GLM 5.3 vs. DeepSeek V4 Pro: Ergebnis, Zeit und Kosten
Aufgabenerfolg, Laufzeit und Kosten pro akzeptiertem Ergebnis vergleichen und die geplante Abschaltung von DeepSeek V4 Pro berücksichtigen.
Inhalt

Testen Sie zuerst GLM 5.3, wenn ein zusätzliches akzeptiertes Ergebnis bei einer schwierigen Aufgabe höhere Ausgaben rechtfertigen könnte. DeepSeek V4 Pro-0813 lohnt sich als Vergleich, wenn die Kosten wiederholter Versuche entscheidend sind. In einer veröffentlichten Untersuchung erledigte GLM mehr Aufgaben und hatte bei erfolgreichen Durchläufen eine kürzere Medianzeit; Pro war günstiger. Daraus folgt kein allgemeiner Sieger.
Die Verfügbarkeit setzt allerdings eine nahe Grenze: DeepSeek plant, V4 Pro am 14. September 2026 um 12:00 Uhr Pekinger Zeit, also 04:00 UTC beziehungsweise 07:00 Uhr Moskauer Zeit, einzustellen. Eine nach Anmeldung sichtbare Mitteilung auf der offiziellen Plattform kündigt an, Pro-Anfragen an V4.1 Flash weiterzuleiten und zu dessen Tarifen abzurechnen. Bauen Sie keine neue langfristige Integration mit der offiziellen API auf der Annahme auf, der alte Name werde weiterhin Pro-0813 liefern.
Dieser Vergleich betrifft GLM 5.3 und Pro-0813, nicht GLM 5.3 Flash oder V4.1 Flash. Historische Pro-Ergebnisse können als Ausgangspunkt für einen Ersatztest dienen. Sie beschreiben nicht das Modell, das nach der Abschaltung hinter diesem Namen antwortet.
Was der Test mit 30 Aufgaben zeigt
Am 27. August veröffentlichte Composio einen Vergleich von fünf Modellen mit 30 mehrstufigen Agentenaufgaben. Für diese beiden Modelle ergeben sich folgende Werte:
| Composio-Messgröße | GLM 5.3 | DeepSeek V4 Pro-0813 |
|---|---|---|
| Erledigte Aufgaben | 22 von 30 | 19 von 30 |
| Gesamtkosten aller 30 Aufgaben | $5.31 | $1.23 |
| Veröffentlichte Kosten pro erfolgreicher Aufgabe | $0.24 | $0.065 |
| Medianzeit der erledigten Aufgaben | 2 Min. 54 Sek. | 4 Min. 41 Sek. |
| Zeitüberschreitungen | 1 | 3 |
Originalergebnisse: Abschluss, Gesamtkosten, Kosten pro Erfolg, Zeit und Zeitüberschreitungen.
GLM erledigte in dieser Stichprobe drei Aufgaben mehr. Bei Pro lagen die Kosten pro Erfolg etwa um den Faktor 3,7 niedriger: $0.24 / $0.065. Das sind historische Testkosten ohne menschliche Nacharbeit, keine aktuellen API-Preise.
Die Zeitmediane berücksichtigen nur erfolgreiche Aufgaben; zudem unterscheiden sich die erfolgreich erledigten Aufgaben beider Modelle. Sie zeigen weder, dass GLM bei jeder identischen Aufgabe schneller ist, noch dass eine ganze Arbeitssitzung entsprechend früher endet. Fehlversuche und Zeitüberschreitungen kosten ebenfalls Zeit.
Es handelt sich um Composios Untersuchung, nicht um einen eigenen Test von uns. Ohne vollständige Einstellungen, Ausführungsumgebung und Wiederholungen lassen sich aus 22 gegenüber 19 keine verlässlichen Erfolgsquoten für Ihr Projekt ableiten. Mehrstufige Arbeit mit externen Werkzeugen ist außerdem etwas anderes als eine Fehlerkorrektur im Repository.
Programmierbenchmarks zeigen ein gemischteres Bild
Die offizielle Modellkarte von GLM 5.3 enthält Ergebnisse für Pro-0813:
| Test in der Z.ai-Tabelle | GLM 5.3 | Pro-0813 |
|---|---|---|
| Terminal Bench 2.1 | 88.2 | 87.9 |
| DeepSWE v1.1 | 66.9 | 62.7 |
| NL2Repo | 58.0 | 61.1 |
| Toolathlon Verified | 73.0 | 74.1 |
GLM liegt in den ersten zwei Zeilen vorn, Pro in den nächsten zwei. Das sind von Z.ai veröffentlichte Ergebnisse unter den Bedingungen der Modellkarte. Sie ersetzen keinen unabhängigen Vergleich im eigenen Client. Unterschiedliche Aufgaben und Bewertungsverfahren lassen sich nicht zu einer einzigen Qualitätsprozentzahl addieren.
Auch die Vorgaben unterscheiden sich: GLM 5.3 verwendet standardmäßig reasoning_effort = max. Der aktuelle DeepSeek-V4-Leitfaden aktiviert das Denken mit Aufwand high. Zwei unveränderte Standardkonfigurationen nutzen somit unterschiedliche Modi. Selbst gleich benannte Aufwandstufen würden keine identischen Rechenbudgets beweisen.
Um einen Benchmark nachzubilden, verwenden Sie dessen veröffentlichte Bedingungen. Zur Modellauswahl für Ihre Arbeit legen Sie dagegen akzeptable Kosten und Zeit fest und testen für jedes Modell geeignete Einstellungen innerhalb dieser Grenzen.
Alle Versuche bis zur Abnahme zählen
Definieren Sie zunächst Erfolg. Bei einer Fehlerkorrektur muss etwa der zuvor fehlschlagende Test ohne Regressionen bestehen. Ein Agent, der mehrere Systeme verändert, muss möglicherweise alle Systeme im richtigen Endzustand hinterlassen, ohne zusätzliche Datensätze oder doppelte Aktionen.
cost_per_accepted_task = total_api_cost_of_all_attempts / accepted_tasks
In den Zähler gehören Fehlversuche, Wiederholungen und Aufrufe von Ersatzmodellen. Ohne akzeptierte Aufgabe ist die Kennzahl nicht definiert: Dokumentieren Sie null Erfolge und die gesamten Ausgaben, nicht null Kosten pro Erfolg.
Erfassen Sie menschliche Prüf- und Korrekturzeit separat. Bei einer Umrechnung in Geld verwenden Sie Ihren eigenen Stundensatz und weisen den Betrag getrennt von den API-Ausgaben aus. Lange Nacharbeit kann eine niedrigere Modellrechnung aufwiegen; messen Sie das an Ihren Aufgaben.
Im BetterToken Dashboard können Sie Modell, Anfragezeit, Eingabe-, Ausgabe- und Cache-Token sowie die zugehörigen Kosten prüfen. Aufgabenabnahme und menschlicher Aufwand benötigen separate Aufzeichnungen. Ein protokollierter Modellname ist kein unabhängiger Nachweis dafür, welche Modellgewichte ein externer Anbieter verwendet hat.
Anhand der eigenen Aufgaben entscheiden
Wählen Sie eine kleine Auswahl wiederkehrender Aufgaben. Beide Modelle erhalten denselben Projekt-Ausgangszustand, dieselben Anweisungen, Werkzeugrechte und Abnahmekriterien. Nutzen Sie für externe Aktionen Testdaten, damit Wiederholungen keine echten Duplikate erzeugen.
Notieren Sie Modell- und Clientversionen, Anbieter, Denkmodus, Zeitlimit und Wiederholungslimit. Bewahren Sie Kosten und Ergebnis jedes Durchlaufs auf, einschließlich der Fehlschläge. Vergleichen Sie, welche konkreten Aufgaben jedes Modell löst, nicht nur die Gesamtrechnung.
- Komplexe Änderungen mit teurer menschlicher Nacharbeit: Testen Sie GLM 5.3 zuerst und prüfen Sie, ob die Vorteile mancher Untersuchungen bei Ihnen zu mehr akzeptierten Änderungen führen.
- Klar abgegrenzte Aufgaben bei engem Budget: Die historischen Pro-0813-Ergebnisse zeigen den Nutzen der Kosten pro Erfolg. Vor der Abschaltung ist ein Vergleich mit Ihrem aktuellen Modell möglich; für den Weiterbetrieb benötigen Sie eine nachweislich verfügbare Alternative.
- Lange Abläufe mit mehreren Werkzeugen: Begrenzen Sie die gesamte Aufgabenzeit einschließlich Wiederholungen. Mediane erfolgreicher Durchläufe blenden verlorene Zeit unvollendeter Aufgaben aus.
Nach dem 14. September darf eine neue offizielle Anfrage an deepseek-v4-pro nicht automatisch als Pro-0813-Test gelten. Prüfen Sie zuerst die Weiterleitung. Antwortet V4.1 Flash, ist das ein neuer Vergleich mit GLM 5.3, der neue Ergebnisse erfordert. Verfügbarkeit und Termine bei Drittanbietern sind gesondert zu prüfen.