DeepSeek V4 Flash fürs Coding: Preis, Benchmarks und Tool-Integration
Modell-IDs, Preise, Benchmark-Modi, Einrichtung, Kompatibilitätsprobleme und faire Tests für DeepSeek V4 Flash.
DeepSeek V4 Flash ist ein Kandidat für häufige Coding-Aufrufe, Subagents und Aufgaben mit klarer Abnahme. Ein niedriger Tokenpreis beseitigt jedoch weder Kosten für langes Reasoning noch Clientfehler und Wiederholungen. Bei Architekturarbeit sollte Flash auf demselben Repository mit Pro verglichen werden, nicht als „billige Kopie“ des Flaggschiffs gelten.
Flash mit kleinem Budget testen? Im BetterToken-Katalog kostete deepseek-v4-flash-0731 am 13. August 2026 etwa 0.191 pro Million Output-Token. Erstellen Sie Ihren eigenen API-Key, führen Sie einen sicheren Test aus und prüfen Sie Modell-ID und Verbrauch im Workspace. Kontrollieren Sie den Katalog vor dem nächsten Lauf erneut: Modell-IDs und Preise hängen vom Anbieter ab und können sich ändern.
Welches DeepSeek V4 Flash ist gemeint?
Die offizielle Ankündigung vom 24. April stellte V4 Preview vor. Am 13. August nannte die DeepSeek-Modellseite die stabilen API-Modell-IDs deepseek-v4-flash und deepseek-v4-pro; ihre MODEL VERSION waren DeepSeek-V4-Flash-0731 und DeepSeek-V4-Pro-0813.
Version und Modell-ID dienen unterschiedlichen Zwecken: Die Version beschreibt den ausgelieferten Build, die stabile Modell-ID bleibt der String der offiziellen API. Andere Anbieter können Namen anders führen. BetterToken listete am 13. August deepseek-v4-flash-0731 und deepseek-v4-pro, nicht deepseek-v4-pro-0813. Öffnen Sie den Katalog des gewählten Endpoints und kopieren Sie dessen Namen; ergänzen Sie 0813 nicht automatisch.
0731 und 0813 bezeichnen das Alter des ausgelieferten Builds, keinen universellen Alias. Laut Dokumentation und Modellkarte hat Flash 284 Milliarden Gesamt- und 13 Milliarden aktive Parameter, ein Kontextfenster von einer Million Token und maximal 384K Output. Thinking und Non-Thinking sind verfügbar, dazu High und Max für Reasoning.
Eine Million Token ist eine technische Obergrenze, kein Qualitätsversprechen für jede Codemenge. Testen Sie, ob Informationen in der Kontextmitte gefunden werden und Projektregeln nach langer Tool-Historie erhalten bleiben.
Was ein Agent-Lauf kostet
Die offiziellen DeepSeek-API-Preise sind: Cache-Input 0.14 und Output 0.14 + 0.02 × 0.0336`. Bei vollständigem Input-Cache wären es $0.00616, doch ein realer Agent verändert Verlauf, Tool-Ergebnisse und Dateien; Teile des Präfixes passen dann nicht mehr.
Nach den BetterToken-Katalograten kostet dasselbe Volumen ohne getrennte Cache-Abrechnung 0.2 × $0.095 + 0.02 × $0.191 = $0.02282. Die Summe darf Reasoning-Verbrauch nicht verdecken: Ein großes max_tokens kann viel Budget verbrauchen, bevor eine hilfreiche Antwort entsteht. Vergleichen Sie deshalb Token pro abgeschlossener Aufgabe, nicht nur Preis pro Million.
Non-Think, High und Max
Die offizielle Modellkarte nennt folgende Werte:
- LiveCodeBench: 55.2 in Non-Think, 88.4 in High, 91.6 in Max.
- Terminal Bench 2.0: 49.1, 56.6, 56.9.
- SWE Verified: 73.7, 78.6, 79.0.
- SWE Pro: 49.1, 52.3, 52.6.
- MRCR 1M: 37.5, 76.9, 78.7.
Das sind Anbieter-/Modellkartenwerte, kein unabhängiger Produktionsbenchmark. Non-Thinking senkt bei einigen Coding- und Long-Context-Tests stark, High → Max bringt deutlich weniger als Non-Think → High.
- Non-Think: Formatierung, Extraktion oder eine offensichtliche lokale Änderung nach Prüfung an Ihren Beispielen.
- High: Hauptkandidat für Bugfixes, Reviews und mehrere zusammenhängende Dateien.
- Max: schwieriges Debugging, lange Agent-Pläne oder Aufgaben, bei denen Fehler teurer als zusätzliche Token sind.
Max sollte nicht nur wegen der größten Tabellenzahl zum Standard werden.
Wann Flash sinnvoll ist
Flash passt zu vielen automatisch prüfbaren Schritten: ein Subagent findet Dateien und sammelt Fakten, CI erklärt einen konkreten Testfehler, ein Stapel-Review prüft eine Regel, ein Agent erzeugt Tests für ein definiertes Interface oder eine Migration wird in kurze gleichartige Chargen zerlegt.
Weniger geeignet ist Flash für neue Architektur ohne klare Grenzen, widersprüchliche Anforderungen oder Arbeit, in der das Modell stundenlang selbst Produktentscheidungen treffen muss. Wiederholungen können den Preisvorteil aufzehren; Pro oder ein anderes Modell kann pro akzeptiertem Ergebnis günstiger sein.
Verbindung mit Claude Code
DeepSeek bietet einen Anthropic-kompatiblen Endpoint. Im offiziellen Beispiel ist Pro der Hauptagent, Flash übernimmt Haiku und Subagent-Aufgaben:
Das teurere Modell entscheidet über Architektur, Flash erledigt engere Teilaufgaben. Wer Flash als Hauptagent testen will, sollte ein separates Profil anlegen und das Ergebnis vergleichen, statt es als offiziell empfohlene Konfiguration auszugeben. Prüfen Sie nach dem Start Base URL, tatsächlich verwendetes Subagent-Modell und einen Tool-Aufruf; Probleme zeigen sich oft erst beim ersten Tool-Aufruf.
Verbindung mit OpenCode
Die offizielle Anleitung verlangt OpenCode 1.14.24 oder neuer:
Führen Sie /connect aus, wählen Sie DeepSeek und geben Sie den Key im Dialog ein. Öffnen Sie danach die Modellliste. Die Anleitung zeigt Pro; wählen Sie Flash nur, wenn deepseek-v4-flash beim offiziellen Provider vorhanden ist. Bei BetterToken war zum Prüfzeitpunkt deepseek-v4-flash-0731 gelistet. Tauschen Sie die Namen nicht ohne Prüfung des Endpunkt-Katalogs aus.
Der Test braucht mehrere Schritte: eine Datei lesen lassen, ein Tool aufrufen und nach dessen Ergebnis weiterdenken. Der zweite Turn deckt reasoning_content-Probleme auf.
Warum der Fehler reasoning_content entsteht
Im Thinking-Modus verlangt DeepSeek, dass reasoning_content in der Historie späterer Anfragen zurückgegeben wird. OpenCode-Issue #24130 beschreibt einen Client, der das Feld verlor und nach einem Tool-Aufruf scheiterte; ein zugehöriger Fix wurde in PR #24146 besprochen. Die aktuelle offizielle Anleitung fordert zudem OpenCode 1.14.24 oder neuer. Leiten Sie keine behobene Version allein aus Issue oder PR ab.
Wenn der Fehler bleibt:
- OpenCode aktualisieren;
- den aktuellen DeepSeek-Provider bestätigen;
- Reasoning-Felder bei eigener Nachrichtennormalisierung nicht entfernen;
- einen Zwei-Turn-Test mit einem Tool wiederholen;
- erst dann Modell-ID und Netzwerk prüfen.
JSON aus einem beliebigen Kommentar kann kurzfristig helfen, der offizielle Provider ist aber sicherer, weil er zusammen mit dem Clientvertrag aktualisiert wird.
Woher das 32K-Limit kommt
OpenCode-Issue #29363 meldete ein Clientlimit von 32K, obwohl das Modell 384K dokumentiert. Modelllimit und das von der Anwendung gesendete Limit sind unterschiedliche Ebenen. Fordern Sie 384K nicht automatisch an: eine große Obergrenze erhöht mögliche Kosten und Zeit. Endet eine Antwort mit length, prüfen Sie effektives max_tokens, Provider-Adapter und Reasoning-Modus, bevor Sie schließen, Flash könne keine langen Antworten erzeugen.
Aussagekraft einzelner Nutzerberichte
In einer praktischen Coding-Diskussion berichteten Nutzer von gelungenen Repository-Audits und kurzen Migrationen, aber auch über übersehene Anforderungen, korrigierte Pläne und wiederholte Fehler bei einer kleinen Testaufgabe. Diese Berichte haben weder Prompt, Commit noch Harness oder unabhängige Prüfung gemeinsam. Sie liefern Szenarien für einen eigenen Abnahmetest, keinen Durchschnittswert.
Ein Issue #1483 meldet Sprachwechsel ins Chinesische bei einigen V4-Flash-Anfragen. Das ist ein einzelner Bericht, keine bekannte Fehlerrate. Prüfen Sie Antwort- und Kommentarsprache, Projektregel-Einhaltung und Erholung nach einem fehlgeschlagenen Tool-Aufruf explizit.
So testen Sie ohne Selbsttäuschung
Vergleichen Sie Non-Think, High und Max bei zehn identischen Aufgaben. Frieren Sie den Commit ein und ändern Sie den Prompt zwischen den Modi nicht. Messen Sie Test-Erfolgsquote, Zeit bis zum fertigen Diff, Input-/Output-/Reasoning-Token, Wiederholungen, Regel- und Sprachverstöße sowie Kosten pro akzeptierter Aufgabe.
Erledigt High neun von zehn Aufgaben und Max dieselben neun mit doppelt so hohem Verbrauch, lohnt Max nicht. Löst allein Max einen schwierigen Bug, sind die Mehrkosten für diese Aufgabenklasse gerechtfertigt.
Quellen
- Offizielle V4-Preview-Ankündigung
- Aktuelle DeepSeek-API-Preise und Limits
- DeepSeek in Coding-Agenten
- DeepSeek V4 Flash: offizielle Modellkarte
- OpenCode-Issue #24130: reasoning_content
- OpenCode-PR #24146: zugehöriger Fix
- OpenCode-Issue #29363: Output-Limit
- Issue #1483: einzelner Bericht zum Sprachwechsel
- Gemischte Nutzerberichte zum Coding