Am 31. Juli 2026 hat DeepSeek V4-Flash-0731 als offizielle API-Open-Beta veröffentlicht. Parametergröße (284 Mrd. gesamt, 13 Mrd. aktiviert) und Architektur entsprechen dem April-Preview; die Leistungssteigerung stammt ausschließlich aus einem neu durchlaufenen Post-Training. In Agent-Benchmarks liegt Flash über V4-Pro Preview, bei Preisen um ein Vielfaches unter Claude Opus 4.8. Dieser Leitfaden deckt ab: Timeline April bis 31. Juli, Preis- und Benchmark-Tabellen, CSA+HCA, mHC und Muon, das neue Harness-Agent-Framework, Horizontalvergleich mit Kimi K3, GLM-5.2 und Qwen3.8-Max, Benchmark- und Harness-Kontroversen, das Konzept der Kill Line, eine Sechs-Schritte-Checkliste und FAQ. V4-Pro GA und Harness sind noch „as soon as possible“ angekündigt; dieses Update ist nur per API verfügbar.
Das V4-Update ist kein Einmalereignis, sondern eine über drei Monate laufende Serie. Die Timeline ordnet bestätigte Ereignisse und offiziale Aussagen — als Referenz zwischen Kimi K3, Qwen3.8-Max und V4-Flash-0731.
| Datum | Ereignis |
|---|---|
| 24. April | Erstveröffentlichung DeepSeek-V4 Preview und Open Source (MIT): V4-Pro (1,6T / 49 Mrd. aktiv) und V4-Flash (284B / 13B aktiv), 1 Mio. Token Kontext |
| 20. Juli | V4 Full GA mit Peak-/Off-Peak-Tarifen. Details: V4 GA Preise und Benchmarks |
| 24. Juli | Legacy-Modelle deepseek-chat und deepseek-reasoner endgültig abgeschaltet; Traffic wechselt auf V4-Bezeichner |
| 27. Juli | Moonshot AI veröffentlicht Kimi K3 (2,8T) Gewichte auf Hugging Face — einer der größten Open-Weights-Releases und Wettbewerbsdruck für DeepSeek |
| 31. Juli | V4-Flash-0731 offiziell: API-Open-Beta, gleiche Architektur, Post-Training-Update, synchrone Hugging-Face-Gewichte. Changelog nennt erstmals Harness mit „coming soon“. Nur API; App und Web unverändert |
| 3. August | Alibaba Qwen3.8-Max GA — Spitze im chinesischen Billionen-Parameter-Release-Fenster |
| 5. August (Redaktionsschluss) | V4-Pro offiziell weiter „as soon as possible“. Termine wie „10.–20. August GA“ sind unbestätigte Berichte |
„Offiziell“ ist kein neues Modell: V4-Flash-0731 hat identische Parameter und Struktur wie April; Gewinne kommen nur aus Post-Training
Agent-Benchmarks hängen von Harness ab: Terminal Bench 2.0 und ähnliche Scores wurden im noch nicht veröffentlichten Harness Minimal Mode gemessen
Nur API aktualisiert: Consumer-App und Web-Chat nutzen noch alte Builds
V4-Pro- und Harness-Termine von Rumoren trennen: Changelog sagt nur „as soon as possible“; konkrete August-Daten sind unbestätigt
Verifikationshinweis: Datenstand 5. August 2026. V4-Pro GA, Harness-Release, Peak-Tarif-Inkrafttreten und Dritt-Benchmark-Retests können sich ändern — vor Produktionsmigration DeepSeek-Changelog prüfen.
| Modell | Status | Gesamt / aktiv | Kontext | Eingabe (Cache Miss / Hit pro M Token) | Ausgabe pro M Token | Lizenz |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Offiziell (31.7.) | 284B / 13B | 1 Mio. | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Preview (24.4., kein GA) | 1,6T / 49B | 1 Mio. | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Gewichte offen (27.7.) | 2,8T / ca. 104B (Community) | ca. 1,048 Mio. | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 | Open (Juni 2026) | ca. 744B / ca. 40B | 1 Mio. | nicht bestätigt | nicht bestätigt | MIT |
| Qwen3.8-Max | API GA (3.8.), Gewichte ausstehend | 2,4T / 95 Mrd. | 1 Mio. | $2,00 / $0,17–0,25 | $6,00 | Open versprochen |
Hinweis: Preise aus offiziellen Tarifen der Anbieter (Vendor Self-Report). DeepSeek kündigt Peak-Zeiten (Werktags Beijing 09:00–12:00 und 14:00–18:00) mit doppelter Abrechnung an; Inkrafttreten zum Redaktionsschluss unbekannt.
| Benchmark | V4-Flash-0731 | V4-Pro Preview | Hinweis |
|---|---|---|---|
| Terminal Bench 2.0 | 82,7 | 67,9 | Harness Minimal Mode, max Reasoning |
| SWE-bench Verified | separater Tabellenwert | 80,6 % | Drittanbieter-Methodik, höhere Vertrauenswürdigkeit |
| Toolathlon u. a. | über V4-Pro | — | Harness-basierte Eigenmessung |
| Artificial Analysis Intelligence Index | 50 | — | Drittunabhängige Bewertung |
| AA Kosten pro Task | $0,03 | — | Kimi K3 $0,86; Fable 5 $3,15 |
„Eigenmessung“ bezeichnet DeepSeek-Changelog und Tech Report; Artificial Analysis ist Drittbewertung. Methodik und Gewichtung unterscheiden sich — nicht direkt zusammenrechnen.
„Stärker = größer“ gilt in der Billionen-Modell-Rennen 2026 nicht mehr. Dass 284B Flash V4-Pro Preview in Agent-Benchmarks übertrifft, zeigt: Post-Training-Qualität kann Parameter-Skalierung ersetzen.
Das zentrale, leicht übersehene Detail bei V4-Flash-0731: Parameterzahl und Modellstruktur sind identisch mit dem April-Preview. DeepSeek betont explizit, dass die Steigerung nicht aus Skalierung, sondern aus erneutem Post-Training kommt. Dass 284B/13B Flash 1,6T/49B Pro Preview in mehreren Agent-Benchmarks übertrifft, signalisiert: In der Spitzenliga 2026 konkurriert Post-Training-Qualität mit Parameter-Skalierung.
Im Tech Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ bleiben drei Architekturänderungen der V4-Serie bestehen:
Laut DeepSeek erreicht V4-Pro bei 1 Mio. Token nur 27 % der FLOPs und 10 % des KV Cache von V3.2 (Vendor Self-Report, noch ohne unabhängige Reproduktion). Falls zutreffend, wird 1 Mio. Kontext von Marketingzahl zu tragfähiger Kostenstruktur.
Im Changelog vom 31. Juli wurde erstmals DeepSeek Harness genannt: Agent-Runtime für Datei-IO, Tool-Calls, Befehlausführung und End-to-End-Engineering — DeepSeeks Pendant zu Claude Code. Bis dahin liefen DeepSeek-Modelle über Drittanbieter-Agent-Tools wie Claude Code und OpenCode.
Entscheidend: Agent-Benchmarks für V4-Flash-0731 (Terminal Bench 2.0, Toolathlon) wurden im noch nicht veröffentlichten Harness Minimal Mode gemessen — max Reasoning, top_p=0,95, temperature=1,0. Der Changelog warnt: „Agent-Scores sind stark abhängig von der Harness-Wahl und dürfen nicht mit reiner Modellverbesserung gleichgesetzt werden.“ Das ist ein Signal, Zahlen nicht isoliert zu interpretieren.
Legacy-Modelnamen prüfen: deepseek-chat und deepseek-reasoner sind seit 24. Juli abgeschaltet. Codebase, CI und Env-Variablen auf deepseek-v4-flash oder deepseek-v4-pro durchsuchen
API vs. lokales Deployment trennen: Cloud-API zeigt bereits V4-Flash-0731. Lokale Inferenz: antirez ds4 + 96GB Mac Praxistest
Kosten-Baseline setzen: Monatliche Token-Rechnung mit Cache-Hit $0,0028/M Eingabe und $0,28/M Ausgabe; Gegenrechnung zu Kimi K3 ($15/M Ausgabe)
Echtes Business-A/B fahren: Nicht allein nach Harness-Eigenbenchmarks migrieren; Blindvergleich im eigenen Code mit Claude Code oder Cursor
Harness- und V4-Pro-Release verfolgen: DeepSeek-Changelog, Hugging Face und Artificial-Analysis-Retests im Blick
Produktions-Stabilität und Compliance: Community-Berichte zu Cache-Hit-Rückgang und Safety-Classifier-Timeouts prüfen. In EU-Enterprise-Szenarien vor Integration DSGVO (Datenverarbeitung, Auftragsverarbeitung, Drittlandtransfer bei API-Nutzung) sowie Log-Aufbewahrung und Prompt-Audit bewerten
V4-Flash-0731 trifft auf das dichteste Open-Source-Release-Fenster in China. Trennung von Artificial-Analysis-Drittdata und DeepSeek-Eigenbenchmarks schärft das Bild.
| Modell | Anbieter | Release / Gewichte | Gesamtparameter | AA Intelligence Index | AA Kosten pro Task |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 31.7. offiziell | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot AI | 16.7. Preview / 27.7. Gewichte | 2,8T | 57 | $0,86 |
| GLM-5.2 | Z.ai | Juni 2026 Open | ca. 744B | ca. 1 Punkt über Flash | nicht bestätigt |
| Qwen3.8-Max | Alibaba | 3.8. GA, Gewichte ausstehend | 2,4T | nicht bestätigt | nicht bestätigt |
| GPT-5.6 Sol | OpenAI | Closed | nicht veröffentlicht | 9+ Punkte über Flash | $1,86 |
| Claude Fable 5 | Anthropic | Closed | nicht veröffentlicht | 9+ Punkte über Flash | $3,15 |
Paradoxer Befund: Im Artificial-Analysis-Gesamtindex liegt V4-Flash unter Kimi K3 und GLM-5.2. Pro Task-Kosten sind jedoch ca. 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol und 1/105 von Claude Fable 5. DeepSeek zielt nicht auf „Punkte-Rang 1“, sondern auf „ausreichende Intelligenz bei extremem Preis“. V4-Flash Preview hielt sieben Wochen OpenRouter-Call-Rang 1 — konsistent mit dieser Strategie.
Gegen Claude Opus 4.8 (Vendor-Listenpreise, keine unabhängige Prüfung): Cache-Miss-Eingabe ca. 36×, Cache-Hit-Eingabe ca. 179×, Ausgabe ca. 89× günstiger. Für Agent- und Batch-Szenarien, wo absolute Intelligenz-Obergrenze weniger kritisch ist, positioniert sich V4-Flash-0731 klar.
In chinesischen Entwickler-Communities zirkuliert 斩杀线 (zhǎn shā xiàn) — die „Kill Line“: die Schwelle, die DeepSeeks Kombination „ausreichende Leistung + extrem niedriger Preis“ im Markt setzt. Wer weder deutlich über DeepSeek in Fähigkeit liegt noch preislich darunter kann, riskiert Sichtbarkeitsverlust. Parallel eskaliert die Preiskrieg-Dynamik (z. B. GPT-5.6 Luna mit 80 % Rabatt).
Vor V4-Flash-0731 verzögerte sich die erwartete V4-Pro-Vollversion („Mitte Juli“); Gründer Liang Wenfeng wurde spöttisch „梁白开“ (Versprechen nicht eingehalten) genannt. Nach dem über Erwartungen liegenden Flash-Release kehrte die Stimmung zu „梁圣“ — ein Beispiel für schnelle Stimmungswechsel in der chinesischen AI-Community. Ein Incubator-Manager sagte laut 21st Century Business Herald: „Alle großen Modellfirmen laufen hinter Liang Wenfeng; nur wer irgendwie vor DeepSeek steht, überlebt.“
DeepSeek konkurriert nicht um „das stärkste Modell“, sondern um „ausreichende Intelligenz bei Massenaufrufen + Preis, den niemand mitgeht“. Die Kill Line ist der Name für diese Marktschwelle.
Wer V4-Flash-0731 in Claude Code, OpenClaw oder ähnlichen Langzeit-Agenten einbindet, stößt auf Laptop oder instabilem Linux-VPS oft an RAM-Grenzen, Session-Abbrüche und fehlende Xcode-/Metal-Toolchains. Niedrige API-Kosten allein reichen nicht: für stabile SSH-Langsession, DerivedData-Cache und iOS-CI/CD ist bei knappem lokalem Mac-Compute NodeMini Mac-Mini-Cloud-Miete oft pragmatischer. Lokales Flash-Inferenz: antirez ds4 + 96GB Mac Praxistest; Preise: Mac-Mini-Mietpreise; Onboarding: Hilfezentrum. EU-Teams mit DSGVO-Datenhoheit können sensible Prefills lokal auf gemietetem Mac halten und API nur für unkritische Tasks nutzen.
Quellen: DeepSeek API-Dokumentation und Changelog, Tech Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“, Hugging Face Model Cards, Artificial Analysis (über Wirtschaftsmedien), 21st Century Business Herald, offizielle Releases von Moonshot AI, Z.ai und Alibaba. Vor Deployment aktuelle Offizialmeldungen verifizieren.
Native 1-Mio.-Token-Kontext und deutlich geringerer Rechen- und Speicheraufwand in Langkontext-Szenarien (offiziell: V4-Pro bei 1 Mio. Token 27 % FLOPs und 10 % KV Cache vs. V3.2). Die V4-Serie ist auf Agent-Fähigkeiten ausgerichtet und kompatibel mit Claude Code, OpenCode und anderen Agent-Tools.
Für Dialoge, einfache Tasks und großvolumige, kostengünstige Aufrufe bietet V4-Flash-0731 das beste Preis-Leistungs-Verhältnis; Agent-Benchmarks liegen über V4-Pro Preview. Für tiefes Reasoning mit Budget: V4-Pro Preview, dann GA bewerten. Kostenvergleich mit Mac-Mini-Mietpreisen sinnvoll.
Zum Redaktionsschluss (5. August 2026) nicht. Offiziell veröffentlicht ist nur V4-Flash-0731, ausschließlich per API. V4-Pro GA und Harness sind „as soon as possible“ ohne festes Datum; „10.–20. August“ sind unbestätigte Berichte.
Unterschiedlich bewerten. SWE-bench Verified und transparente Drittanbieter-Benchmarks sind relativ verlässlich. Terminal Bench 2.0 stammt aus unveröffentlichtem Harness Minimal Mode; DeepSeek warnt vor Harness-Abhängigkeit. Unabhängige Reproduktion abwarten oder A/B im eigenen Produktionskontext.
Per OpenAI- oder Anthropic-kompatibler API zeigt deepseek-v4-flash automatisch die neue offizielle Version. Legacy deepseek-chat und deepseek-reasoner seit 24. Juli auf V4-Bezeichner umstellen. Lokale Inferenz: ds4 Mac Praxistest; Remote-Mac: Hilfezentrum.