DeepSeek V4-Flash-0731 offiziell
Harness, Post-Training, Benchmarks und die Kill Line

Am 31. Juli 2026 hat DeepSeek V4-Flash-0731 als offizielle API-Open-Beta veröffentlicht. Parametergröße (284 Mrd. gesamt, 13 Mrd. aktiviert) und Architektur entsprechen dem April-Preview; die Leistungssteigerung stammt ausschließlich aus einem neu durchlaufenen Post-Training. In Agent-Benchmarks liegt Flash über V4-Pro Preview, bei Preisen um ein Vielfaches unter Claude Opus 4.8. Dieser Leitfaden deckt ab: Timeline April bis 31. Juli, Preis- und Benchmark-Tabellen, CSA+HCA, mHC und Muon, das neue Harness-Agent-Framework, Horizontalvergleich mit Kimi K3, GLM-5.2 und Qwen3.8-Max, Benchmark- und Harness-Kontroversen, das Konzept der Kill Line, eine Sechs-Schritte-Checkliste und FAQ. V4-Pro GA und Harness sind noch „as soon as possible“ angekündigt; dieses Update ist nur per API verfügbar.

01

Zeitplan: Vom April-Preview zur offiziellen Version am 31. Juli

Das V4-Update ist kein Einmalereignis, sondern eine über drei Monate laufende Serie. Die Timeline ordnet bestätigte Ereignisse und offiziale Aussagen — als Referenz zwischen Kimi K3, Qwen3.8-Max und V4-Flash-0731.

DatumEreignis
24. AprilErstveröffentlichung DeepSeek-V4 Preview und Open Source (MIT): V4-Pro (1,6T / 49 Mrd. aktiv) und V4-Flash (284B / 13B aktiv), 1 Mio. Token Kontext
20. JuliV4 Full GA mit Peak-/Off-Peak-Tarifen. Details: V4 GA Preise und Benchmarks
24. JuliLegacy-Modelle deepseek-chat und deepseek-reasoner endgültig abgeschaltet; Traffic wechselt auf V4-Bezeichner
27. JuliMoonshot AI veröffentlicht Kimi K3 (2,8T) Gewichte auf Hugging Face — einer der größten Open-Weights-Releases und Wettbewerbsdruck für DeepSeek
31. JuliV4-Flash-0731 offiziell: API-Open-Beta, gleiche Architektur, Post-Training-Update, synchrone Hugging-Face-Gewichte. Changelog nennt erstmals Harness mit „coming soon“. Nur API; App und Web unverändert
3. AugustAlibaba Qwen3.8-Max GA — Spitze im chinesischen Billionen-Parameter-Release-Fenster
5. August (Redaktionsschluss)V4-Pro offiziell weiter „as soon as possible“. Termine wie „10.–20. August GA“ sind unbestätigte Berichte

Vier Informationsfallen für Entwickler

  1. 01

    „Offiziell“ ist kein neues Modell: V4-Flash-0731 hat identische Parameter und Struktur wie April; Gewinne kommen nur aus Post-Training

  2. 02

    Agent-Benchmarks hängen von Harness ab: Terminal Bench 2.0 und ähnliche Scores wurden im noch nicht veröffentlichten Harness Minimal Mode gemessen

  3. 03

    Nur API aktualisiert: Consumer-App und Web-Chat nutzen noch alte Builds

  4. 04

    V4-Pro- und Harness-Termine von Rumoren trennen: Changelog sagt nur „as soon as possible“; konkrete August-Daten sind unbestätigt

warning

Verifikationshinweis: Datenstand 5. August 2026. V4-Pro GA, Harness-Release, Peak-Tarif-Inkrafttreten und Dritt-Benchmark-Retests können sich ändern — vor Produktionsmigration DeepSeek-Changelog prüfen.

02

Kernzahlen: Preistabelle, Benchmarks und Spezifikationen

ModellStatusGesamt / aktivKontextEingabe (Cache Miss / Hit pro M Token)Ausgabe pro M TokenLizenz
DeepSeek-V4-Flash-0731Offiziell (31.7.)284B / 13B1 Mio.$0,14 / $0,0028$0,28MIT
DeepSeek-V4-ProPreview (24.4., kein GA)1,6T / 49B1 Mio.$0,435 / $0,003625$0,87MIT
Kimi K3Gewichte offen (27.7.)2,8T / ca. 104B (Community)ca. 1,048 Mio.$3,00 / $0,30$15,00Modified MIT
GLM-5.2Open (Juni 2026)ca. 744B / ca. 40B1 Mio.nicht bestätigtnicht bestätigtMIT
Qwen3.8-MaxAPI GA (3.8.), Gewichte ausstehend2,4T / 95 Mrd.1 Mio.$2,00 / $0,17–0,25$6,00Open versprochen

Hinweis: Preise aus offiziellen Tarifen der Anbieter (Vendor Self-Report). DeepSeek kündigt Peak-Zeiten (Werktags Beijing 09:00–12:00 und 14:00–18:00) mit doppelter Abrechnung an; Inkrafttreten zum Redaktionsschluss unbekannt.

DeepSeek offizielle Agent- und Code-Benchmarks (Eigenmessung)

BenchmarkV4-Flash-0731V4-Pro PreviewHinweis
Terminal Bench 2.082,767,9Harness Minimal Mode, max Reasoning
SWE-bench Verifiedseparater Tabellenwert80,6 %Drittanbieter-Methodik, höhere Vertrauenswürdigkeit
Toolathlon u. a.über V4-ProHarness-basierte Eigenmessung
Artificial Analysis Intelligence Index50Drittunabhängige Bewertung
AA Kosten pro Task$0,03Kimi K3 $0,86; Fable 5 $3,15

„Eigenmessung“ bezeichnet DeepSeek-Changelog und Tech Report; Artificial Analysis ist Drittbewertung. Methodik und Gewichtung unterscheiden sich — nicht direkt zusammenrechnen.

„Stärker = größer“ gilt in der Billionen-Modell-Rennen 2026 nicht mehr. Dass 284B Flash V4-Pro Preview in Agent-Benchmarks übertrifft, zeigt: Post-Training-Qualität kann Parameter-Skalierung ersetzen.

03

Tiefenanalyse: Post-Training, Architektur und Harness

Gleiche Architektur, neues Post-Training

Das zentrale, leicht übersehene Detail bei V4-Flash-0731: Parameterzahl und Modellstruktur sind identisch mit dem April-Preview. DeepSeek betont explizit, dass die Steigerung nicht aus Skalierung, sondern aus erneutem Post-Training kommt. Dass 284B/13B Flash 1,6T/49B Pro Preview in mehreren Agent-Benchmarks übertrifft, signalisiert: In der Spitzenliga 2026 konkurriert Post-Training-Qualität mit Parameter-Skalierung.

CSA+HCA Hybrid-Attention, mHC, Muon-Optimierer

Im Tech Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“ bleiben drei Architekturänderungen der V4-Serie bestehen:

  • Hybrid-Attention (CSA+HCA): Compressed Sparse Attention und High-Compression Attention kombiniert; extern oft als „DSA Sparse Attention“ bezeichnet. Ziel: weniger Rechen- und VRAM-Aufwand bei Langkontext
  • mHC (Manifold-Constrained Hyper-Connections): verbessert Residual-Pfade in 61 Schichten für stabilere Signalpropagation
  • Muon-Optimierer: ersetzt AdamW für schnellere Konvergenz und stabilere Training

Laut DeepSeek erreicht V4-Pro bei 1 Mio. Token nur 27 % der FLOPs und 10 % des KV Cache von V3.2 (Vendor Self-Report, noch ohne unabhängige Reproduktion). Falls zutreffend, wird 1 Mio. Kontext von Marketingzahl zu tragfähiger Kostenstruktur.

Harness: DeepSeeks erstes eigenes Agent-Framework

Im Changelog vom 31. Juli wurde erstmals DeepSeek Harness genannt: Agent-Runtime für Datei-IO, Tool-Calls, Befehlausführung und End-to-End-Engineering — DeepSeeks Pendant zu Claude Code. Bis dahin liefen DeepSeek-Modelle über Drittanbieter-Agent-Tools wie Claude Code und OpenCode.

Entscheidend: Agent-Benchmarks für V4-Flash-0731 (Terminal Bench 2.0, Toolathlon) wurden im noch nicht veröffentlichten Harness Minimal Mode gemessen — max Reasoning, top_p=0,95, temperature=1,0. Der Changelog warnt: „Agent-Scores sind stark abhängig von der Harness-Wahl und dürfen nicht mit reiner Modellverbesserung gleichgesetzt werden.“ Das ist ein Signal, Zahlen nicht isoliert zu interpretieren.

Sechs-Schritte-Evaluierungs-Checkliste (operativ)

  1. 01

    Legacy-Modelnamen prüfen: deepseek-chat und deepseek-reasoner sind seit 24. Juli abgeschaltet. Codebase, CI und Env-Variablen auf deepseek-v4-flash oder deepseek-v4-pro durchsuchen

  2. 02

    API vs. lokales Deployment trennen: Cloud-API zeigt bereits V4-Flash-0731. Lokale Inferenz: antirez ds4 + 96GB Mac Praxistest

  3. 03

    Kosten-Baseline setzen: Monatliche Token-Rechnung mit Cache-Hit $0,0028/M Eingabe und $0,28/M Ausgabe; Gegenrechnung zu Kimi K3 ($15/M Ausgabe)

  4. 04

    Echtes Business-A/B fahren: Nicht allein nach Harness-Eigenbenchmarks migrieren; Blindvergleich im eigenen Code mit Claude Code oder Cursor

  5. 05

    Harness- und V4-Pro-Release verfolgen: DeepSeek-Changelog, Hugging Face und Artificial-Analysis-Retests im Blick

  6. 06

    Produktions-Stabilität und Compliance: Community-Berichte zu Cache-Hit-Rückgang und Safety-Classifier-Timeouts prüfen. In EU-Enterprise-Szenarien vor Integration DSGVO (Datenverarbeitung, Auftragsverarbeitung, Drittlandtransfer bei API-Nutzung) sowie Log-Aufbewahrung und Prompt-Audit bewerten

04

Horizontalvergleich: Kimi K3, GLM-5.2, Qwen3.8-Max und Closed-Source-Spitzen

V4-Flash-0731 trifft auf das dichteste Open-Source-Release-Fenster in China. Trennung von Artificial-Analysis-Drittdata und DeepSeek-Eigenbenchmarks schärft das Bild.

ModellAnbieterRelease / GewichteGesamtparameterAA Intelligence IndexAA Kosten pro Task
V4-Flash-0731DeepSeek31.7. offiziell284B50$0,03
Kimi K3Moonshot AI16.7. Preview / 27.7. Gewichte2,8T57$0,86
GLM-5.2Z.aiJuni 2026 Openca. 744Bca. 1 Punkt über Flashnicht bestätigt
Qwen3.8-MaxAlibaba3.8. GA, Gewichte ausstehend2,4Tnicht bestätigtnicht bestätigt
GPT-5.6 SolOpenAIClosednicht veröffentlicht9+ Punkte über Flash$1,86
Claude Fable 5AnthropicClosednicht veröffentlicht9+ Punkte über Flash$3,15

Paradoxer Befund: Im Artificial-Analysis-Gesamtindex liegt V4-Flash unter Kimi K3 und GLM-5.2. Pro Task-Kosten sind jedoch ca. 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol und 1/105 von Claude Fable 5. DeepSeek zielt nicht auf „Punkte-Rang 1“, sondern auf „ausreichende Intelligenz bei extremem Preis“. V4-Flash Preview hielt sieben Wochen OpenRouter-Call-Rang 1 — konsistent mit dieser Strategie.

Gegen Claude Opus 4.8 (Vendor-Listenpreise, keine unabhängige Prüfung): Cache-Miss-Eingabe ca. 36×, Cache-Hit-Eingabe ca. 179×, Ausgabe ca. 89× günstiger. Für Agent- und Batch-Szenarien, wo absolute Intelligenz-Obergrenze weniger kritisch ist, positioniert sich V4-Flash-0731 klar.

05

Kontroversen, Kill Line und Branchenkontext

Vier Deutungsfallen

  • Harness-abhängige Eigenmessung: Terminal Bench 2.0 82,7 (vs. V4-Pro Preview 67,9) stammt aus unveröffentlichtem Harness Minimal Mode. Bis Reproduktion in Claude Code oder Cursor: als „spezifisches Framework + Vendor Self-Report“ behandeln
  • Produktions-Berichte: Internationale Entwickler-Communities melden sinkende Input-Cache-Hit-Raten und intermittierende Safety-Classifier-Timeouts. Lücke zwischen „Score-Sprung“-Narrativ und Produktionsstabilität möglich
  • V4-Pro- und Harness-Termin-Rumoren: „Interner Test Ende Juli“, „GA 10.–20. August“ sind unbestätigt. Changelog: nur „as soon as possible“
  • Investment- und IPO-Berichte: ca. 7,4 Mrd. $ Finanzierung, 48,7 Mrd. $ Bewertung, IPO-Vorbereitung — „laut Berichten“, nicht durch DeepSeek- oder Regulierungsfilings bestätigt

Was ist die „Kill Line“?

In chinesischen Entwickler-Communities zirkuliert 斩杀线 (zhǎn shā xiàn) — die „Kill Line“: die Schwelle, die DeepSeeks Kombination „ausreichende Leistung + extrem niedriger Preis“ im Markt setzt. Wer weder deutlich über DeepSeek in Fähigkeit liegt noch preislich darunter kann, riskiert Sichtbarkeitsverlust. Parallel eskaliert die Preiskrieg-Dynamik (z. B. GPT-5.6 Luna mit 80 % Rabatt).

Vor V4-Flash-0731 verzögerte sich die erwartete V4-Pro-Vollversion („Mitte Juli“); Gründer Liang Wenfeng wurde spöttisch „梁白开“ (Versprechen nicht eingehalten) genannt. Nach dem über Erwartungen liegenden Flash-Release kehrte die Stimmung zu „梁圣“ — ein Beispiel für schnelle Stimmungswechsel in der chinesischen AI-Community. Ein Incubator-Manager sagte laut 21st Century Business Herald: „Alle großen Modellfirmen laufen hinter Liang Wenfeng; nur wer irgendwie vor DeepSeek steht, überlebt.“

Weiterer Branchenkontext

  • Post-Training vs. Parameter-Rennen: V4-Flash-0731 steigert Agent-Fähigkeit ohne Skalierung; Qwen3.8-Max MoE „große Kapazität, geringe Aktivierung“ folgt derselben Erzählung
  • Kollektives Open Sourcing: Kimi K3, GLM-5.2, DeepSeek V4, Qwen3.8-Max (Gewichte versprochen) konzentrieren Releases in Juli–August
  • Marktreife: Am 31. Juli kein spürbarer Chip-Sektor-Einbruch (Nvidia, Broadcom, AMD) — im Gegensatz zu DeepSeek-R1 Anfang 2025. „Weniger Rechen, gleicher Effekt“ wird nicht automatisch als Schock interpretiert

DeepSeek konkurriert nicht um „das stärkste Modell“, sondern um „ausreichende Intelligenz bei Massenaufrufen + Preis, den niemand mitgeht“. Die Kill Line ist der Name für diese Marktschwelle.

Wer V4-Flash-0731 in Claude Code, OpenClaw oder ähnlichen Langzeit-Agenten einbindet, stößt auf Laptop oder instabilem Linux-VPS oft an RAM-Grenzen, Session-Abbrüche und fehlende Xcode-/Metal-Toolchains. Niedrige API-Kosten allein reichen nicht: für stabile SSH-Langsession, DerivedData-Cache und iOS-CI/CD ist bei knappem lokalem Mac-Compute NodeMini Mac-Mini-Cloud-Miete oft pragmatischer. Lokales Flash-Inferenz: antirez ds4 + 96GB Mac Praxistest; Preise: Mac-Mini-Mietpreise; Onboarding: Hilfezentrum. EU-Teams mit DSGVO-Datenhoheit können sensible Prefills lokal auf gemietetem Mac halten und API nur für unkritische Tasks nutzen.

Quellen: DeepSeek API-Dokumentation und Changelog, Tech Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence“, Hugging Face Model Cards, Artificial Analysis (über Wirtschaftsmedien), 21st Century Business Herald, offizielle Releases von Moonshot AI, Z.ai und Alibaba. Vor Deployment aktuelle Offizialmeldungen verifizieren.

FAQ

Häufig gestellte Fragen

Native 1-Mio.-Token-Kontext und deutlich geringerer Rechen- und Speicheraufwand in Langkontext-Szenarien (offiziell: V4-Pro bei 1 Mio. Token 27 % FLOPs und 10 % KV Cache vs. V3.2). Die V4-Serie ist auf Agent-Fähigkeiten ausgerichtet und kompatibel mit Claude Code, OpenCode und anderen Agent-Tools.

Für Dialoge, einfache Tasks und großvolumige, kostengünstige Aufrufe bietet V4-Flash-0731 das beste Preis-Leistungs-Verhältnis; Agent-Benchmarks liegen über V4-Pro Preview. Für tiefes Reasoning mit Budget: V4-Pro Preview, dann GA bewerten. Kostenvergleich mit Mac-Mini-Mietpreisen sinnvoll.

Zum Redaktionsschluss (5. August 2026) nicht. Offiziell veröffentlicht ist nur V4-Flash-0731, ausschließlich per API. V4-Pro GA und Harness sind „as soon as possible“ ohne festes Datum; „10.–20. August“ sind unbestätigte Berichte.

Unterschiedlich bewerten. SWE-bench Verified und transparente Drittanbieter-Benchmarks sind relativ verlässlich. Terminal Bench 2.0 stammt aus unveröffentlichtem Harness Minimal Mode; DeepSeek warnt vor Harness-Abhängigkeit. Unabhängige Reproduktion abwarten oder A/B im eigenen Produktionskontext.

Per OpenAI- oder Anthropic-kompatibler API zeigt deepseek-v4-flash automatisch die neue offizielle Version. Legacy deepseek-chat und deepseek-reasoner seit 24. Juli auf V4-Bezeichner umstellen. Lokale Inferenz: ds4 Mac Praxistest; Remote-Mac: Hilfezentrum.