Wer noch deepseek-chat produktiv nutzt oder DeepSeek V4 GA datenbasiert gegen GPT-5.6 bewertet: Am 20. Juli 2026 geht die Vollversion live — mit Peak-Valley-Preisen, SWE-bench Verified 80,6 % (Open-Source-Rekord), 1M Token Kontext und Legacy-API-Abschaltung am 24. Juli. Dieser Leitfaden deckt die Quelldaten vollständig ab: Zeitleiste 24.04.–20.07., V4-Pro/Flash-Architektur (CSA+HCA+mHC+Muon), Benchmarks vs. GPT-5.6 / Claude Fable 5, vollständige Preistabelle (CNY/USD), Sechs-Schritte-API-Migration mit Code — plus Pain-Point-Analyse, Kostenstrategien und FAQ. Stand: 2026-07-20
Nach drei Monaten Vorschau ist V4 produktionsreif. Die Leistungsdaten sind überzeugend — gleichzeitig erhöhen Kommerzialisierung und API-Änderungen die operative Komplexität. Diese sechs Punkte dominieren aktuelle Team-Feedbacks:
Legacy-Countdown: deepseek-chat und deepseek-reasoner werden am 24. Juli, 15:59 UTC (23:59 Peking) permanent abgeschaltet — nicht migrierte Produktionstraffic liefert 404.
Peak-Valley-Komplexität: Erstmals zeitabhängige Tarife — Werktags 09–12 und 14–18 Uhr (Peking) verdoppeln die Raten; 24/7-Agent-Pipelines erschweren Budgetprognosen.
Closed-Source führt bei harten Benchmarks: Claude Fable 5 erreicht 80,3 % auf SWE-bench Pro; V4-Pro nur 55,4 % — Multi-File-Repo-Fixes brauchen weiterhin Premium-Modelle.
Self-Hosting-Hardware: V4-Pro (1,6T/49B aktiv) läuft nicht auf Laptops; V4-Flash lokal braucht 96GB+ UMA (siehe antirez ds4 + Mac 96GB Test).
Drei Inferenzmodi: Non-think / Think High / Think Max — Think Max verbraucht 384K+ Kontext und treibt Kosten und Latenz.
Von „fast gratis“ zu regulierter Plattform: Trotz 75 %-Preissenkung im Juni macht Peak-Valley Scheduling zur Kernkompetenz — nicht nur Preisvergleich.
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Vorschau + Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| 2026-05 | Produktionsoptimierte V4-Flash/V4-Pro; API allgemein verfügbar |
| 2026-06 | V4-Pro dauerhaft 75 % günstiger (Ausgabe $0,87/M Token) |
| 2026-06-29 | E-Mail an alle API-Nutzer: GA Mitte Juli + erste Offenlegung Peak-Valley-Preise |
| 2026-07-19 | Gray-Test für ausgewählte Entwickler; Medien: „Vollversion morgen“ |
| 2026-07-20 | GA-Release (Veröffentlichungsdatum) |
| 2026-07-24 | deepseek-chat / deepseek-reasoner permanent offline |
„Die Vorschau war bereits stark — GA liefert gezielte Verbesserungen bei Agent, Mathe-Reasoning und Code-Generierung plus formale Peak-Valley-Abrechnung.“
DeepSeek V4 ersetzt MLA aus V2/V3 durch CSA + HCA Hybrid-Attention, mHC-Residuals und den Muon-Optimizer — 1M Kontext wird damit betrieblich skalierbar.
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktiv pro Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Max. Ausgabe | 384K Token | 384K Token |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining-Daten | 33T+ Token | 32T+ Token |
| Lizenz | MIT | MIT |
| Modus | Eigenschaft | Einsatz |
|---|---|---|
| Non-think | Keine Thought Chain, schnellste Antwort | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (<redacted_thinking>) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximales Reasoning, 384K+ Kontext nötig | Komplexe Mathe, lange Agent-Ketten |
Offizielle Sampling-Parameter (alle Modi): temperature=1.0, top_p=1.0
V4-Pro setzt Open-Source-Rekorde — Closed-Source führt bei den härtesten Tests. Entscheidend: Kosten pro Aufgabe.
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ Open-Source-Rekord | 96,0 % | Nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified testet echte GitHub-Bugfixes — V4-Pro 80,6 % teilt sich Open-Source-Spitze mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Claude Fable 5 führt mit 80,3 %.
Quellen: DeepSeek-Dokumentation, arXiv:2606.19348, HuggingFace, Artificial Analysis, LLMReference.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source | ✅ MIT | ❌ Closed | ❌ Closed |
| Self-Hosting | ✅ Ja | ❌ | ❌ |
| Kontextfenster | 1M Token | Nicht veröffentlicht | 1M Token |
| Code-Fähigkeit | Sehr stark (nahe Fable 5) | Sehr stark | Stärkste |
| API-Ausgabe (Off-Peak) | $0,87/M Token | ~$15/M | $50/M |
| API-Ausgabe (Peak) | $1,74/M Token | — | — |
| Agent-Fähigkeit | Stark, Multi-Agent | Stark | Stärkste |
| Datenschutz / DSGVO | ✅ Private Deployment möglich | ❌ | ❌ |
GA-Kernänderung: Peak (Pekinger Werktagszeit 09:00–12:00 und 14:00–18:00) — Tarife verdoppeln.
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Eingabe (Cache-Hit) | ¥0,025 / $0,0035 / 1M Token | 2× |
| Eingabe (Cache-Miss) | ¥3,00 / $0,435 / 1M Token | ¥6,00 / $0,87 | |
| Ausgabe | ¥6,00 / $0,87 / 1M Token | ¥12,00 / $1,74 | |
| V4-Flash | Eingabe (Cache-Hit) | ¥0,02 / $0,0028 / 1M Token | 2× |
| Eingabe (Cache-Miss) | ¥1,00 / $0,14 / 1M Token | ¥2,00 / $0,28 | |
| Ausgabe | ¥2,00 / $0,28 / 1M Token | ¥4,00 / $0,56 |
Batch-Jobs Off-Peak: Dokumentenverarbeitung, Labeling, Code-Review nach 18:00 oder vor 09:00 (Peking).
Prompt Cache nutzen: Wiederholte System-Prompts — V4-Flash Cache-Hit $0,0028/M.
Flash als Router: Einfache Intents auf V4-Flash, komplexes Reasoning auf V4-Pro — 60–80 % Ersparnis.
Abrechnungs-E-Mails: DeepSeek kündigt Preisänderungen 24 Stunden vorher an.
Selbst im Peak: V4-Pro Ausgabe ($1,74/M) ist 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).
Wichtig: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking) permanent.
| Altes Modell | Neues Modell | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-Think) | Schnell, leichte Tasks |
deepseek-reasoner | deepseek-v4-flash (Think) oder deepseek-v4-pro | Pro für stärkeres Reasoning |
Repo-weite Suche: deepseek-chat und deepseek-reasoner inkl. Env-Vars und CI.
Mapping festlegen: Leichter Chat → deepseek-v4-flash; Reasoner → Flash Think oder deepseek-v4-pro.
OpenAI SDK: Nur model ändern; Think per extra_body (siehe Code).
Anthropic SDK: base_url bleibt https://api.deepseek.com, model aktualisieren.
Staging-Regression: Vor dem 24. Juli Agent/RAG testen, Peak-Valley-Rechnung prüfen.
Produktions-Rollout: Schrittweise umschalten, Rollback bis Deadline.
Think Max: Kontextfenster 384K+ setzen.
# ❌ Alt (ab 24. Juli ungültig)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# ✅ Neu
client.chat.completions.create(
model="deepseek-v4-pro", # oder deepseek-v4-flash
messages=[...],
# Think-Modus:
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# Anthropic SDK
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
DeepSeek V4 GA senkt API-Kosten drastisch — lokales V4-Flash braucht weiterhin einen 96GB UMA Mac; günstige Linux-VPS können weder xcodebuild noch notarytool ausführen. Teams mit Cloud-DeepSeek-API und iOS CI/CD / CLI-Agent-Langsessions profitieren von dedizierten Remote-Mac-Knoten — unabhängig von Peak-Valley-Schwankungen. Für EU-Teams mit DSGVO-Anforderungen an Datenhoheit und stabile SSH-Sessions ist NodeMini Mac-Mini-Cloud-Miete oft die robustere Ausführungsschicht. Spezifikationen: Mietpreise; Einrichtung: Hilfezentrum; lokales Flash: antirez ds4 + 96GB Mac Test.
Stand: 2026-07-20. API-Migration bis 24. Juli abschließen.
Architektur gleich; GA verbessert Agent, Mathe und Code und führt Peak-Valley ein. Legacy-Modelle enden am 24. Juli. Budgetplanung: Mietpreise.
Peking Werktags 09:00–12:00 und 14:00–18:00 (2×). Batch nach 18:00, Prompt Cache, V4-Flash-Routing.
deepseek-chat → deepseek-v4-flash (Non-Think); deepseek-reasoner → Flash Think oder deepseek-v4-pro. Deadline 24. Juli 23:59 Peking.
SWE-bench Verified: V4-Pro 80,6 % (Open-Source-Rekord), Fable 5 96 %. Kosten/Self-Hosting: V4-Pro $0,87/M ≈ 1/17 von GPT-5.6 Sol. Mehr Infos: Hilfezentrum.
Ja. ds4 auf 96GB UMA Mac (284B/13B aktiv); V4-Pro (1,6T) braucht Cloud vLLM/SGLang. Details: antirez ds4 Mac Test.
Einfache Q&A: Non-think; Code-Debug: Think High; komplexe Mathe/lange Agenten: Think Max (384K+). Sampling: temperature=1.0, top_p=1.0.