DeepSeek V4 GA: Preise, Architektur & Benchmark-Vergleich mit GPT-5.6
Peak-Valley-Preise × SWE-bench 80,6 % × API-Migration bis 24. Juli (2026)

Wer noch deepseek-chat produktiv nutzt oder DeepSeek V4 GA datenbasiert gegen GPT-5.6 bewertet: Am 20. Juli 2026 geht die Vollversion live — mit Peak-Valley-Preisen, SWE-bench Verified 80,6 % (Open-Source-Rekord), 1M Token Kontext und Legacy-API-Abschaltung am 24. Juli. Dieser Leitfaden deckt die Quelldaten vollständig ab: Zeitleiste 24.04.–20.07., V4-Pro/Flash-Architektur (CSA+HCA+mHC+Muon), Benchmarks vs. GPT-5.6 / Claude Fable 5, vollständige Preistabelle (CNY/USD), Sechs-Schritte-API-Migration mit Code — plus Pain-Point-Analyse, Kostenstrategien und FAQ. Stand: 2026-07-20

01

DeepSeek V4 GA: Sechs messbare Pain Points für Integrations-Teams

Nach drei Monaten Vorschau ist V4 produktionsreif. Die Leistungsdaten sind überzeugend — gleichzeitig erhöhen Kommerzialisierung und API-Änderungen die operative Komplexität. Diese sechs Punkte dominieren aktuelle Team-Feedbacks:

  1. 01

    Legacy-Countdown: deepseek-chat und deepseek-reasoner werden am 24. Juli, 15:59 UTC (23:59 Peking) permanent abgeschaltet — nicht migrierte Produktionstraffic liefert 404.

  2. 02

    Peak-Valley-Komplexität: Erstmals zeitabhängige Tarife — Werktags 09–12 und 14–18 Uhr (Peking) verdoppeln die Raten; 24/7-Agent-Pipelines erschweren Budgetprognosen.

  3. 03

    Closed-Source führt bei harten Benchmarks: Claude Fable 5 erreicht 80,3 % auf SWE-bench Pro; V4-Pro nur 55,4 % — Multi-File-Repo-Fixes brauchen weiterhin Premium-Modelle.

  4. 04

    Self-Hosting-Hardware: V4-Pro (1,6T/49B aktiv) läuft nicht auf Laptops; V4-Flash lokal braucht 96GB+ UMA (siehe antirez ds4 + Mac 96GB Test).

  5. 05

    Drei Inferenzmodi: Non-think / Think High / Think Max — Think Max verbraucht 384K+ Kontext und treibt Kosten und Latenz.

  6. 06

    Von „fast gratis“ zu regulierter Plattform: Trotz 75 %-Preissenkung im Juni macht Peak-Valley Scheduling zur Kernkompetenz — nicht nur Preisvergleich.

Zeitleiste: Vorschau bis GA

DatumEreignis
2026-04-24V4-Vorschau + Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B)
2026-05Produktionsoptimierte V4-Flash/V4-Pro; API allgemein verfügbar
2026-06V4-Pro dauerhaft 75 % günstiger (Ausgabe $0,87/M Token)
2026-06-29E-Mail an alle API-Nutzer: GA Mitte Juli + erste Offenlegung Peak-Valley-Preise
2026-07-19Gray-Test für ausgewählte Entwickler; Medien: „Vollversion morgen“
2026-07-20GA-Release (Veröffentlichungsdatum)
2026-07-24deepseek-chat / deepseek-reasoner permanent offline

„Die Vorschau war bereits stark — GA liefert gezielte Verbesserungen bei Agent, Mathe-Reasoning und Code-Generierung plus formale Peak-Valley-Abrechnung.“

02

V4-Pro vs. V4-Flash: CSA + HCA für 1 Million Token

DeepSeek V4 ersetzt MLA aus V2/V3 durch CSA + HCA Hybrid-Attention, mHC-Residuals und den Muon-Optimizer — 1M Kontext wird damit betrieblich skalierbar.

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktiv pro Token49 Milliarden (49B)13 Milliarden (13B)
Transformer-Schichten6143
Kontextfenster1.000.000 Token1.000.000 Token
Max. Ausgabe384K Token384K Token
PräzisionFP4 (Experten) + FP8 (Rest)FP4 + FP8 gemischt
Pretraining-Daten33T+ Token32T+ Token
LizenzMITMIT

① Compressed Sparse Attention (CSA)

  • KV-Sequenz per Softmax-Gating komprimiert
  • FP4-„Lightning Indexer“ für Top-k: V4-Pro top-1024, V4-Flash top-512
  • Sliding Window der letzten 128 Token
  • Bei 1M Kontext nur 27 % der Inferenz-FLOPs von V3.2

② Heavily Compressed Attention (HCA)

  • Token 128× komprimiert, dann globale dichte Attention
  • V4-Flash: erste 2 Schichten HCA, danach CSA/HCA alternierend
  • KV-Cache-Speicher nur 10 % von V3.2 (V4-Flash: 7 %)

③ mHC und Muon

  • mHC (Manifold-Constrained Hyper-Connections): 4-Kanal-Residual-Stream mit doppelt-stochastischer Mischmatrix (Birkhoff-Polytop) für stabile 61-Layer-Signale
  • Muon-Optimizer: Newton-Schulz-Orthogonalisierung statt AdamW — schnellere Konvergenz

Drei Inferenzmodi und Sampling

ModusEigenschaftEinsatz
Non-thinkKeine Thought Chain, schnellste AntwortEinfache Q&A, Routing
Think HighExplizites Reasoning (<redacted_thinking>)Mittlere Komplexität, Code-Debug
Think MaxMaximales Reasoning, 384K+ Kontext nötigKomplexe Mathe, lange Agent-Ketten

Offizielle Sampling-Parameter (alle Modi): temperature=1.0, top_p=1.0

03

Benchmarks: SWE-bench 80,6 % und 116× Kostenfaktor

V4-Pro setzt Open-Source-Rekorde — Closed-Source führt bei den härtesten Tests. Entscheidend: Kosten pro Aufgabe.

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % ★ Open-Source-Rekord96,0 %Nicht separat veröffentlicht~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified testet echte GitHub-Bugfixes — V4-Pro 80,6 % teilt sich Open-Source-Spitze mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Claude Fable 5 führt mit 80,3 %.

Kosten-Nutzen (Artificial Analysis)

  • Claude Fable 5: Strategy & Ops Index — $3,48 pro Aufgabe, 50 Punkte
  • DeepSeek V4-Pro: gleiche Kategorie — $0,03 pro Aufgabe, 38 Punkte
  • DeepSeek V4-Flash: alle sechs Index-Typen unter $0,04 pro Aufgabe
  • Kostenfaktor: Fable 5 ist 116× teurer als V4-Pro bei nur ~12 Punkten (~31 %) mehr
info

Quellen: DeepSeek-Dokumentation, arXiv:2606.19348, HuggingFace, Artificial Analysis, LLMReference.

04

Vergleich GPT-5.6 Sol vs. Claude Fable 5: Entscheidungsmatrix

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open Source✅ MIT❌ Closed❌ Closed
Self-Hosting✅ Ja
Kontextfenster1M TokenNicht veröffentlicht1M Token
Code-FähigkeitSehr stark (nahe Fable 5)Sehr starkStärkste
API-Ausgabe (Off-Peak)$0,87/M Token~$15/M$50/M
API-Ausgabe (Peak)$1,74/M Token
Agent-FähigkeitStark, Multi-AgentStarkStärkste
Datenschutz / DSGVO✅ Private Deployment möglich
  • Budget / hohe Frequenz / DSGVO-konformes Self-Hosting: V4-Pro oder V4-Flash — Daten bleiben in kontrollierter Infrastruktur
  • Maximale Code-Qualität, Kosten egal: Claude Fable 5 (SWE-bench Pro Spitze)
  • Komplexe Algorithmen + Mathe: GPT-5.6 Sol / Ultra
  • Große Logs/Dokumente (günstig): V4-Flash Cache-Hit nur $0,0028/M

Peak-Valley-Preistabelle (CNY + USD)

GA-Kernänderung: Peak (Pekinger Werktagszeit 09:00–12:00 und 14:00–18:00) — Tarife verdoppeln.

ModellPositionOff-PeakPeak
V4-ProEingabe (Cache-Hit)¥0,025 / $0,0035 / 1M Token
Eingabe (Cache-Miss)¥3,00 / $0,435 / 1M Token¥6,00 / $0,87
Ausgabe¥6,00 / $0,87 / 1M Token¥12,00 / $1,74
V4-FlashEingabe (Cache-Hit)¥0,02 / $0,0028 / 1M Token
Eingabe (Cache-Miss)¥1,00 / $0,14 / 1M Token¥2,00 / $0,28
Ausgabe¥2,00 / $0,28 / 1M Token¥4,00 / $0,56

Vier datengetriebene Sparstrategien

  1. 01

    Batch-Jobs Off-Peak: Dokumentenverarbeitung, Labeling, Code-Review nach 18:00 oder vor 09:00 (Peking).

  2. 02

    Prompt Cache nutzen: Wiederholte System-Prompts — V4-Flash Cache-Hit $0,0028/M.

  3. 03

    Flash als Router: Einfache Intents auf V4-Flash, komplexes Reasoning auf V4-Pro — 60–80 % Ersparnis.

  4. 04

    Abrechnungs-E-Mails: DeepSeek kündigt Preisänderungen 24 Stunden vorher an.

Selbst im Peak: V4-Pro Ausgabe ($1,74/M) ist 8,6× günstiger als Claude Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).

05

API-Migration in sechs Schritten: Deadline 24. Juli

warning

Wichtig: deepseek-chat und deepseek-reasoner enden am 24. Juli 2026, 15:59 UTC (23:59 Peking) permanent.

Altes ModellNeues ModellHinweis
deepseek-chatdeepseek-v4-flash (Non-Think)Schnell, leichte Tasks
deepseek-reasonerdeepseek-v4-flash (Think) oder deepseek-v4-proPro für stärkeres Reasoning
  1. 01

    Repo-weite Suche: deepseek-chat und deepseek-reasoner inkl. Env-Vars und CI.

  2. 02

    Mapping festlegen: Leichter Chat → deepseek-v4-flash; Reasoner → Flash Think oder deepseek-v4-pro.

  3. 03

    OpenAI SDK: Nur model ändern; Think per extra_body (siehe Code).

  4. 04

    Anthropic SDK: base_url bleibt https://api.deepseek.com, model aktualisieren.

  5. 05

    Staging-Regression: Vor dem 24. Juli Agent/RAG testen, Peak-Valley-Rechnung prüfen.

  6. 06

    Produktions-Rollout: Schrittweise umschalten, Rollback bis Deadline.

  7. 07

    Think Max: Kontextfenster 384K+ setzen.

python
# ❌ Alt (ab 24. Juli ungültig)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# ✅ Neu
client.chat.completions.create(
    model="deepseek-v4-pro",          # oder deepseek-v4-flash
    messages=[...],
    # Think-Modus:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
python
# Anthropic SDK
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

Harte Kennzahlen (EEAT)

  • KV-Cache: Bei 1M Kontext V4-Pro 10 %, V4-Flash 7 % von V3.2
  • Inferenz-FLOPs: CSA senkt 1M-Szenario auf 27 % von V3.2
  • Juni-Preissenkung: V4-Pro Ausgabe auf $0,87/M (75 % off), danach Peak-Valley
  • Concurrency: V4-Pro Standard 500 parallele Requests

DeepSeek V4 GA senkt API-Kosten drastisch — lokales V4-Flash braucht weiterhin einen 96GB UMA Mac; günstige Linux-VPS können weder xcodebuild noch notarytool ausführen. Teams mit Cloud-DeepSeek-API und iOS CI/CD / CLI-Agent-Langsessions profitieren von dedizierten Remote-Mac-Knoten — unabhängig von Peak-Valley-Schwankungen. Für EU-Teams mit DSGVO-Anforderungen an Datenhoheit und stabile SSH-Sessions ist NodeMini Mac-Mini-Cloud-Miete oft die robustere Ausführungsschicht. Spezifikationen: Mietpreise; Einrichtung: Hilfezentrum; lokales Flash: antirez ds4 + 96GB Mac Test.

Stand: 2026-07-20. API-Migration bis 24. Juli abschließen.

FAQ

Häufige Fragen

Architektur gleich; GA verbessert Agent, Mathe und Code und führt Peak-Valley ein. Legacy-Modelle enden am 24. Juli. Budgetplanung: Mietpreise.

Peking Werktags 09:00–12:00 und 14:00–18:00 (2×). Batch nach 18:00, Prompt Cache, V4-Flash-Routing.

deepseek-chatdeepseek-v4-flash (Non-Think); deepseek-reasoner → Flash Think oder deepseek-v4-pro. Deadline 24. Juli 23:59 Peking.

SWE-bench Verified: V4-Pro 80,6 % (Open-Source-Rekord), Fable 5 96 %. Kosten/Self-Hosting: V4-Pro $0,87/M ≈ 1/17 von GPT-5.6 Sol. Mehr Infos: Hilfezentrum.

Ja. ds4 auf 96GB UMA Mac (284B/13B aktiv); V4-Pro (1,6T) braucht Cloud vLLM/SGLang. Details: antirez ds4 Mac Test.

Einfache Q&A: Non-think; Code-Debug: Think High; komplexe Mathe/lange Agenten: Think Max (384K+). Sampling: temperature=1.0, top_p=1.0.