DeepSeek V4 en version finale : tarification, architecture et comparaison avec GPT-5.6
Tarification peak-valley × SWE-bench 80,6 % × migration API avant le 24 juillet (2026)

Si votre stack appelle encore deepseek-chat ou si vous évaluez le passage à DeepSeek V4 — la version GA du 20 juillet 2026 apporte la tarification peak-valley, un record open source de 80,6 % sur SWE-bench Verified, un contexte de 1 million de tokens, et une extinction des anciennes API le 24 juillet. Cet article couvre l'intégralité du dossier source : chronologie avril–juillet, architecture V4-Pro/Flash (CSA+HCA+mHC+Muon), benchmarks face à GPT-5.6 et Claude Fable 5, grille tarifaire complète (CNY/USD), migration API en six étapes avec exemples de code, ainsi qu'une analyse des points de friction, des stratégies d'économie et une FAQ. Dernière mise à jour : 2026-07-20

01

DeepSeek V4 GA : six enjeux que les équipes d'intégration doivent traiter

Trois mois après l'aperçu, V4 devient une offre commerciale mature. Les gains de performance sont réels, mais la commercialisation et les changements d'interface introduisent une friction opérationnelle que les responsables techniques ne peuvent ignorer.

  1. 01

    Compte à rebours des anciennes API : deepseek-chat et deepseek-reasoner seront retirés le 24 juillet à 15h59 UTC (23h59 à Pékin) — le trafic non migré renverra une erreur 404.

  2. 02

    Complexité peak-valley : première tarification horaire — les créneaux 09h–12h et 14h–18h (Pékin, jours ouvrés) doublent les tarifs, compliquant la prévision des pipelines agents 24/7.

  3. 03

    Les modèles fermés dominent les benchmarks les plus exigeants : Claude Fable 5 atteint 80,3 % sur SWE-bench Pro ; V4-Pro 55,4 % — la réparation multi-fichiers de dépôts complexes reste du ressort des modèles premium.

  4. 04

    Seuil matériel pour l'auto-hébergement : V4-Pro (1,6T/49B actifs) ne tourne pas sur un portable ; V4-Flash en local exige 96 Go+ de mémoire unifiée (voir test antirez ds4 + Mac 96 Go).

  5. 05

    Trois modes d'inférence : Non-think / Think High / Think Max — Think Max consomme 384K+ de contexte et fait grimper coût et latence.

  6. 06

    D'une plateforme quasi gratuite à une offre commerciale structurée : malgré la baisse de 75 % en juin, le peak-valley fait du scheduling un avantage compétitif, au-delà du simple comparatif de prix.

Chronologie complète : de l'aperçu à la GA

DateÉvénement
2026-04-24Aperçu V4 + open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B)
2026-05Versions optimisées production V4-Flash/V4-Pro ; API disponible
2026-06Baisse permanente V4-Pro de 75 % (sortie $0,87/M tokens)
2026-06-29E-mail à tous les utilisateurs API : GA mi-juillet + première annonce peak-valley
2026-07-19Accès gray-test pour certains développeurs ; presse : « version finale imminente »
2026-07-20Release GA (date de publication)
2026-07-24deepseek-chat / deepseek-reasoner retirés définitivement

« L'aperçu était déjà solide ; la GA apporte des gains ciblés sur les agents, le raisonnement mathématique et la génération de code, avec une tarification commerciale formalisée. »

02

V4-Pro et V4-Flash : comment CSA + HCA portent 1 million de tokens

DeepSeek V4 abandonne le MLA de V2/V3 au profit d'une attention hybride CSA + HCA, de résidus mHC et de l'optimiseur Muon — rendant le contexte 1M réellement exploitable en production.

SpécificationV4-ProV4-Flash
Paramètres totaux1,6 billion (1,6T)284 milliards (284B)
Actifs par token49 milliards (49B)13 milliards (13B)
Couches Transformer6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Sortie max.384K tokens384K tokens
PrécisionFP4 (experts) + FP8 (reste)FP4 + FP8 mixte
Données de pré-entraînement33T+ tokens32T+ tokens
LicenceMITMIT

① Compressed Sparse Attention (CSA)

  • Séquence KV compressée par pooling à porte Softmax
  • Indexeur FP4 « lightning » pour top-k : V4-Pro top-1024, V4-Flash top-512
  • Fenêtre glissante des 128 derniers tokens
  • À 1M tokens, seulement 27 % des FLOPs d'inférence de V3.2

② Heavily Compressed Attention (HCA)

  • Compression 128× puis attention globale dense pour les dépendances longues
  • V4-Flash : 2 premières couches en HCA, puis alternance CSA/HCA
  • Mémoire KV cache à 10 % de V3.2 (V4-Flash : 7 %)

③ mHC et Muon

  • mHC (Manifold-Constrained Hyper-Connections) : flux résiduel à 4 canaux avec matrice doublement stochastique (polytope de Birkhoff) pour stabiliser 61 couches
  • Optimiseur Muon : orthogonalisation Newton-Schulz à la place d'AdamW — convergence plus rapide

Trois modes d'inférence et paramètres d'échantillonnage

ModeCaractéristiqueUsage
Non-thinkPas de chaîne de pensée, réponse rapideQ&R simples, routage
Think HighRaisonnement explicite (<redacted_thinking>)Complexité moyenne, debug code
Think MaxRaisonnement maximal, contexte 384K+ requisMathématiques complexes, agents longue chaîne

Paramètres recommandés (tous modes) : temperature=1.0, top_p=1.0

03

Benchmarks : 80,6 % SWE-bench et un écart de coût de 116×

V4-Pro établit des records open source — les modèles fermés conservent l'avantage sur les benchmarks les plus sévères. La variable décisive reste le coût par tâche.

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % ★ record open source96,0 %Non publié séparément~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified évalue les corrections de bugs sur de vrais dépôts GitHub — V4-Pro à 80,6 % partage la première place open source avec Gemini 3.1 Pro. SWE-bench Pro est plus strict ; Claude Fable 5 mène avec 80,3 %.

Rapport coût-performance (Artificial Analysis)

  • Claude Fable 5 : tâches Strategy & Ops — 3,48 $ par tâche, score 50
  • DeepSeek V4-Pro : mêmes tâches — 0,03 $ par tâche, score 38
  • DeepSeek V4-Flash : six types d'index, tous sous 0,04 $ par tâche
  • Facteur de coût : Fable 5 coûte 116× plus cher pour ~12 points (~31 %) de score en plus
info

Sources : documentation DeepSeek, arXiv:2606.19348, HuggingFace, Artificial Analysis, LLMReference.

04

Face à GPT-5.6 Sol et Claude Fable 5 : matrice de choix

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open source✅ MIT❌ Fermé❌ Fermé
Auto-hébergement✅ Oui
Contexte1M tokensNon communiqué1M tokens
Capacité codeTrès forte (proche Fable 5)Très forteLa plus forte
Sortie API (off-peak)0,87 $/M tokens~15 $/M50 $/M
Sortie API (peak)1,74 $/M tokens
Capacité agentForte, multi-agentsForteLa plus forte
Confidentialité des données✅ Déploiement privé possible
  • Budget serré / appels fréquents / déploiement privé : V4-Pro ou V4-Flash
  • Excellence code absolue, coût secondaire : Claude Fable 5 (leader SWE-bench Pro)
  • Algorithmes complexes + mathématiques : GPT-5.6 Sol / Ultra
  • Logs/documents massifs à faible coût : V4-Flash cache hit 0,0028 $/M

Grille tarifaire peak-valley complète (CNY + USD)

Changement majeur de la GA : heures de pointe (Pékin, jours ouvrés 09h00–12h00 et 14h00–18h00) — tarifs doublés.

ModèlePosteOff-peakPeak
V4-ProEntrée (cache hit)¥0,025 / $0,0035 / 1M tokens
Entrée (cache miss)¥3,00 / $0,435 / 1M tokens¥6,00 / $0,87
Sortie¥6,00 / $0,87 / 1M tokens¥12,00 / $1,74
V4-FlashEntrée (cache hit)¥0,02 / $0,0028 / 1M tokens
Entrée (cache miss)¥1,00 / $0,14 / 1M tokens¥2,00 / $0,28
Sortie¥2,00 / $0,28 / 1M tokens¥4,00 / $0,56

Quatre stratégies pour réduire la facture

  1. 01

    Planifier hors pointe : traitement documentaire, annotation, revue de code après 18h00 ou avant 09h00 (Pékin).

  2. 02

    Exploiter le cache : prompts système répétés — V4-Flash cache hit 0,0028 $/M.

  3. 03

    Flash en routage : intents simples sur V4-Flash, raisonnement complexe sur V4-Pro — économie de 60 à 80 %.

  4. 04

    Surveiller les e-mails de facturation : DeepSeek annonce les changements 24 heures à l'avance.

Même en pointe, la sortie V4-Pro (1,74 $/M) reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).

05

Migration API en six étapes : checklist avant le 24 juillet

warning

Avertissement : deepseek-chat et deepseek-reasoner seront définitivement désactivés le 24 juillet 2026 à 15h59 UTC (23h59 à Pékin).

Ancien modèleNouveau modèleRemarque
deepseek-chatdeepseek-v4-flash (non-thinking)Rapide, tâches légères
deepseek-reasonerdeepseek-v4-flash (thinking) ou deepseek-v4-proPro pour un raisonnement plus fort
  1. 01

    Recherche globale : deepseek-chat et deepseek-reasoner dans le code, variables d'environnement et CI.

  2. 02

    Cartographie : chat léger → deepseek-v4-flash ; ancien reasoner → Flash thinking ou deepseek-v4-pro.

  3. 03

    SDK OpenAI : modifier uniquement model ; mode thinking via extra_body (voir code).

  4. 04

    SDK Anthropic : base_url reste https://api.deepseek.com, mettre à jour model.

  5. 05

    Régression staging : valider agents/RAG avant le 24 juillet, vérifier la facture peak-valley.

  6. 06

    Bascule progressive : migration par tranches de trafic, rollback possible jusqu'à la deadline.

  7. 07

    Think Max : fenêtre de contexte 384K+.

python
# ❌ Ancien (invalide après le 24 juillet)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# ✅ Nouveau
client.chat.completions.create(
    model="deepseek-v4-pro",          # ou deepseek-v4-flash
    messages=[...],
    # Mode thinking :
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
python
# SDK Anthropic
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

Données techniques citables (EEAT)

  • KV Cache : à 1M, V4-Pro 10 %, V4-Flash 7 % de V3.2
  • FLOPs d'inférence : CSA ramène le scénario 1M à 27 % de V3.2
  • Baisse de juin : sortie V4-Pro à 0,87 $/M (–75 %), puis peak-valley
  • Concurrence : V4-Pro par défaut 500 requêtes parallèles

DeepSeek V4 GA réduit fortement les coûts API — l'inférence locale V4-Flash exige toujours un Mac 96 Go UMA ; un VPS Linux bon marché ne peut exécuter ni xcodebuild ni notarytool. Les équipes qui combinent appels API DeepSeek cloud et CI/CD iOS / sessions CLI agent longues gagnent en stabilité en externalisant les charges macOS sur un nœud distant dédié. Pour les environnements de production nécessitant sessions SSH stables et bande passante prévisible, la location cloud Mac Mini NodeMini constitue généralement la couche d'exécution la plus fiable — indépendamment des variations peak-valley. Tarifs : tarifs de location ; mise en service : centre d'aide ; Flash local : test antirez ds4 + Mac 96 Go.

Dernière mise à jour : 2026-07-20. Finaliser la migration API avant le 24 juillet.

FAQ

Questions fréquentes

Architecture inchangée ; la GA améliore agents, mathématiques et code, et introduit peak-valley. Anciens modèles retirés le 24 juillet. Budget : tarifs de location.

Pékin, jours ouvrés 09h00–12h00 et 14h00–18h00 (tarifs ×2). Batch après 18h, cache prompt, routage V4-Flash.

deepseek-chatdeepseek-v4-flash (non-thinking) ; deepseek-reasoner → Flash thinking ou deepseek-v4-pro. Deadline 24 juillet 23h59 Pékin.

SWE-bench Verified : V4-Pro 80,6 % (record open source), Fable 5 96 %. Coût/auto-hébergement : V4-Pro 0,87 $/M ≈ 1/17 de GPT-5.6 Sol. Environnement distant : centre d'aide.

Oui. ds4 sur Mac 96 Go UMA (284B/13B actifs) ; V4-Pro (1,6T) nécessite vLLM/SGLang cloud. Détails : test antirez ds4 Mac.

Q&R simples : Non-think ; debug code : Think High ; mathématiques complexes et agents longs : Think Max (384K+). Sampling : temperature=1.0, top_p=1.0.