Si votre stack appelle encore deepseek-chat ou si vous évaluez le passage à DeepSeek V4 — la version GA du 20 juillet 2026 apporte la tarification peak-valley, un record open source de 80,6 % sur SWE-bench Verified, un contexte de 1 million de tokens, et une extinction des anciennes API le 24 juillet. Cet article couvre l'intégralité du dossier source : chronologie avril–juillet, architecture V4-Pro/Flash (CSA+HCA+mHC+Muon), benchmarks face à GPT-5.6 et Claude Fable 5, grille tarifaire complète (CNY/USD), migration API en six étapes avec exemples de code, ainsi qu'une analyse des points de friction, des stratégies d'économie et une FAQ. Dernière mise à jour : 2026-07-20
Trois mois après l'aperçu, V4 devient une offre commerciale mature. Les gains de performance sont réels, mais la commercialisation et les changements d'interface introduisent une friction opérationnelle que les responsables techniques ne peuvent ignorer.
Compte à rebours des anciennes API : deepseek-chat et deepseek-reasoner seront retirés le 24 juillet à 15h59 UTC (23h59 à Pékin) — le trafic non migré renverra une erreur 404.
Complexité peak-valley : première tarification horaire — les créneaux 09h–12h et 14h–18h (Pékin, jours ouvrés) doublent les tarifs, compliquant la prévision des pipelines agents 24/7.
Les modèles fermés dominent les benchmarks les plus exigeants : Claude Fable 5 atteint 80,3 % sur SWE-bench Pro ; V4-Pro 55,4 % — la réparation multi-fichiers de dépôts complexes reste du ressort des modèles premium.
Seuil matériel pour l'auto-hébergement : V4-Pro (1,6T/49B actifs) ne tourne pas sur un portable ; V4-Flash en local exige 96 Go+ de mémoire unifiée (voir test antirez ds4 + Mac 96 Go).
Trois modes d'inférence : Non-think / Think High / Think Max — Think Max consomme 384K+ de contexte et fait grimper coût et latence.
D'une plateforme quasi gratuite à une offre commerciale structurée : malgré la baisse de 75 % en juin, le peak-valley fait du scheduling un avantage compétitif, au-delà du simple comparatif de prix.
| Date | Événement |
|---|---|
| 2026-04-24 | Aperçu V4 + open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B) |
| 2026-05 | Versions optimisées production V4-Flash/V4-Pro ; API disponible |
| 2026-06 | Baisse permanente V4-Pro de 75 % (sortie $0,87/M tokens) |
| 2026-06-29 | E-mail à tous les utilisateurs API : GA mi-juillet + première annonce peak-valley |
| 2026-07-19 | Accès gray-test pour certains développeurs ; presse : « version finale imminente » |
| 2026-07-20 | Release GA (date de publication) |
| 2026-07-24 | deepseek-chat / deepseek-reasoner retirés définitivement |
« L'aperçu était déjà solide ; la GA apporte des gains ciblés sur les agents, le raisonnement mathématique et la génération de code, avec une tarification commerciale formalisée. »
DeepSeek V4 abandonne le MLA de V2/V3 au profit d'une attention hybride CSA + HCA, de résidus mHC et de l'optimiseur Muon — rendant le contexte 1M réellement exploitable en production.
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Actifs par token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie max. | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 (reste) | FP4 + FP8 mixte |
| Données de pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
| Mode | Caractéristique | Usage |
|---|---|---|
| Non-think | Pas de chaîne de pensée, réponse rapide | Q&R simples, routage |
| Think High | Raisonnement explicite (<redacted_thinking>) | Complexité moyenne, debug code |
| Think Max | Raisonnement maximal, contexte 384K+ requis | Mathématiques complexes, agents longue chaîne |
Paramètres recommandés (tous modes) : temperature=1.0, top_p=1.0
V4-Pro établit des records open source — les modèles fermés conservent l'avantage sur les benchmarks les plus sévères. La variable décisive reste le coût par tâche.
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ record open source | 96,0 % | Non publié séparément | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified évalue les corrections de bugs sur de vrais dépôts GitHub — V4-Pro à 80,6 % partage la première place open source avec Gemini 3.1 Pro. SWE-bench Pro est plus strict ; Claude Fable 5 mène avec 80,3 %.
Sources : documentation DeepSeek, arXiv:2606.19348, HuggingFace, Artificial Analysis, LLMReference.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | ✅ MIT | ❌ Fermé | ❌ Fermé |
| Auto-hébergement | ✅ Oui | ❌ | ❌ |
| Contexte | 1M tokens | Non communiqué | 1M tokens |
| Capacité code | Très forte (proche Fable 5) | Très forte | La plus forte |
| Sortie API (off-peak) | 0,87 $/M tokens | ~15 $/M | 50 $/M |
| Sortie API (peak) | 1,74 $/M tokens | — | — |
| Capacité agent | Forte, multi-agents | Forte | La plus forte |
| Confidentialité des données | ✅ Déploiement privé possible | ❌ | ❌ |
Changement majeur de la GA : heures de pointe (Pékin, jours ouvrés 09h00–12h00 et 14h00–18h00) — tarifs doublés.
| Modèle | Poste | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / $0,0035 / 1M tokens | 2× |
| Entrée (cache miss) | ¥3,00 / $0,435 / 1M tokens | ¥6,00 / $0,87 | |
| Sortie | ¥6,00 / $0,87 / 1M tokens | ¥12,00 / $1,74 | |
| V4-Flash | Entrée (cache hit) | ¥0,02 / $0,0028 / 1M tokens | 2× |
| Entrée (cache miss) | ¥1,00 / $0,14 / 1M tokens | ¥2,00 / $0,28 | |
| Sortie | ¥2,00 / $0,28 / 1M tokens | ¥4,00 / $0,56 |
Planifier hors pointe : traitement documentaire, annotation, revue de code après 18h00 ou avant 09h00 (Pékin).
Exploiter le cache : prompts système répétés — V4-Flash cache hit 0,0028 $/M.
Flash en routage : intents simples sur V4-Flash, raisonnement complexe sur V4-Pro — économie de 60 à 80 %.
Surveiller les e-mails de facturation : DeepSeek annonce les changements 24 heures à l'avance.
Même en pointe, la sortie V4-Pro (1,74 $/M) reste 8,6× moins chère que Claude Opus 4.8 (15 $/M) et GPT-5.6 Sol (~15 $/M).
Avertissement : deepseek-chat et deepseek-reasoner seront définitivement désactivés le 24 juillet 2026 à 15h59 UTC (23h59 à Pékin).
| Ancien modèle | Nouveau modèle | Remarque |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-thinking) | Rapide, tâches légères |
deepseek-reasoner | deepseek-v4-flash (thinking) ou deepseek-v4-pro | Pro pour un raisonnement plus fort |
Recherche globale : deepseek-chat et deepseek-reasoner dans le code, variables d'environnement et CI.
Cartographie : chat léger → deepseek-v4-flash ; ancien reasoner → Flash thinking ou deepseek-v4-pro.
SDK OpenAI : modifier uniquement model ; mode thinking via extra_body (voir code).
SDK Anthropic : base_url reste https://api.deepseek.com, mettre à jour model.
Régression staging : valider agents/RAG avant le 24 juillet, vérifier la facture peak-valley.
Bascule progressive : migration par tranches de trafic, rollback possible jusqu'à la deadline.
Think Max : fenêtre de contexte 384K+.
# ❌ Ancien (invalide après le 24 juillet)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# ✅ Nouveau
client.chat.completions.create(
model="deepseek-v4-pro", # ou deepseek-v4-flash
messages=[...],
# Mode thinking :
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# SDK Anthropic
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
DeepSeek V4 GA réduit fortement les coûts API — l'inférence locale V4-Flash exige toujours un Mac 96 Go UMA ; un VPS Linux bon marché ne peut exécuter ni xcodebuild ni notarytool. Les équipes qui combinent appels API DeepSeek cloud et CI/CD iOS / sessions CLI agent longues gagnent en stabilité en externalisant les charges macOS sur un nœud distant dédié. Pour les environnements de production nécessitant sessions SSH stables et bande passante prévisible, la location cloud Mac Mini NodeMini constitue généralement la couche d'exécution la plus fiable — indépendamment des variations peak-valley. Tarifs : tarifs de location ; mise en service : centre d'aide ; Flash local : test antirez ds4 + Mac 96 Go.
Dernière mise à jour : 2026-07-20. Finaliser la migration API avant le 24 juillet.
Architecture inchangée ; la GA améliore agents, mathématiques et code, et introduit peak-valley. Anciens modèles retirés le 24 juillet. Budget : tarifs de location.
Pékin, jours ouvrés 09h00–12h00 et 14h00–18h00 (tarifs ×2). Batch après 18h, cache prompt, routage V4-Flash.
deepseek-chat → deepseek-v4-flash (non-thinking) ; deepseek-reasoner → Flash thinking ou deepseek-v4-pro. Deadline 24 juillet 23h59 Pékin.
SWE-bench Verified : V4-Pro 80,6 % (record open source), Fable 5 96 %. Coût/auto-hébergement : V4-Pro 0,87 $/M ≈ 1/17 de GPT-5.6 Sol. Environnement distant : centre d'aide.
Oui. ds4 sur Mac 96 Go UMA (284B/13B actifs) ; V4-Pro (1,6T) nécessite vLLM/SGLang cloud. Détails : test antirez ds4 Mac.
Q&R simples : Non-think ; debug code : Think High ; mathématiques complexes et agents longs : Think Max (384K+). Sampling : temperature=1.0, top_p=1.0.