Le 31 juillet 2026, DeepSeek a promu V4-Flash-0731 en bêta API officielle : architecture inchangée (284 milliards de paramètres totaux, 13 milliards activés), gains issus du post-entraînement uniquement. Le modèle dépasse la preview V4-Pro sur les benchmarks agent tout en restant 36 à 179 fois moins cher que Claude Opus 4.8 selon les tarifs catalogue. Cet article s'adresse aux développeurs qui évaluent le choix de modèle et le coût des workflows agent. Il couvre : la chronologie avril–août, les grilles tarifaires et benchmarks officiels, l'architecture CSA+HCA (DSA), la première mention du framework Harness, une comparaison avec Kimi K3, GLM-5.2 et Qwen3.8-Max, les controverses (dépendance Harness, cache hit, dates V4-Pro non confirmées), le concept chinois de « kill line », une checklist opérationnelle en six étapes et une FAQ. Données clés : entrée Flash 0,14 $ / 0,0028 $ (cache miss/hit), sortie 0,28 $ par million de tokens ; Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 — tous les scores agent mesurés en mode minimal Harness non encore publié.
Le déploiement de DeepSeek V4 s'étale sur trois mois, pas sur une seule date de lancement. Chaque étape a repositionné la pression concurrentielle face à Kimi K3, Qwen3.8-Max et aux modèles fermés occidentaux.
| Date | Événement |
|---|---|
| 24 avril 2026 | Lancement de la preview DeepSeek-V4 et open source MIT : V4-Pro (1,6T total / 49 Mrd activés) et V4-Flash (284 Mrd / 13 Mrd activés), contexte 1 million de tokens |
| 20 juillet 2026 | V4 passe en GA avec tarification peak-valley ; SWE-bench Verified 80,6 % pour V4-Pro |
| 24 juillet 2026 | Retrait des alias deepseek-chat et deepseek-reasoner ; tout le trafic est routé vers la famille V4 |
| 27 juillet 2026 | Moonshot AI publie les poids Kimi K3 sur Hugging Face (2,8T total) — l'une des plus grandes sorties open weights à ce jour |
| 31 juillet 2026 | V4-Flash-0731 en bêta API officielle ; synchronisation des poids MIT sur Hugging Face. Le changelog nomme pour la première fois DeepSeek Harness (« à publier prochainement »). API uniquement — application et chat web non mis à jour |
| Au 5 août 2026 | GA officielle V4-Pro non confirmée. La presse chinoise cite des sources anonymes évoquant des tests internes fin juillet et une fenêtre GA du 10 au 20 août — non confirmé par DeepSeek ; à traiter comme rumeur |
« Officiel » ne signifie pas nouveau modèle : V4-Flash-0731 conserve la taille et la structure d'avril ; les gains proviennent uniquement du post-entraînement
Les benchmarks agent dépendent de Harness : Terminal Bench 2.0 et Toolathlon ont été mesurés en mode minimal d'un framework non encore publié
Ne pas confondre index tiers et auto-évaluation : Artificial Analysis place V4-Flash sous Kimi K3 en Intelligence Index, mais le coût par tâche est d'un ordre de grandeur inférieur
Distinguer rumeurs et changelog officiel : « dès que possible » est la seule formulation confirmée pour V4-Pro et Harness ; les dates du 10–20 août restent non vérifiées
Le cache hit modifie l'économie : 0,14 $ vs 0,0028 $ en entrée change radicalement le ratio face à Claude (36x à 179x)
API ≠ expérience consommateur : l'application et le chat web DeepSeek n'ont pas été mis à jour au 31 juillet — seule l'API pointe vers 0731
Vérification : les données de cet article sont arrêtées au 5 août 2026. Dates GA V4-Pro, publication Harness, activation de la surcharge peak-hour 2x et reproductions tierces des benchmarks peuvent évoluer — consultez le changelog officiel DeepSeek avant toute migration prod.
| Modèle | Statut | Total / activés | Contexte | Entrée (cache miss / hit, par M tokens) | Sortie (par M tokens) | Licence |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Officiel (31/07/2026) | 284 Mrd / 13 Mrd | 1 M | 0,14 $ / 0,0028 $ | 0,28 $ | MIT |
| DeepSeek-V4-Pro | Preview (24/04/2026) | 1,6T / 49 Mrd | 1 M | 0,435 $ / 0,003625 $ | 0,87 $ | MIT |
| Kimi K3 | Poids ouverts (27/07/2026) | 2,8T / ~104 Mrd (estim.) | ~1,05 M | 3,00 $ / 0,30 $ | 15,00 $ | MIT modifiée |
| GLM-5.2 (Zhipu / Z.ai) | Ouvert (juin 2026) | ~744 Mrd / ~40 Mrd | 1 M | Non vérifié | Non vérifié | MIT |
| Qwen3.8-Max | API GA (03/08) ; poids en attente | 2,4T / 95 Mrd | 1 M | 2,00 $ / ~0,17–0,25 $ | 6,00 $ | Promis open source |
Tous les tarifs sont des prix catalogue éditeur. DeepSeek a annoncé une future surcharge 2x en heures de pointe (9h–12h et 14h–18h, heure de Pékin) sans date d'entrée en vigueur confirmée.
| Benchmark | V4-Flash-0731 | Preview V4-Pro | Remarque |
|---|---|---|---|
| Terminal Bench 2.0 | 82,7 | 67,9 | Harness minimal, intensité de raisonnement max |
| Toolathlon et autres | Dépasse V4-Pro | — | Mesure interne Harness |
| SWE-bench Verified | Non reproduit indépendamment pour 0731 | 80,6 % (GA juillet) | Benchmark tiers plus fiable |
Le détail le plus facile à manquer : V4-Flash-0731 est identique en taille et en structure à la preview d'avril. DeepSeek affirme que l'intégralité du gain sur les benchmarks agent provient d'une réexécution du post-entraînement, pas d'un scale-up. Un modèle 284 Mrd / 13 Mrd activés dépasse désormais un sibling 1,6T / 49 Mrd sur plusieurs tâches agentiques — ce qui remet en cause l'hypothèse par défaut « plus gros = meilleur » dans la course aux modèles chinois de 2026.
Le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence décrit trois évolutions architecturales héritées de la preview d'avril :
À 1 million de tokens, DeepSeek affirme que V4-Pro n'exige que 27 % des FLOPs d'inférence par token de V3.2 et 10 % de l'empreinte KV cache. Ces chiffres d'efficacité sont rapportés par l'éditeur ; aucune reproduction tierce indépendante n'a été publiée au 5 août 2026.
Le changelog du 31 juillet marque la première mention officielle de DeepSeek Harness — un framework d'exécution agent en interne pour lecture/écriture de fichiers, appels d'outils et travaux d'ingénierie multi-étapes, positionné comme réponse à Claude Code. Jusqu'alors, les équipes DeepSeek s'appuyaient sur Claude Code, OpenCode et d'autres outils agent tiers.
Chaque benchmark agent publié pour V4-Flash-0731 (Terminal Bench 2.0, Toolathlon, etc.) a été mesuré en « mode minimal » de Harness, qui n'est pas encore publié, avec intensité de raisonnement max, top_p 0,95, temperature 1,0. Le changelog DeepSeek précise que les scores agent sont « extrêmement sensibles au choix du harness » — une mise en garde à prendre au sérieux plutôt qu'à survoler.
Les scores agent en une ligne de titre dépendent du harness et sont auto-évalués. Tant que des tiers n'auront pas reproduit avec Claude Code, Cursor ou d'autres frameworks, traitez Terminal Bench 2.0 comme des résultats « éditeur + framework spécifique », pas comme des affirmations de capacité portable.
Vérifier le point de terminaison API : confirmer que deepseek-v4-flash résout vers la build officielle 0731 ; deepseek-chat et deepseek-reasoner ont été retirés le 24 juillet
Choisir Flash vs Pro selon la charge : V4-Flash-0731 gagne sur le coût et dépasse la preview V4-Pro sur les scores agent Harness ; réserver V4-Pro preview aux tâches exigeant une connaissance du monde plus profonde jusqu'à la GA officielle
Modéliser le coût avec les paliers cache : facturer à 0,14 $ cache miss vs 0,0028 $ cache hit en entrée — la stratégie de cache modifie matériellement l'écart de prix face à Claude
Traiter les benchmarks Harness comme spécifiques au framework : ne pas porter les scores Terminal Bench 2.0 vers Claude Code ou Cursor sans reproduction indépendante sur votre stack
Lancer des A/B sur charges réelles : les tableaux éditeur sont directionnels — tester en aveugle contre Kimi K3 ou votre modèle actuel sur vos pipelines agent avant migration complète
Suivre le changelog pour GA V4-Pro et sortie Harness : ignorer les rumeurs du 10–20 août tant que le compte officiel ou api-docs.deepseek.com ne confirment pas ; surveiller le calendrier de la surcharge peak-hour 2x
V4-Flash-0731 arrive dans la fenêtre la plus dense de lancements open weights chinois de l'année. Les chiffres Artificial Analysis ci-dessous sont indépendants ; les benchmarks agent DeepSeek utilisent une méthodologie distincte.
| Modèle | Labo | Sortie / poids | Params totaux | AA Intelligence Index | Coût moyen/tâche (AA) |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 31/07/2026 (officiel) | 284 Mrd | 50 | 0,03 $ |
| Kimi K3 | Moonshot AI | 16/07 preview / 27/07 poids | 2,8T | 57 | 0,86 $ |
| GLM-5.2 | Zhipu / Z.ai | Juin 2026 | ~744 Mrd | ~1 pt au-dessus de V4-Flash | Non vérifié |
| Qwen3.8-Max | Alibaba | 03/08 GA (poids en attente) | 2,4T | Non vérifié | Non vérifié |
| GPT-5.6 Sol | OpenAI | Fermé | Non divulgué | 9+ pts au-dessus | 1,86 $ |
| Claude Fable 5 | Anthropic | Fermé | Non divulgué | 9+ pts au-dessus | 3,15 $ |
Source : Intelligence Index et coût par tâche d'Artificial Analysis, repris par Wantrich et Meyka. Benchmarks agent DeepSeek (Terminal Bench 2.0, etc.) : mesure éditeur via Harness minimal non publié — ne pas confondre les deux jeux de données.
La tension : sur l'index indépendant, V4-Flash reste derrière Kimi K3 et GLM-5.2. Mais le coût par tâche représente environ 1/29e de Kimi K3, 1/62e de GPT-5.6 Sol et 1/105e de Claude Fable 5. DeepSeek ne vise pas la première place du classement — il optimise pour « assez intelligent à un prix que personne d'autre ne peut égaler », ce qui explique aussi pourquoi la preview a dominé le classement OpenRouter pendant sept semaines consécutives.
Face à Claude Opus 4.8, les tarifs officiels V4-Flash représenteraient environ 36x moins cher en entrée cache miss, 179x en cache hit et 89x en sortie (21st Century Business Herald, prix catalogue — audit indépendant absent). Pour les workflows agent et batch où le plafond d'intelligence absolue compte moins que le coût marginal, le positionnement de V4-Flash-0731 est limpide.
Avant la sortie de V4-Flash-0731, les forums IA chinois moquaient le fondateur Liang Wenfeng sous le surnom « Liang Baikai » — jeu de mots signifiant à peu près « Liang Promesse Vide », après le report de la cible mi-juillet pour V4-Pro. Une fois la build Flash officielle au-delà des attentes, les communautés sont revenues à « Liang Sheng » (« Liang le Sage ») — un baromètre révélateur des oscillations de sentiment dans l'écosystème développeur chinois.
Plus substantiellement, les cercles développeur chinois emploient le terme « 斩杀线 » (zhǎn shā xiàn — « kill line ») : la combinaison DeepSeek de performance suffisante et de prix plancher fixe une barre effective. Les concurrents qui ne battent pas clairement DeepSeek en capacité et ne peuvent pas le sous-coter en prix risquent de perdre leur pertinence marché. Ce cadrage éclaire des mouvements comme la baisse rapportée de 80 % des tarifs GPT-5.6 Luna par OpenAI à la même période. Un responsable d'incubateur IA cité par 21st Century Business Herald : « Toutes les entreprises de grands modèles courent devant Liang Wenfeng — de quelque manière qu'elles y parviennent, elles doivent rester devant DeepSeek pour survivre. »
Le 31 juillet, Nvidia, Broadcom et AMD n'ont enregistré aucun mouvement boursier significatif lors de la sortie officielle de V4-Flash — contraste avec début 2025, quand les affirmations d'efficacité de DeepSeek-R1 avaient déclenché une vente mondiale sur les actions IA. Les marchés semblent traiter « DeepSeek fait plus avec moins de calcul » comme de l'ingénierie normale plutôt que comme un signal baissier automatique sur la demande de compute.
Si vous envisagez de brancher V4-Flash sur Claude Code, OpenCode ou OpenClaw pour des sessions agent longues, faire tourner des CLI sur un portable ou un VPS Linux instable entraîne souvent pression mémoire, sessions interrompues et absence de la toolchain Xcode/Metal. Pour les environnements de production nécessitant des sessions SSH stables, un cache DerivedData et une automatisation CI/CD iOS — ou une inférence locale ds4 sur Mac 96 Go — la location cloud Mac Mini de NodeMini est généralement le meilleur choix : nœuds dédiés, provisionnement en quelques secondes, agents et builds sur le même matériel Mac réel. Consultez les tarifs de location Mac Mini et le centre d'aide. Pour le déploiement local DeepSeek V4 sur Mac loué, voir notre guide inférence ds4 sur Mac 96 Go UMA en location.
Sources : documentation API et changelog DeepSeek (api-docs.deepseek.com), rapport technique DeepSeek-V4 et fiches Hugging Face, Artificial Analysis (via Wantrich, Meyka), 21st Century Business Herald, Kuai Technology / ifeng Tech, discussions communautaires V2EX, Moonshot AI, Zhipu/Z.ai et annonces Alibaba Cloud. Vérifier tarifs et statut de sortie avant toute décision.
Oui. V4-Pro et V4-Flash, y compris la build officielle V4-Flash-0731 du 31 juillet 2026, sont publiés sous licence MIT sur Hugging Face. Utilisation commerciale, fine-tuning et redistribution sont autorisés sans permission supplémentaire.
Selon les tarifs listés rapportés par 21st Century Business Herald, V4-Flash-0731 coûte environ 36 fois moins cher que Claude Opus 4.8 en entrée cache miss, 179 fois moins en entrée cache hit, et 89 fois moins en sortie, par million de tokens. Il s'agit de prix catalogue éditeur, non d'un audit indépendant. Pour estimer le coût d'un environnement de test, voir les tarifs de location Mac Mini.
Aucune date confirmée. Le changelog DeepSeek indique seulement que la GA V4-Pro suivra « dès que possible ». Les rumeurs d'une fenêtre du 10 au 20 août proviennent de sources anonymes dans la presse chinoise et n'ont pas été confirmées par DeepSeek.
Partiellement. Les benchmarks tiers largement adoptés comme SWE-bench Verified ont plus de poids. Les scores agent (Terminal Bench 2.0, Toolathlon, etc.) ont été mesurés avec le framework Harness non encore publié ; DeepSeek avertit que ces chiffres sont très sensibles au choix du harness — attendez une reproduction indépendante avec d'autres outils agent avant de les traiter comme des affirmations de capacité générale.
C'est le premier framework d'exécution agent développé en interne par DeepSeek, positionné comme alternative à Claude Code pour l'édition de fichiers, les appels d'outils et les tâches d'ingénierie multi-étapes. Il a été nommé pour la première fois dans le changelog du 31 juillet 2026 et n'est pas encore disponible publiquement. Pour l'inférence locale, consultez le guide ds4 sur Mac 96 Go ; pour l'onboarding, le centre d'aide.