DeepSeek V4-Flash-0731 :
post-entraînement, Harness, benchmarks officiels et « kill line »

Le 31 juillet 2026, DeepSeek a promu V4-Flash-0731 en bêta API officielle : architecture inchangée (284 milliards de paramètres totaux, 13 milliards activés), gains issus du post-entraînement uniquement. Le modèle dépasse la preview V4-Pro sur les benchmarks agent tout en restant 36 à 179 fois moins cher que Claude Opus 4.8 selon les tarifs catalogue. Cet article s'adresse aux développeurs qui évaluent le choix de modèle et le coût des workflows agent. Il couvre : la chronologie avril–août, les grilles tarifaires et benchmarks officiels, l'architecture CSA+HCA (DSA), la première mention du framework Harness, une comparaison avec Kimi K3, GLM-5.2 et Qwen3.8-Max, les controverses (dépendance Harness, cache hit, dates V4-Pro non confirmées), le concept chinois de « kill line », une checklist opérationnelle en six étapes et une FAQ. Données clés : entrée Flash 0,14 $ / 0,0028 $ (cache miss/hit), sortie 0,28 $ par million de tokens ; Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 — tous les scores agent mesurés en mode minimal Harness non encore publié.

01

Chronologie : de la preview d'avril à la GA Flash du 31 juillet

Le déploiement de DeepSeek V4 s'étale sur trois mois, pas sur une seule date de lancement. Chaque étape a repositionné la pression concurrentielle face à Kimi K3, Qwen3.8-Max et aux modèles fermés occidentaux.

DateÉvénement
24 avril 2026Lancement de la preview DeepSeek-V4 et open source MIT : V4-Pro (1,6T total / 49 Mrd activés) et V4-Flash (284 Mrd / 13 Mrd activés), contexte 1 million de tokens
20 juillet 2026V4 passe en GA avec tarification peak-valley ; SWE-bench Verified 80,6 % pour V4-Pro
24 juillet 2026Retrait des alias deepseek-chat et deepseek-reasoner ; tout le trafic est routé vers la famille V4
27 juillet 2026Moonshot AI publie les poids Kimi K3 sur Hugging Face (2,8T total) — l'une des plus grandes sorties open weights à ce jour
31 juillet 2026V4-Flash-0731 en bêta API officielle ; synchronisation des poids MIT sur Hugging Face. Le changelog nomme pour la première fois DeepSeek Harness (« à publier prochainement »). API uniquement — application et chat web non mis à jour
Au 5 août 2026GA officielle V4-Pro non confirmée. La presse chinoise cite des sources anonymes évoquant des tests internes fin juillet et une fenêtre GA du 10 au 20 août — non confirmé par DeepSeek ; à traiter comme rumeur

Six pièges d'information que les développeurs doivent éviter

  1. 01

    « Officiel » ne signifie pas nouveau modèle : V4-Flash-0731 conserve la taille et la structure d'avril ; les gains proviennent uniquement du post-entraînement

  2. 02

    Les benchmarks agent dépendent de Harness : Terminal Bench 2.0 et Toolathlon ont été mesurés en mode minimal d'un framework non encore publié

  3. 03

    Ne pas confondre index tiers et auto-évaluation : Artificial Analysis place V4-Flash sous Kimi K3 en Intelligence Index, mais le coût par tâche est d'un ordre de grandeur inférieur

  4. 04

    Distinguer rumeurs et changelog officiel : « dès que possible » est la seule formulation confirmée pour V4-Pro et Harness ; les dates du 10–20 août restent non vérifiées

  5. 05

    Le cache hit modifie l'économie : 0,14 $ vs 0,0028 $ en entrée change radicalement le ratio face à Claude (36x à 179x)

  6. 06

    API ≠ expérience consommateur : l'application et le chat web DeepSeek n'ont pas été mis à jour au 31 juillet — seule l'API pointe vers 0731

warning

Vérification : les données de cet article sont arrêtées au 5 août 2026. Dates GA V4-Pro, publication Harness, activation de la surcharge peak-hour 2x et reproductions tierces des benchmarks peuvent évoluer — consultez le changelog officiel DeepSeek avant toute migration prod.

02

Tarification officielle, spécifications et benchmarks clés

ModèleStatutTotal / activésContexteEntrée (cache miss / hit, par M tokens)Sortie (par M tokens)Licence
DeepSeek-V4-Flash-0731Officiel (31/07/2026)284 Mrd / 13 Mrd1 M0,14 $ / 0,0028 $0,28 $MIT
DeepSeek-V4-ProPreview (24/04/2026)1,6T / 49 Mrd1 M0,435 $ / 0,003625 $0,87 $MIT
Kimi K3Poids ouverts (27/07/2026)2,8T / ~104 Mrd (estim.)~1,05 M3,00 $ / 0,30 $15,00 $MIT modifiée
GLM-5.2 (Zhipu / Z.ai)Ouvert (juin 2026)~744 Mrd / ~40 Mrd1 MNon vérifiéNon vérifiéMIT
Qwen3.8-MaxAPI GA (03/08) ; poids en attente2,4T / 95 Mrd1 M2,00 $ / ~0,17–0,25 $6,00 $Promis open source

Tous les tarifs sont des prix catalogue éditeur. DeepSeek a annoncé une future surcharge 2x en heures de pointe (9h–12h et 14h–18h, heure de Pékin) sans date d'entrée en vigueur confirmée.

Benchmarks agent (mesure DeepSeek, mode Harness minimal)

BenchmarkV4-Flash-0731Preview V4-ProRemarque
Terminal Bench 2.082,767,9Harness minimal, intensité de raisonnement max
Toolathlon et autresDépasse V4-ProMesure interne Harness
SWE-bench VerifiedNon reproduit indépendamment pour 073180,6 % (GA juillet)Benchmark tiers plus fiable

Chiffres clés en un coup d'œil

  • Tarif Flash API : 0,14 $ entrée cache miss, 0,0028 $ cache hit, 0,28 $ sortie par million de tokens
  • Architecture inchangée : 284 Mrd total / 13 Mrd activés — saut de performance attribué entièrement au post-entraînement
  • Efficacité à 1M de contexte (V4-Pro vs V3.2, chiffres éditeur) : 27 % des FLOPs par token, 10 % de l'empreinte KV cache
  • Artificial Analysis (indépendant) : Intelligence Index 50, coût moyen par tâche 0,03 $
  • OpenRouter (semaine du 18–24 mai 2026) : V4-Flash en tête du classement hebdomadaire par volume de tokens (3,43T)
03

Analyse : post-entraînement, architecture et framework Harness

L'architecture n'a pas bougé — le post-entraînement, si

Le détail le plus facile à manquer : V4-Flash-0731 est identique en taille et en structure à la preview d'avril. DeepSeek affirme que l'intégralité du gain sur les benchmarks agent provient d'une réexécution du post-entraînement, pas d'un scale-up. Un modèle 284 Mrd / 13 Mrd activés dépasse désormais un sibling 1,6T / 49 Mrd sur plusieurs tâches agentiques — ce qui remet en cause l'hypothèse par défaut « plus gros = meilleur » dans la course aux modèles chinois de 2026.

CSA+HCA (DSA), mHC et optimiseur Muon

Le rapport technique DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence décrit trois évolutions architecturales héritées de la preview d'avril :

  • Attention hybride (DSA) : Compressed Sparse Attention (CSA) plus Heavily Compressed Attention (HCA), commercialisée sous « DeepSeek Sparse Attention », visant à réduire calcul et mémoire en contexte long
  • Manifold-Constrained Hyper-Connections (mHC) : amélioration des connexions résiduelles standard
  • Optimiseur Muon : remplace les optimiseurs traditionnels pour une convergence plus rapide et une stabilité d'entraînement accrue

À 1 million de tokens, DeepSeek affirme que V4-Pro n'exige que 27 % des FLOPs d'inférence par token de V3.2 et 10 % de l'empreinte KV cache. Ces chiffres d'efficacité sont rapportés par l'éditeur ; aucune reproduction tierce indépendante n'a été publiée au 5 août 2026.

Harness : première mention officielle et benchmarks en mode minimal

Le changelog du 31 juillet marque la première mention officielle de DeepSeek Harness — un framework d'exécution agent en interne pour lecture/écriture de fichiers, appels d'outils et travaux d'ingénierie multi-étapes, positionné comme réponse à Claude Code. Jusqu'alors, les équipes DeepSeek s'appuyaient sur Claude Code, OpenCode et d'autres outils agent tiers.

Chaque benchmark agent publié pour V4-Flash-0731 (Terminal Bench 2.0, Toolathlon, etc.) a été mesuré en « mode minimal » de Harness, qui n'est pas encore publié, avec intensité de raisonnement max, top_p 0,95, temperature 1,0. Le changelog DeepSeek précise que les scores agent sont « extrêmement sensibles au choix du harness » — une mise en garde à prendre au sérieux plutôt qu'à survoler.

Les scores agent en une ligne de titre dépendent du harness et sont auto-évalués. Tant que des tiers n'auront pas reproduit avec Claude Code, Cursor ou d'autres frameworks, traitez Terminal Bench 2.0 comme des résultats « éditeur + framework spécifique », pas comme des affirmations de capacité portable.

Checklist d'évaluation en six étapes (mise en production)

  1. 01

    Vérifier le point de terminaison API : confirmer que deepseek-v4-flash résout vers la build officielle 0731 ; deepseek-chat et deepseek-reasoner ont été retirés le 24 juillet

  2. 02

    Choisir Flash vs Pro selon la charge : V4-Flash-0731 gagne sur le coût et dépasse la preview V4-Pro sur les scores agent Harness ; réserver V4-Pro preview aux tâches exigeant une connaissance du monde plus profonde jusqu'à la GA officielle

  3. 03

    Modéliser le coût avec les paliers cache : facturer à 0,14 $ cache miss vs 0,0028 $ cache hit en entrée — la stratégie de cache modifie matériellement l'écart de prix face à Claude

  4. 04

    Traiter les benchmarks Harness comme spécifiques au framework : ne pas porter les scores Terminal Bench 2.0 vers Claude Code ou Cursor sans reproduction indépendante sur votre stack

  5. 05

    Lancer des A/B sur charges réelles : les tableaux éditeur sont directionnels — tester en aveugle contre Kimi K3 ou votre modèle actuel sur vos pipelines agent avant migration complète

  6. 06

    Suivre le changelog pour GA V4-Pro et sortie Harness : ignorer les rumeurs du 10–20 août tant que le compte officiel ou api-docs.deepseek.com ne confirment pas ; surveiller le calendrier de la surcharge peak-hour 2x

04

Comparaison : Intelligence Index vs coût par tâche

V4-Flash-0731 arrive dans la fenêtre la plus dense de lancements open weights chinois de l'année. Les chiffres Artificial Analysis ci-dessous sont indépendants ; les benchmarks agent DeepSeek utilisent une méthodologie distincte.

ModèleLaboSortie / poidsParams totauxAA Intelligence IndexCoût moyen/tâche (AA)
DeepSeek-V4-Flash-0731DeepSeek31/07/2026 (officiel)284 Mrd500,03 $
Kimi K3Moonshot AI16/07 preview / 27/07 poids2,8T570,86 $
GLM-5.2Zhipu / Z.aiJuin 2026~744 Mrd~1 pt au-dessus de V4-FlashNon vérifié
Qwen3.8-MaxAlibaba03/08 GA (poids en attente)2,4TNon vérifiéNon vérifié
GPT-5.6 SolOpenAIFerméNon divulgué9+ pts au-dessus1,86 $
Claude Fable 5AnthropicFerméNon divulgué9+ pts au-dessus3,15 $

Source : Intelligence Index et coût par tâche d'Artificial Analysis, repris par Wantrich et Meyka. Benchmarks agent DeepSeek (Terminal Bench 2.0, etc.) : mesure éditeur via Harness minimal non publié — ne pas confondre les deux jeux de données.

La tension : sur l'index indépendant, V4-Flash reste derrière Kimi K3 et GLM-5.2. Mais le coût par tâche représente environ 1/29e de Kimi K3, 1/62e de GPT-5.6 Sol et 1/105e de Claude Fable 5. DeepSeek ne vise pas la première place du classement — il optimise pour « assez intelligent à un prix que personne d'autre ne peut égaler », ce qui explique aussi pourquoi la preview a dominé le classement OpenRouter pendant sept semaines consécutives.

Face à Claude Opus 4.8, les tarifs officiels V4-Flash représenteraient environ 36x moins cher en entrée cache miss, 179x en cache hit et 89x en sortie (21st Century Business Herald, prix catalogue — audit indépendant absent). Pour les workflows agent et batch où le plafond d'intelligence absolue compte moins que le coût marginal, le positionnement de V4-Flash-0731 est limpide.

05

Controverses, « kill line » et contexte sectoriel

Les benchmarks impressionnent — mais lisez les notes de bas de page

  • Dépendance Harness : Terminal Bench 2.0 à 82,7 (vs preview V4-Pro 67,9) mesuré en mode minimal Harness non publié — le changelog officiel avertit de la sensibilité au harness
  • Problèmes de cache hit et fiabilité : 21st Century Business Herald, citant des retours de développeurs étrangers, signale des taux de cache hit faibles et des timeouts occasionnels du classificateur de sécurité sur la build officielle V4-Flash
  • Dates GA V4-Pro et Harness non confirmées : la presse chinoise évoque le 10–20 août sur base de sources anonymes ; le changelog DeepSeek indique seulement que V4-Pro officiel « suivra dès que possible »
  • Rumeurs de financement : des médias rapportent un tour d'environ 7,4 Md$ (Tencent, NetEase) à ~48,7 Md$ de valorisation, plus une préparation IPO à ~71 Md$ — sources anonymes uniquement, sans dépôt réglementaire ni déclaration DeepSeek

De « Liang Baikai » à « Liang Sheng » et la « kill line »

Avant la sortie de V4-Flash-0731, les forums IA chinois moquaient le fondateur Liang Wenfeng sous le surnom « Liang Baikai » — jeu de mots signifiant à peu près « Liang Promesse Vide », après le report de la cible mi-juillet pour V4-Pro. Une fois la build Flash officielle au-delà des attentes, les communautés sont revenues à « Liang Sheng » (« Liang le Sage ») — un baromètre révélateur des oscillations de sentiment dans l'écosystème développeur chinois.

Plus substantiellement, les cercles développeur chinois emploient le terme « 斩杀线 » (zhǎn shā xiàn — « kill line ») : la combinaison DeepSeek de performance suffisante et de prix plancher fixe une barre effective. Les concurrents qui ne battent pas clairement DeepSeek en capacité et ne peuvent pas le sous-coter en prix risquent de perdre leur pertinence marché. Ce cadrage éclaire des mouvements comme la baisse rapportée de 80 % des tarifs GPT-5.6 Luna par OpenAI à la même période. Un responsable d'incubateur IA cité par 21st Century Business Herald : « Toutes les entreprises de grands modèles courent devant Liang Wenfeng — de quelque manière qu'elles y parviennent, elles doivent rester devant DeepSeek pour survivre. »

Le 31 juillet, Nvidia, Broadcom et AMD n'ont enregistré aucun mouvement boursier significatif lors de la sortie officielle de V4-Flash — contraste avec début 2025, quand les affirmations d'efficacité de DeepSeek-R1 avaient déclenché une vente mondiale sur les actions IA. Les marchés semblent traiter « DeepSeek fait plus avec moins de calcul » comme de l'ingénierie normale plutôt que comme un signal baissier automatique sur la demande de compute.

2026 : post-entraînement vs course aux paramètres

  • Post-entraînement vs scale-up : V4-Flash-0731 améliore les capacités agent sans grossir le modèle ; Qwen3.8-Max prolonge le récit « grande capacité, faible activation » en MoE
  • Open weights en cascade : Kimi K3 (27/07), V4-Flash MIT (31/07), promesse Qwen3.8-Max — la Chine consolide un écosystème largement ouvert
  • Agent comme axe produit : Harness annoncé, Terminal Bench 2.0 mis en avant — la bataille 2026 se joue autant sur les frameworks d'exécution que sur les scores bruts
  • Réaction des marchés : pas de choc chip au 31 juillet, contrairement à R1 — le marché intègre l'efficacité DeepSeek comme donnée structurelle

Si vous envisagez de brancher V4-Flash sur Claude Code, OpenCode ou OpenClaw pour des sessions agent longues, faire tourner des CLI sur un portable ou un VPS Linux instable entraîne souvent pression mémoire, sessions interrompues et absence de la toolchain Xcode/Metal. Pour les environnements de production nécessitant des sessions SSH stables, un cache DerivedData et une automatisation CI/CD iOS — ou une inférence locale ds4 sur Mac 96 Go — la location cloud Mac Mini de NodeMini est généralement le meilleur choix : nœuds dédiés, provisionnement en quelques secondes, agents et builds sur le même matériel Mac réel. Consultez les tarifs de location Mac Mini et le centre d'aide. Pour le déploiement local DeepSeek V4 sur Mac loué, voir notre guide inférence ds4 sur Mac 96 Go UMA en location.

Sources : documentation API et changelog DeepSeek (api-docs.deepseek.com), rapport technique DeepSeek-V4 et fiches Hugging Face, Artificial Analysis (via Wantrich, Meyka), 21st Century Business Herald, Kuai Technology / ifeng Tech, discussions communautaires V2EX, Moonshot AI, Zhipu/Z.ai et annonces Alibaba Cloud. Vérifier tarifs et statut de sortie avant toute décision.

FAQ

Questions fréquentes

Oui. V4-Pro et V4-Flash, y compris la build officielle V4-Flash-0731 du 31 juillet 2026, sont publiés sous licence MIT sur Hugging Face. Utilisation commerciale, fine-tuning et redistribution sont autorisés sans permission supplémentaire.

Selon les tarifs listés rapportés par 21st Century Business Herald, V4-Flash-0731 coûte environ 36 fois moins cher que Claude Opus 4.8 en entrée cache miss, 179 fois moins en entrée cache hit, et 89 fois moins en sortie, par million de tokens. Il s'agit de prix catalogue éditeur, non d'un audit indépendant. Pour estimer le coût d'un environnement de test, voir les tarifs de location Mac Mini.

Aucune date confirmée. Le changelog DeepSeek indique seulement que la GA V4-Pro suivra « dès que possible ». Les rumeurs d'une fenêtre du 10 au 20 août proviennent de sources anonymes dans la presse chinoise et n'ont pas été confirmées par DeepSeek.

Partiellement. Les benchmarks tiers largement adoptés comme SWE-bench Verified ont plus de poids. Les scores agent (Terminal Bench 2.0, Toolathlon, etc.) ont été mesurés avec le framework Harness non encore publié ; DeepSeek avertit que ces chiffres sont très sensibles au choix du harness — attendez une reproduction indépendante avec d'autres outils agent avant de les traiter comme des affirmations de capacité générale.

C'est le premier framework d'exécution agent développé en interne par DeepSeek, positionné comme alternative à Claude Code pour l'édition de fichiers, les appels d'outils et les tâches d'ingénierie multi-étapes. Il a été nommé pour la première fois dans le changelog du 31 juillet 2026 et n'est pas encore disponible publiquement. Pour l'inférence locale, consultez le guide ds4 sur Mac 96 Go ; pour l'onboarding, le centre d'aide.