DeepSeek V4-Flash-0731 официальный релиз
Harness, post-training, бенчмарки и «kill line» китайских LLM

31 июля 2026 DeepSeek выпустил V4-Flash-0731 — официальную сборку Flash-линейки в API open beta. Параметры (284B total, 13B activated) и архитектура совпадают с апрельским preview; прирост качества — только из post-training rerun. На Agent-бенчмарках модель обгоняет собственный V4-Pro preview при цене на порядки ниже Claude Opus 4.8. Материал для тех, кто выбирает model stack и считает Agent workflow cost: timeline апрель–август, pricing + benchmark tables, CSA+HCA / mHC / Muon, собственный Agent framework Harness, сравнение с Kimi K3 / GLM-5.2 / Qwen3.8-Max, споры вокруг harness-dependent scores, концепция «kill line» (斩杀线), 6-step evaluation checklist и FAQ. V4-Pro GA и Harness пока «как можно скорее»; обновление только через API — app и web-chat не тронуты.

01

Timeline: от апрельского preview до 31 июля

Релиз V4-Flash-0731 — не разовый drop, а финал трёхмесячной дуги. Ниже — confirmed events для сопоставления с Kimi K3, Qwen3.8-Max и предыдущими V4-материалами.

ДатаСобытие
24 апреляDeepSeek-V4 preview + open weights (MIT): V4-Pro (1.6T / 49B active), V4-Flash (284B / 13B active), 1M context
20 июляV4 full GA, peak-valley pricing. Подробнее — V4 GA: pricing и бенчмарки
24 июляLegacy deepseek-chat и deepseek-reasoner permanent offline; весь traffic на V4 model names
27 июляMoonshot AI open-weights Kimi K3 (2.8T) на Hugging Face — давление на DeepSeek по open-source narrative
31 июляV4-Flash-0731 official в API open beta. Та же архитектура, обновлённый post-training; weights sync на Hugging Face. Changelog впервые раскрывает Harness («скоро»). Только API — consumer app/web не обновлены
3 августаAlibaba Qwen3.8-Max GA — пик «trillion-parameter» гонки июль–август
5 августа (дата публикации)V4-Pro official и Harness — по-прежнему «как можно скорее». «10–20 августа GA» — неподтверждённые слухи, не official statement

Четыре info-traps, которые dev должен знать

  1. 01

    «Official» ≠ новая модель: V4-Flash-0731 — те же params и structure; uplift только из post-training

  2. 02

    Agent scores зависят от Harness: Terminal Bench 2.0 и др. сняты в непубличном Harness minimal mode

  3. 03

    API only: app и web-chat остаются на предыдущей сборке

  4. 04

    Даты V4-Pro / Harness: changelog говорит «как можно скорее»; конкретные даты из прессы — rumors до official confirm

warning

Verify before prod: данные актуальны на 5 августа 2026. V4-Pro GA, Harness release, peak-valley billing start и third-party retest могут измениться — сверяйтесь с official DeepSeek changelog перед migration.

02

Spec sheet: pricing, бенчмарки, official numbers

МодельСтатусTotal / activeContextInput (miss/hit per M)Output per MLicense
DeepSeek-V4-Flash-0731Official (31.07)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-ProPreview (24.04, GA TBD)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3Weights open (27.07)2.8T / ~104B (community est.)~1.048M$3.00 / $0.30$15.00Modified MIT
GLM-5.2Open (июнь 2026)~744B / ~40B1MNot disclosedNot disclosedMIT
Qwen3.8-MaxAPI GA (03.08), weights pending2.4T / 95B1M$2.00 / $0.17–0.25$6.00Open promised

Note: цены — vendor list rates. DeepSeek анонсировал peak x2 (Beijing weekdays 09:00–12:00, 14:00–18:00); effective date на момент публикации не подтверждён.

Official Agent / code benchmarks (DeepSeek self-test)

BenchmarkV4-Flash-0731V4-Pro previewПримечание
Terminal Bench 2.082.767.9Harness minimal mode, max reasoning
SWE-bench Verifiedотдельная строка в release80.6%Third-party methodology, выше доверие
Toolathlon и др.выше V4-ProHarness-based self-measurement
Artificial Analysis Intelligence Index50Independent third-party
AA cost per task (avg.)$0.03vs Kimi K3 $0.86, Fable 5 $3.15

«Self-test» — DeepSeek changelog / tech report; Artificial Analysis — independent. Methodology различается — не складывайте в один verdict.

«Сильнее = больше» в H2 2026 перестаёт работать. 284B Flash обгоняет 1.6T Pro preview на Agent benches — post-training quality догоняет param scale.

03

Deep dive: post-training, архитектура и Harness

Архитектура та же — изменился post-training

Ключевой факт V4-Flash-0731: param count и model structure идентичны апрельскому preview. DeepSeek явно указывает, что uplift — не scale-up, а post-training rerun. 284B / 13B Flash обгоняет 1.6T / 49B Pro preview на ряде Agent benchmarks — сигнал, что в H2 2026 качество post-training сопоставимо с гонкой параметров.

CSA+HCA hybrid attention, mHC, Muon

Tech report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» фиксирует три архитектурных изменения серии V4:

  • Hybrid attention (CSA+HCA): compressed sparse attention + high-density compressed attention; внешне — «DSA sparse attention». Цель — снизить compute и VRAM на long context
  • mHC (manifold-constrained hyper-connections): улучшенные residual paths для стабильной сигнализации в 61-layer stack
  • Muon optimizer: замена AdamW — быстрее сходимость, стабильнее training

Official claim: на 1M tokens V4-Pro — 27% FLOPs и 10% KV cache от V3.2. Independent reproduction пока нет; если цифры верны, 1M context — servable cost structure, а не marketing slide.

Harness: первый собственный Agent execution framework DeepSeek

31 июля changelog впервые называет DeepSeek Harness — framework для file I/O, tool calls, shell execution и end-to-end engineering tasks. По позиционированию — ответ на Claude Code. До этого модели DeepSeek в основном жили в third-party Agent tools (Claude Code, OpenCode и т.д.).

Agent scores V4-Flash-0731 (Terminal Bench 2.0, Toolathlon) сняты в ещё не опубликованном Harness minimal mode: max reasoning, top_p=0.95, temperature=1.0. Changelog предупреждает: Agent scores highly sensitive to harness choice — не приравнивайте к raw model capability. Это сигнал не мигрировать в prod по цифрам из press release alone.

6-step evaluation checklist (hands-on)

  1. 01

    Legacy model names: после 24 июля deepseek-chat / deepseek-reasoner offline — grep codebase на deepseek-v4-flash / deepseek-v4-pro

  2. 02

    API vs local: cloud API уже указывает на V4-Flash-0731; local path — antirez ds4 + 96GB Mac benchmark

  3. 03

    Cost baseline: cache hit $0.0028/M input, output $0.28/M — monthly estimate vs Kimi K3 ($15/M output)

  4. 04

    Prod A/B: не мигрируйте по Harness-based official scores; blind test на своём codebase в Claude Code / Cursor

  5. 05

    Track Harness + V4-Pro GA: DeepSeek changelog, Hugging Face, Artificial Analysis retest

  6. 06

    Cache / safety classifier: community reports о низком cache hit rate и intermittent safety classifier timeout — measure latency и failure rate на своём workload до prod cutover

04

Head-to-head: Kimi K3, GLM-5.2, Qwen3.8-Max, closed flagships

V4-Flash-0731 вышел в самое плотное окно open-source trillion-class релизов. Разделение third-party AA data и DeepSeek self-benchmarks даёт более честную картину.

ModelVendorRelease / weightsTotal paramsAA Intelligence IndexAA cost/task
V4-Flash-0731DeepSeek31.07 official284B50$0.03
Kimi K3Moonshot AI16.07 preview / 27.07 weights2.8T57$0.86
GLM-5.2Z.aiИюнь 2026 open~744B~1 pt above FlashNot disclosed
Qwen3.8-MaxAlibaba03.08 GA, weights pending2.4TNot in tableNot in table
GPT-5.6 SolOpenAIClosedUndisclosed9+ pts above Flash$1.86
Claude Fable 5AnthropicClosedUndisclosed9+ pts above Flash$3.15

Парадокс: на AA composite index V4-Flash ниже Kimi K3 и GLM-5.2, но cost per task — ~1/29 от K3, ~1/62 от GPT-5.6 Sol, ~1/105 от Fable 5. DeepSeek играет не в «score #1», а в «достаточный интеллект + экстремальная цена». V4-Flash preview держал #1 на OpenRouter по volume семь недель подряд — тот же narrative.

Vs Claude Opus 4.8 (vendor list, не independent audit): cache miss input ~36× дешевле, cache hit input ~179×, output ~89×. Для Agent pipelines и batch workloads, где ceiling intelligence менее критичен, позиционирование V4-Flash-0731 однозначно.

05

Controversy, «kill line» и industry context

Четыре спорных точки — не переоценивайте headline scores

  • Harness-dependent self-test: Terminal Bench 2.0 82.7 (vs Pro preview 67.9) — unpublished Harness minimal mode. До retest в Claude Code / Cursor — «vendor + specific framework», не universal verdict
  • Production friction: overseas dev community сообщает о degraded input cache hit и intermittent safety classifier timeout — gap между «score jump» narrative и prod stability
  • V4-Pro / Harness date rumors: «internal test week of 28 July», «GA 10–20 August» — unconfirmed press; official — только «как можно скорее»
  • IPO / funding headlines: ~$7.4B round, $48.7B valuation, IPO prep — «по сообщениям СМИ», без regulatory filing или official DeepSeek confirm

Что такое «kill line» (斩杀线)

В китайском dev-сообществе 「斩杀线» (zhǎn shā xiàn), или kill line — порог, который DeepSeek задаёт комбинацией «достаточно хорошо + экстремально дёшево». Если конкурент не обгоняет по capability и не может undercut по price, модель рискует потерять market relevance. Контекст — price war H2 2026 (в т.ч. GPT-5.6 Luna −80%).

До релиза V4-Flash-0731 ожидание «V4-Pro full GA к mid-July» сдвинулось — community шутила про основателя Лян Вэньфэна (梁文锋) как «梁白开» (обещания не сдержал). После сильного Flash-release narrative откатился к «梁圣» (пророк). Инцубаторный инвестор в интервью 21st Century Business Herald: «все крупные model labs бегут за Ляном; выжить можно только встав в очередь за DeepSeek» — иллюстрация kill line как industry psychology, не только pricing table.

Более широкий контекст

  • Post-training vs param race: V4-Flash-0731 поднял Agent без scale-up; Qwen3.8-Max «high capacity, low activation» MoE — тот же сюжет
  • Collective open: Kimi K3, GLM-5.2, DeepSeek V4, Qwen3.8-Max (weights promised) — июль–август формируют «коллективный open» top-tier CN stack
  • Market maturity: 31 июля chip stocks (NVIDIA, Broadcom, AMD) без резкого падения — контраст с шоком DeepSeek-R1 в начале 2025. «Меньше compute за тот же эффект» больше не auto-bearish signal

DeepSeek выбрал не гонку «самая сильная модель», а «достаточный интеллект для массовых вызовов по цене, которую никто не повторит». Kill line — имя порога, который эта стратегия оставила на рынке.

Если планируете V4-Flash-0731 в Claude Code, OpenClaw или других long-session Agent на ноутбуке или flaky Linux VPS, типичные pain points — OOM, dropped sessions, missing Xcode/Metal toolchain. API дёшев, но для prod с stable SSH long sessions, DerivedData cache и iOS CI/CD automation, когда local Mac iron не тянет, NodeMini Mac Mini cloud rental — dedicated node, seconds provisioning, Agent и build jobs на одной real Mac machine. Local Flash inference: antirez ds4 + 96GB Mac benchmark. Specs и pricing: цены аренды Mac Mini. Onboarding: help center.

Sources: DeepSeek official API docs и changelog, tech report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence», Hugging Face model cards, Artificial Analysis (via financial press), 21st Century Business Herald, Moonshot AI / Z.ai / Alibaba releases. Verify latest official announcements перед prod migration.

FAQ

Частые вопросы

Нативный 1M context и резкое снижение compute/memory на длинных сессиях (official: V4-Pro — 27% FLOPs, 10% KV cache от V3.2 на 1M). V4-серия заточена под Agent и совместима с Claude Code, OpenCode и аналогами.

Для диалога, простых задач и массовых дешёвых вызовов V4-Flash-0731 — лучший cost/performance; Agent benches уже выше V4-Pro preview. Для max reasoning при большем бюджете — V4-Pro preview до GA, затем переоценка. Сравните TCO с ценами аренды Mac Mini.

На 5 августа 2026 — нет. Official release — только V4-Flash-0731, API-only. App и web-chat на старой сборке. V4-Pro GA и Harness — «как можно скорее»; «10–20 августа» — неподтверждённые слухи.

Разделяйте: SWE-bench Verified и подобные third-party — относительно надёжны. Agent scores (Terminal Bench 2.0 и др.) — unpublished Harness minimal mode; DeepSeek сам предупреждает о harness sensitivity. Ждите independent retest или A/B в Claude Code / Cursor на своём dataset.

При OpenAI/Anthropic-compatible API deepseek-v4-flash автоматически указывает на новую official сборку. Legacy deepseek-chat / deepseek-reasoner — migrate (sunset с 24 июля). Local inference: ds4 Mac benchmark. Remote Mac nodes: help center.