31 июля 2026 DeepSeek выпустил V4-Flash-0731 — официальную сборку Flash-линейки в API open beta. Параметры (284B total, 13B activated) и архитектура совпадают с апрельским preview; прирост качества — только из post-training rerun. На Agent-бенчмарках модель обгоняет собственный V4-Pro preview при цене на порядки ниже Claude Opus 4.8. Материал для тех, кто выбирает model stack и считает Agent workflow cost: timeline апрель–август, pricing + benchmark tables, CSA+HCA / mHC / Muon, собственный Agent framework Harness, сравнение с Kimi K3 / GLM-5.2 / Qwen3.8-Max, споры вокруг harness-dependent scores, концепция «kill line» (斩杀线), 6-step evaluation checklist и FAQ. V4-Pro GA и Harness пока «как можно скорее»; обновление только через API — app и web-chat не тронуты.
Релиз V4-Flash-0731 — не разовый drop, а финал трёхмесячной дуги. Ниже — confirmed events для сопоставления с Kimi K3, Qwen3.8-Max и предыдущими V4-материалами.
| Дата | Событие |
|---|---|
| 24 апреля | DeepSeek-V4 preview + open weights (MIT): V4-Pro (1.6T / 49B active), V4-Flash (284B / 13B active), 1M context |
| 20 июля | V4 full GA, peak-valley pricing. Подробнее — V4 GA: pricing и бенчмарки |
| 24 июля | Legacy deepseek-chat и deepseek-reasoner permanent offline; весь traffic на V4 model names |
| 27 июля | Moonshot AI open-weights Kimi K3 (2.8T) на Hugging Face — давление на DeepSeek по open-source narrative |
| 31 июля | V4-Flash-0731 official в API open beta. Та же архитектура, обновлённый post-training; weights sync на Hugging Face. Changelog впервые раскрывает Harness («скоро»). Только API — consumer app/web не обновлены |
| 3 августа | Alibaba Qwen3.8-Max GA — пик «trillion-parameter» гонки июль–август |
| 5 августа (дата публикации) | V4-Pro official и Harness — по-прежнему «как можно скорее». «10–20 августа GA» — неподтверждённые слухи, не official statement |
«Official» ≠ новая модель: V4-Flash-0731 — те же params и structure; uplift только из post-training
Agent scores зависят от Harness: Terminal Bench 2.0 и др. сняты в непубличном Harness minimal mode
API only: app и web-chat остаются на предыдущей сборке
Даты V4-Pro / Harness: changelog говорит «как можно скорее»; конкретные даты из прессы — rumors до official confirm
Verify before prod: данные актуальны на 5 августа 2026. V4-Pro GA, Harness release, peak-valley billing start и third-party retest могут измениться — сверяйтесь с official DeepSeek changelog перед migration.
| Модель | Статус | Total / active | Context | Input (miss/hit per M) | Output per M | License |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Official (31.07) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | Preview (24.04, GA TBD) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | Weights open (27.07) | 2.8T / ~104B (community est.) | ~1.048M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | Open (июнь 2026) | ~744B / ~40B | 1M | Not disclosed | Not disclosed | MIT |
| Qwen3.8-Max | API GA (03.08), weights pending | 2.4T / 95B | 1M | $2.00 / $0.17–0.25 | $6.00 | Open promised |
Note: цены — vendor list rates. DeepSeek анонсировал peak x2 (Beijing weekdays 09:00–12:00, 14:00–18:00); effective date на момент публикации не подтверждён.
| Benchmark | V4-Flash-0731 | V4-Pro preview | Примечание |
|---|---|---|---|
| Terminal Bench 2.0 | 82.7 | 67.9 | Harness minimal mode, max reasoning |
| SWE-bench Verified | отдельная строка в release | 80.6% | Third-party methodology, выше доверие |
| Toolathlon и др. | выше V4-Pro | — | Harness-based self-measurement |
| Artificial Analysis Intelligence Index | 50 | — | Independent third-party |
| AA cost per task (avg.) | $0.03 | — | vs Kimi K3 $0.86, Fable 5 $3.15 |
«Self-test» — DeepSeek changelog / tech report; Artificial Analysis — independent. Methodology различается — не складывайте в один verdict.
«Сильнее = больше» в H2 2026 перестаёт работать. 284B Flash обгоняет 1.6T Pro preview на Agent benches — post-training quality догоняет param scale.
Ключевой факт V4-Flash-0731: param count и model structure идентичны апрельскому preview. DeepSeek явно указывает, что uplift — не scale-up, а post-training rerun. 284B / 13B Flash обгоняет 1.6T / 49B Pro preview на ряде Agent benchmarks — сигнал, что в H2 2026 качество post-training сопоставимо с гонкой параметров.
Tech report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» фиксирует три архитектурных изменения серии V4:
Official claim: на 1M tokens V4-Pro — 27% FLOPs и 10% KV cache от V3.2. Independent reproduction пока нет; если цифры верны, 1M context — servable cost structure, а не marketing slide.
31 июля changelog впервые называет DeepSeek Harness — framework для file I/O, tool calls, shell execution и end-to-end engineering tasks. По позиционированию — ответ на Claude Code. До этого модели DeepSeek в основном жили в third-party Agent tools (Claude Code, OpenCode и т.д.).
Agent scores V4-Flash-0731 (Terminal Bench 2.0, Toolathlon) сняты в ещё не опубликованном Harness minimal mode: max reasoning, top_p=0.95, temperature=1.0. Changelog предупреждает: Agent scores highly sensitive to harness choice — не приравнивайте к raw model capability. Это сигнал не мигрировать в prod по цифрам из press release alone.
Legacy model names: после 24 июля deepseek-chat / deepseek-reasoner offline — grep codebase на deepseek-v4-flash / deepseek-v4-pro
API vs local: cloud API уже указывает на V4-Flash-0731; local path — antirez ds4 + 96GB Mac benchmark
Cost baseline: cache hit $0.0028/M input, output $0.28/M — monthly estimate vs Kimi K3 ($15/M output)
Prod A/B: не мигрируйте по Harness-based official scores; blind test на своём codebase в Claude Code / Cursor
Track Harness + V4-Pro GA: DeepSeek changelog, Hugging Face, Artificial Analysis retest
Cache / safety classifier: community reports о низком cache hit rate и intermittent safety classifier timeout — measure latency и failure rate на своём workload до prod cutover
V4-Flash-0731 вышел в самое плотное окно open-source trillion-class релизов. Разделение third-party AA data и DeepSeek self-benchmarks даёт более честную картину.
| Model | Vendor | Release / weights | Total params | AA Intelligence Index | AA cost/task |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 31.07 official | 284B | 50 | $0.03 |
| Kimi K3 | Moonshot AI | 16.07 preview / 27.07 weights | 2.8T | 57 | $0.86 |
| GLM-5.2 | Z.ai | Июнь 2026 open | ~744B | ~1 pt above Flash | Not disclosed |
| Qwen3.8-Max | Alibaba | 03.08 GA, weights pending | 2.4T | Not in table | Not in table |
| GPT-5.6 Sol | OpenAI | Closed | Undisclosed | 9+ pts above Flash | $1.86 |
| Claude Fable 5 | Anthropic | Closed | Undisclosed | 9+ pts above Flash | $3.15 |
Парадокс: на AA composite index V4-Flash ниже Kimi K3 и GLM-5.2, но cost per task — ~1/29 от K3, ~1/62 от GPT-5.6 Sol, ~1/105 от Fable 5. DeepSeek играет не в «score #1», а в «достаточный интеллект + экстремальная цена». V4-Flash preview держал #1 на OpenRouter по volume семь недель подряд — тот же narrative.
Vs Claude Opus 4.8 (vendor list, не independent audit): cache miss input ~36× дешевле, cache hit input ~179×, output ~89×. Для Agent pipelines и batch workloads, где ceiling intelligence менее критичен, позиционирование V4-Flash-0731 однозначно.
В китайском dev-сообществе 「斩杀线» (zhǎn shā xiàn), или kill line — порог, который DeepSeek задаёт комбинацией «достаточно хорошо + экстремально дёшево». Если конкурент не обгоняет по capability и не может undercut по price, модель рискует потерять market relevance. Контекст — price war H2 2026 (в т.ч. GPT-5.6 Luna −80%).
До релиза V4-Flash-0731 ожидание «V4-Pro full GA к mid-July» сдвинулось — community шутила про основателя Лян Вэньфэна (梁文锋) как «梁白开» (обещания не сдержал). После сильного Flash-release narrative откатился к «梁圣» (пророк). Инцубаторный инвестор в интервью 21st Century Business Herald: «все крупные model labs бегут за Ляном; выжить можно только встав в очередь за DeepSeek» — иллюстрация kill line как industry psychology, не только pricing table.
DeepSeek выбрал не гонку «самая сильная модель», а «достаточный интеллект для массовых вызовов по цене, которую никто не повторит». Kill line — имя порога, который эта стратегия оставила на рынке.
Если планируете V4-Flash-0731 в Claude Code, OpenClaw или других long-session Agent на ноутбуке или flaky Linux VPS, типичные pain points — OOM, dropped sessions, missing Xcode/Metal toolchain. API дёшев, но для prod с stable SSH long sessions, DerivedData cache и iOS CI/CD automation, когда local Mac iron не тянет, NodeMini Mac Mini cloud rental — dedicated node, seconds provisioning, Agent и build jobs на одной real Mac machine. Local Flash inference: antirez ds4 + 96GB Mac benchmark. Specs и pricing: цены аренды Mac Mini. Onboarding: help center.
Sources: DeepSeek official API docs и changelog, tech report «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence», Hugging Face model cards, Artificial Analysis (via financial press), 21st Century Business Herald, Moonshot AI / Z.ai / Alibaba releases. Verify latest official announcements перед prod migration.
Нативный 1M context и резкое снижение compute/memory на длинных сессиях (official: V4-Pro — 27% FLOPs, 10% KV cache от V3.2 на 1M). V4-серия заточена под Agent и совместима с Claude Code, OpenCode и аналогами.
Для диалога, простых задач и массовых дешёвых вызовов V4-Flash-0731 — лучший cost/performance; Agent benches уже выше V4-Pro preview. Для max reasoning при большем бюджете — V4-Pro preview до GA, затем переоценка. Сравните TCO с ценами аренды Mac Mini.
На 5 августа 2026 — нет. Official release — только V4-Flash-0731, API-only. App и web-chat на старой сборке. V4-Pro GA и Harness — «как можно скорее»; «10–20 августа» — неподтверждённые слухи.
Разделяйте: SWE-bench Verified и подобные third-party — относительно надёжны. Agent scores (Terminal Bench 2.0 и др.) — unpublished Harness minimal mode; DeepSeek сам предупреждает о harness sensitivity. Ждите independent retest или A/B в Claude Code / Cursor на своём dataset.
При OpenAI/Anthropic-compatible API deepseek-v4-flash автоматически указывает на новую official сборку. Legacy deepseek-chat / deepseek-reasoner — migrate (sunset с 24 июля). Local inference: ds4 Mac benchmark. Remote Mac nodes: help center.