7月31日,DeepSeek将 V4-Flash-0731 升级为官方版:同一套 284B 总参数、13B 激活 架构不变,性能跃升完全来自后训练重做——不是新模型,却能在 Agent 基准上反超自家 1.6T 的 V4-Pro 预览版,定价仅为 Claude Opus 4.8 的数十分之一 📉。旗舰 V4-Pro 官方版 与自研 Harness Agent 框架仍「即将发布」,没有确切日期。本文面向关注大模型选型与Agent 调用成本的开发者,完整覆盖:六大痛点拆解、官方定价表与 Opus 4.8 倍率对照、CSA+HCA 架构与 Harness 争议、与 Kimi K3 / GLM-5.2 / Qwen3.8-Max 六方横向对比、「斩杀线」产业背景、六步评估清单与 FAQ。关键硬数据:Flash 输入 $0.14 / $0.0028(缓存未命中/命中),输出 $0.28/百万 token;Terminal Bench 2.0 82.7 vs V4-Pro 预览 67.9——均为 Harness 极简模式厂商自报。
V4-Flash 正式版低调上线,营销叙事很热闹,但集成团队反馈的摩擦点同样真实。以下六点是目前中文开发者社区讨论最集中的「卡点」:
「官方版」认知混乱:这不是新模型发布,而是同一个 284B 模型重新做了一遍后训练。很多人误以为 V4「满血版」已全面上线,实际上旗舰 V4-Pro 官方版仍未放出。
旧接口已永久停用:7 月 24 日起 deepseek-chat 与 deepseek-reasoner 正式下线,未迁移的生产流量将直接失败,须切换至 deepseek-v4-flash 等新命名。
API 独占、端侧未同步:7 月 31 日正式版仅限 API,DeepSeek App 与网页端暂未更新——消费端体验与 API 能力存在明显落差。
Harness 跑分难以横向对比:Terminal Bench 2.0 等 Agent 分数全部基于尚未公开发布的 Harness「极简模式」测得,官方 changelog 明确警告「对 harness 选择高度敏感」,不能直接套用到 Claude Code 或 Cursor。
缓存命中与稳定性隐患:据 21 世纪经济报道援引海外开发者反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题,与「跑分暴涨」叙事形成反差。
Pro 与 Harness 上线时间仍是传言:媒体援引未署名消息源称 V4-Pro 可能在 8 月 10–20 日 GA,但 DeepSeek 官方仅说「尽快发布」——把猜测当计划是常见踩坑点。
核实提醒:本文数据截至 2026 年 8 月 5 日。V4-Pro GA 日期、Harness 公开发布、高峰时段 2 倍加价生效日与第三方复测结果可能随时变化,生产迁移前请以 DeepSeek 官方 changelog 为准。
| 模型 | 状态 | 总参数 / 激活参数 | 上下文 | 输入价格(缓存未命中/命中,每百万 token) | 输出价格(每百万 token) | 协议 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(2026-07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 预览版(2026-04-24,官方版未发布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3(月之暗面) | 权重开源(2026-07-27) | 2.8T / 约 104B(社区估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2(智谱/Z.ai) | 开源(2026 年 6 月) | ~744B / ~40B | 1M | 未在本文核实范围内 | 未在本文核实范围内 | MIT |
| Qwen3.8-Max(阿里) | API 可用(2026-08-02),权重待放出 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 官方承诺开源 |
说明:以上定价均为 DeepSeek、Moonshot、阿里等官方公开数据,属于「厂商自报」信息;DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。
| 比较维度 | 倍率(V4-Flash 相对 Opus 4.8) |
|---|---|
| 输入(缓存未命中) | 约 36 倍 便宜 |
| 输入(缓存命中) | 约 179 倍 便宜 |
| 输出 | 约 89 倍 便宜 |
更完整的 V4 系列 GA 定价与峰谷计费说明,可参考我们的 DeepSeek V4 满血版发布解读。
这次最容易被忽略、但其实最关键的一点是:V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」,而非扩大模型规模。284B 总参数、13B 激活的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——这也从侧面印证了一个行业趋势:2026 年下半年大模型竞争中,后训练数据质量与方法的重要性正在逼近甚至超过单纯堆参数。
根据 DeepSeek 发布的技术报告(《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》),V4 系列在架构上做了三处关键改动:
三项改动叠加的效果是:在 100 万 token 上下文场景下,V4-Pro 相比前代 V3.2,单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%。这是 DeepSeek 官方公布的技术指标,尚未看到独立第三方机构的复现验证,但如果基本属实,意味着「百万级上下文」第一次有可能以接近主流上下文长度的成本大规模商用,而不只是一个营销参数。
7 月 31 日的 changelog 里第一次正式出现 DeepSeek Harness 这个名字——这是 DeepSeek 自研的 Agent 执行框架,用于让模型读写文件、调用工具、执行命令、完成端到端的工程任务,对标的产品是 Claude Code。在此之前,DeepSeek 的模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具来完成类似任务。
官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「极简模式」(minimal mode)测出来的,参数设置为 max 档位、top_p=0.95、temperature=1.0,且 Harness 本身尚未公开发布。DeepSeek 在 changelog 里主动提示:「跑分对 harness(执行框架)的选择非常敏感,不能简单等同于模型本身能力的提升」——这句话本身就值得读者留意,而非当成客套话略过。
Agent 类 headline 跑分是「厂商自报 + 特定框架」结果。在第三方用 Claude Code、Cursor 等工具独立复现之前,不要把 Terminal Bench 2.0 的数字当作可移植的通用能力声明。
DeepSeek-V4-Flash 的这次更新,恰好卡在中国大模型开源阵营最密集的窗口期——Kimi K3 7 月 27 日刚开源权重,阿里 Qwen3.8-Max 8 月 2 日 GA。把几家近期动作放在一起看,格局会更清楚:
| 模型 | 实验室 | 发布/权重开放时间 | 总参数 | AA Intelligence Index | 单任务平均成本(AA) |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 2026-07-31(官方版) | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 2026-07-16 预览 / 07-27 权重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 2026 年 6 月 | ~744B | 比 V4-Flash 高约 1 分 | 未在本次调研范围内核实 |
| Qwen3.8-Max | 阿里 | 2026-08-02 GA(权重待放出) | 2.4T | 未在本次调研范围内核实 | 未在本次调研范围内核实 |
| GPT-5.6 Sol | OpenAI | 闭源 | 未公开 | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic | 闭源 | 未公开 | 比 V4-Flash 高 9 分以上 | $3.15 |
数据来源标注:Intelligence Index 与单任务成本数据引自研究机构 Artificial Analysis(第三方独立评测),经财经媒体转引;DeepSeek 官方跑分为厂商自报,两组数据的评测方法和权重不完全一致,不能直接相加比较,本文分开列出以示区分。
可以看到一个有意思的反差 🔍:在 Artificial Analysis 这个第三方综合指数上,V4-Flash 的「智能分」其实不是最高的,甚至落后于 Kimi K3 和 GLM-5.2;但它的单任务成本只有 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 这次打的不是「跑分第一」,而是够用的智能 + 极致的价格——这也是为什么 V4-Flash 预览版能在 OpenRouter 上连续七周稳坐调用量第一:它的目标用户是需要大规模调用、对绝对智能上限没那么敏感的 Agent 和批量任务场景,而不是要争「最强大模型」的头衔。
在 V4 正式版发布之前,因为 Pro 版本迟迟没有兑现此前「7 月中旬全量上线」的预期,中文 AI 社区一度把 DeepSeek 创始人梁文锋戏称为「梁白开」(谐音「白等」「放空炮」)。V4-Flash-0731 上线后,因为实际表现超出预期,不少网友又把「梁圣」的称号还了回去——这种戏谑式的昵称反转,本身就是观察中国 AI 社区情绪风向的一个有趣侧面。
更值得关注的是一个在中文开发者社区流传的说法:「斩杀线」。意思是 DeepSeek 凭借「够用的性能 + 极端低价」的组合,给同行设下了一条门槛——友商的模型如果性能没有明显超过 DeepSeek,又拿不出更低的价格,就会在市场上失去存在感。这也解释了近期一些友商(比如有报道提到 GPT-5.6 Luna 低价版一次性降价 80%)为何密集调整定价策略。一位从事 AI 创业孵化的业内人士对 21 世纪经济报道的评价颇为形象:「所有大模型公司都在梁文锋前面奔跑,不管用什么方式,都必须跑到 DeepSeek 前面才能生存。」
从更大的行业背景看,V4-Flash 正式版上线当天(7 月 31 日),英伟达、博通、AMD 等算力芯片股并未出现明显波动——市场似乎已经习惯了「DeepSeek 式效率突破」这种叙事,不再简单把「用更少算力做到同等效果」等同于「利空算力股」。这和 2025 年初 DeepSeek-R1 发布时引发全球 AI 芯片股集体下跌的场景形成了鲜明对比。
确认 API 端点:核实 deepseek-v4-flash 已指向 0731 官方构建;7 月 24 日起 deepseek-chat 与 deepseek-reasoner 已停用
按 workload 选 Flash 或 Pro:V4-Flash-0731 在成本与 Harness 自报 Agent 分数上均优于 V4-Pro 预览版;深度世界知识任务可暂用 Pro 预览版,待官方 GA 再评估
按缓存分层建模成本:输入 $0.14(缓存未命中)vs $0.0028(缓存命中)——缓存策略会显著改变相对 Claude 的价差倍数(输入端 36 倍至 179 倍)
Harness 跑分勿直接外推:不要把 Terminal Bench 2.0 分数直接套用到 Claude Code 或 Cursor,须在你的技术栈上独立复现
真实业务 A/B 盲测:用自有代码库对照 Kimi K3 或当前主力模型,勿仅凭厂商表格全量迁移
跟踪官方 changelog:忽略未经证实的 8 月 10–20 日传言,关注 V4-Pro GA 与 Harness 公开发布,以及高峰时段 2 倍加价生效时间
若你计划将 V4-Flash 接入 Claude Code、OpenCode 或 OpenClaw 跑长会话 Agent 流水线,在笔记本或不稳定的 Linux VPS 上常面临内存压力、SSH 断连与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境——或在 96GB 统一内存 Mac 上跑本地 ds4 推理——NodeMini Mac Mini 云租赁通常是更稳妥的选择:独占节点、秒级开通,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格与 帮助中心;本地部署路径可参考 ds4 引擎与 96GB UMA Mac 部署指南,V4 系列整体定价背景见 V4 满血版发布解读。
数据来源:DeepSeek 官方 API 文档与更新日志(api-docs.deepseek.com)、DeepSeek-V4 技术报告及 Hugging Face 模型卡、Artificial Analysis(经财经媒体转引)、21 世纪经济报道、快科技、V2EX 社区讨论、Moonshot AI、智谱/Z.ai、阿里云官方发布信息。发布前请务必核实最新定价、跑分及 V4-Pro/Harness 上线状态,本文所有数据截至 2026 年 8 月 5 日。
最直接的区别是原生支持 100 万 token 上下文,且长上下文场景下的计算和显存开销大幅降低(官方数据:V4-Pro 在百万 token 上下文下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配了 Claude Code、OpenCode 等主流 Agent 工具。
如果只是普通对话、简单任务或者需要大规模、低成本调用(比如批量处理、Agent 流水线),目前的 V4-Flash-0731 官方版性价比更高,且 Agent 跑分已经反超 V4-Pro 预览版。如果任务涉及更深的世界知识或复杂推理,且预算不敏感,可以先用 V4-Pro 预览版,等官方版上线后再评估是否需要切换。
截至 2026 年 8 月 5 日,还不能。目前上线的官方版只有 V4-Flash-0731,且仅限 API 调用,App 和网页端还是旧版本。V4-Pro 官方版和自研 Harness 框架官方口径是「尽快发布」,没有确切上线日期,网上流传的「8 月 10–20 日」等具体时间是未经证实的传言。
建议区分对待。像 SWE-bench Verified 这类被广泛采用、方法论透明的第三方基准,可信度相对较高;但 Terminal Bench 2.0 等 Agent 类跑分是用 DeepSeek 自研且未公开的 Harness 测出来的,官方自己也提示这类数字对框架选择高度敏感,建议等社区用其他 Agent 工具(Claude Code、Cursor 等)独立复现后再下结论。
如果你在用 OpenAI ChatCompletions 或 Anthropic 格式的 API 接入 DeepSeek,不需要改代码,deepseek-v4-flash 这个 model 名会自动指向新的官方版本。如果你此前用的是已经停用的 deepseek-chat 或 deepseek-reasoner,需要尽快切换到新命名,官方已在 7 月 24 日正式停用旧名称。