DeepSeek V4 Flash正式版评测
跑分逼近 Opus 4.8 · Harness × 斩杀线 × 后训练升级

7月31日,DeepSeek将 V4-Flash-0731 升级为官方版:同一套 284B 总参数、13B 激活 架构不变,性能跃升完全来自后训练重做——不是新模型,却能在 Agent 基准上反超自家 1.6T 的 V4-Pro 预览版,定价仅为 Claude Opus 4.8 的数十分之一 📉。旗舰 V4-Pro 官方版 与自研 Harness Agent 框架仍「即将发布」,没有确切日期。本文面向关注大模型选型Agent 调用成本的开发者,完整覆盖:六大痛点拆解官方定价表与 Opus 4.8 倍率对照CSA+HCA 架构与 Harness 争议Kimi K3 / GLM-5.2 / Qwen3.8-Max 六方横向对比「斩杀线」产业背景六步评估清单FAQ。关键硬数据:Flash 输入 $0.14 / $0.0028(缓存未命中/命中),输出 $0.28/百万 token;Terminal Bench 2.0 82.7 vs V4-Pro 预览 67.9——均为 Harness 极简模式厂商自报。

01

开发者必须正视的六大痛点

V4-Flash 正式版低调上线,营销叙事很热闹,但集成团队反馈的摩擦点同样真实。以下六点是目前中文开发者社区讨论最集中的「卡点」:

  1. 01

    「官方版」认知混乱:这不是新模型发布,而是同一个 284B 模型重新做了一遍后训练。很多人误以为 V4「满血版」已全面上线,实际上旗舰 V4-Pro 官方版仍未放出。

  2. 02

    旧接口已永久停用:7 月 24 日起 deepseek-chatdeepseek-reasoner 正式下线,未迁移的生产流量将直接失败,须切换至 deepseek-v4-flash 等新命名。

  3. 03

    API 独占、端侧未同步:7 月 31 日正式版仅限 API,DeepSeek App 与网页端暂未更新——消费端体验与 API 能力存在明显落差。

  4. 04

    Harness 跑分难以横向对比:Terminal Bench 2.0 等 Agent 分数全部基于尚未公开发布的 Harness「极简模式」测得,官方 changelog 明确警告「对 harness 选择高度敏感」,不能直接套用到 Claude Code 或 Cursor。

  5. 05

    缓存命中与稳定性隐患:据 21 世纪经济报道援引海外开发者反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题,与「跑分暴涨」叙事形成反差。

  6. 06

    Pro 与 Harness 上线时间仍是传言:媒体援引未署名消息源称 V4-Pro 可能在 8 月 10–20 日 GA,但 DeepSeek 官方仅说「尽快发布」——把猜测当计划是常见踩坑点。

warning

核实提醒:本文数据截至 2026 年 8 月 5 日。V4-Pro GA 日期、Harness 公开发布、高峰时段 2 倍加价生效日与第三方复测结果可能随时变化,生产迁移前请以 DeepSeek 官方 changelog 为准。

02

核心数据一览:定价表与 Opus 4.8 对照

模型状态总参数 / 激活参数上下文输入价格(缓存未命中/命中,每百万 token)输出价格(每百万 token)协议
DeepSeek-V4-Flash-0731官方正式版(2026-07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro预览版(2026-04-24,官方版未发布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3(月之暗面)权重开源(2026-07-27)2.8T / 约 104B(社区估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2(智谱/Z.ai)开源(2026 年 6 月)~744B / ~40B1M未在本文核实范围内未在本文核实范围内MIT
Qwen3.8-Max(阿里)API 可用(2026-08-02),权重待放出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00官方承诺开源

说明:以上定价均为 DeepSeek、Moonshot、阿里等官方公开数据,属于「厂商自报」信息;DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。

与 Claude Opus 4.8 的价格倍率(据 21 世纪经济报道转引)

比较维度倍率(V4-Flash 相对 Opus 4.8)
输入(缓存未命中)36 倍 便宜
输入(缓存命中)179 倍 便宜
输出89 倍 便宜

Agent 跑分速查(Harness 极简模式,厂商自报)

  • Terminal Bench 2.0:V4-Flash-0731 82.7 vs V4-Pro 预览版 67.9
  • 架构效率(V4-Pro vs V3.2,百万 token):单 token FLOPs 仅 27%,KV Cache 仅 10%
  • Artificial Analysis(独立):Intelligence Index 50,单任务平均成本 $0.03

更完整的 V4 系列 GA 定价与峰谷计费说明,可参考我们的 DeepSeek V4 满血版发布解读

03

深度拆解:架构不变,后训练与 Harness 才是关键

参数规模没变,变的是后训练

这次最容易被忽略、但其实最关键的一点是:V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」,而非扩大模型规模。284B 总参数、13B 激活的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——这也从侧面印证了一个行业趋势:2026 年下半年大模型竞争中,后训练数据质量与方法的重要性正在逼近甚至超过单纯堆参数

混合注意力机制:CSA+HCA、mHC、Muon 优化器

根据 DeepSeek 发布的技术报告(《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》),V4 系列在架构上做了三处关键改动:

  • 混合注意力架构:结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),官方对外统一称为「DSA 稀疏注意力」,核心目的是在长上下文场景下降低计算和显存开销
  • 流形约束超连接(mHC):对传统残差连接结构做了改进
  • Muon 优化器:替换传统优化器,用于提升训练收敛速度和稳定性

三项改动叠加的效果是:在 100 万 token 上下文场景下,V4-Pro 相比前代 V3.2,单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%。这是 DeepSeek 官方公布的技术指标,尚未看到独立第三方机构的复现验证,但如果基本属实,意味着「百万级上下文」第一次有可能以接近主流上下文长度的成本大规模商用,而不只是一个营销参数。

Harness:DeepSeek 自研 Agent 框架首次亮相

7 月 31 日的 changelog 里第一次正式出现 DeepSeek Harness 这个名字——这是 DeepSeek 自研的 Agent 执行框架,用于让模型读写文件、调用工具、执行命令、完成端到端的工程任务,对标的产品是 Claude Code。在此之前,DeepSeek 的模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具来完成类似任务。

官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「极简模式」(minimal mode)测出来的,参数设置为 max 档位、top_p=0.95、temperature=1.0,且 Harness 本身尚未公开发布。DeepSeek 在 changelog 里主动提示:「跑分对 harness(执行框架)的选择非常敏感,不能简单等同于模型本身能力的提升」——这句话本身就值得读者留意,而非当成客套话略过。

Agent 类 headline 跑分是「厂商自报 + 特定框架」结果。在第三方用 Claude Code、Cursor 等工具独立复现之前,不要把 Terminal Bench 2.0 的数字当作可移植的通用能力声明。

04

横向对比:中国开源大模型的「六边形混战」

DeepSeek-V4-Flash 的这次更新,恰好卡在中国大模型开源阵营最密集的窗口期——Kimi K3 7 月 27 日刚开源权重,阿里 Qwen3.8-Max 8 月 2 日 GA。把几家近期动作放在一起看,格局会更清楚:

模型实验室发布/权重开放时间总参数AA Intelligence Index单任务平均成本(AA)
DeepSeek-V4-Flash-0731DeepSeek2026-07-31(官方版)284B50$0.03
Kimi K3月之暗面2026-07-16 预览 / 07-27 权重2.8T57$0.86
GLM-5.2智谱/Z.ai2026 年 6 月~744B比 V4-Flash 高约 1 分未在本次调研范围内核实
Qwen3.8-Max阿里2026-08-02 GA(权重待放出)2.4T未在本次调研范围内核实未在本次调研范围内核实
GPT-5.6 SolOpenAI闭源未公开比 V4-Flash 高 9 分以上$1.86
Claude Fable 5Anthropic闭源未公开比 V4-Flash 高 9 分以上$3.15

数据来源标注:Intelligence Index 与单任务成本数据引自研究机构 Artificial Analysis(第三方独立评测),经财经媒体转引;DeepSeek 官方跑分为厂商自报,两组数据的评测方法和权重不完全一致,不能直接相加比较,本文分开列出以示区分。

可以看到一个有意思的反差 🔍:在 Artificial Analysis 这个第三方综合指数上,V4-Flash 的「智能分」其实不是最高的,甚至落后于 Kimi K3 和 GLM-5.2;但它的单任务成本只有 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 这次打的不是「跑分第一」,而是够用的智能 + 极致的价格——这也是为什么 V4-Flash 预览版能在 OpenRouter 上连续七周稳坐调用量第一:它的目标用户是需要大规模调用、对绝对智能上限没那么敏感的 Agent 和批量任务场景,而不是要争「最强大模型」的头衔。

05

争议、斩杀线与开发者行动指南

跑分好看,不代表没有水分

  • 跑分方法依赖 Harness,官方自己都在提醒别只看数字。V4-Flash-0731 公布的 Agent 类跑分(Terminal Bench 2.0 拿到 82.7 分)全部基于 DeepSeek 自研且尚未公开发布的 Harness 极简模式测得。在独立社区复现之前,应视为「厂商自报+特定框架」结果。
  • 海外开发者反馈了具体的可用性问题。据 21 世纪经济报道援引的海外开发者社区反馈,V4-Flash 正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题,算力和参数储备仍是限制模型能力上限的现实瓶颈。
  • V4-Pro 官方版和 Harness 的具体上线时间目前未经证实。多家中文媒体报道「内部测试」和「8 月 10–20 日 GA」等具体窗口,但均为未署名消息源,DeepSeek 官方 changelog 的原话只是「将尽快发布」。
  • 企业融资与 IPO 传闻同样需要谨慎对待。多家媒体报道 DeepSeek 近期完成一轮约 74 亿美元融资,估值约 487 亿美元;也有报道称公司正在筹备新一轮约 710 亿美元估值的融资并为 IPO 做准备。这些信息目前主要来自财经媒体的「据报道」「消息人士称」,尚无 DeepSeek 官方或监管备案文件的直接确认。

从「梁白开」到「梁圣」:社群情绪的戏谑反转

在 V4 正式版发布之前,因为 Pro 版本迟迟没有兑现此前「7 月中旬全量上线」的预期,中文 AI 社区一度把 DeepSeek 创始人梁文锋戏称为「梁白开」(谐音「白等」「放空炮」)。V4-Flash-0731 上线后,因为实际表现超出预期,不少网友又把「梁圣」的称号还了回去——这种戏谑式的昵称反转,本身就是观察中国 AI 社区情绪风向的一个有趣侧面。

「斩杀线」(kill line):够用性能 + 极端低价的门槛

更值得关注的是一个在中文开发者社区流传的说法:「斩杀线」。意思是 DeepSeek 凭借「够用的性能 + 极端低价」的组合,给同行设下了一条门槛——友商的模型如果性能没有明显超过 DeepSeek,又拿不出更低的价格,就会在市场上失去存在感。这也解释了近期一些友商(比如有报道提到 GPT-5.6 Luna 低价版一次性降价 80%)为何密集调整定价策略。一位从事 AI 创业孵化的业内人士对 21 世纪经济报道的评价颇为形象:「所有大模型公司都在梁文锋前面奔跑,不管用什么方式,都必须跑到 DeepSeek 前面才能生存。」

从更大的行业背景看,V4-Flash 正式版上线当天(7 月 31 日),英伟达、博通、AMD 等算力芯片股并未出现明显波动——市场似乎已经习惯了「DeepSeek 式效率突破」这种叙事,不再简单把「用更少算力做到同等效果」等同于「利空算力股」。这和 2025 年初 DeepSeek-R1 发布时引发全球 AI 芯片股集体下跌的场景形成了鲜明对比。

六步评估清单:迁移前请逐项核对

  1. 01

    确认 API 端点:核实 deepseek-v4-flash 已指向 0731 官方构建;7 月 24 日起 deepseek-chatdeepseek-reasoner 已停用

  2. 02

    按 workload 选 Flash 或 Pro:V4-Flash-0731 在成本与 Harness 自报 Agent 分数上均优于 V4-Pro 预览版;深度世界知识任务可暂用 Pro 预览版,待官方 GA 再评估

  3. 03

    按缓存分层建模成本:输入 $0.14(缓存未命中)vs $0.0028(缓存命中)——缓存策略会显著改变相对 Claude 的价差倍数(输入端 36 倍至 179 倍)

  4. 04

    Harness 跑分勿直接外推:不要把 Terminal Bench 2.0 分数直接套用到 Claude Code 或 Cursor,须在你的技术栈上独立复现

  5. 05

    真实业务 A/B 盲测:用自有代码库对照 Kimi K3 或当前主力模型,勿仅凭厂商表格全量迁移

  6. 06

    跟踪官方 changelog:忽略未经证实的 8 月 10–20 日传言,关注 V4-Pro GA 与 Harness 公开发布,以及高峰时段 2 倍加价生效时间

若你计划将 V4-Flash 接入 Claude Code、OpenCode 或 OpenClaw 跑长会话 Agent 流水线,在笔记本或不稳定的 Linux VPS 上常面临内存压力、SSH 断连与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境——或在 96GB 统一内存 Mac 上跑本地 ds4 推理——NodeMini Mac Mini 云租赁通常是更稳妥的选择:独占节点、秒级开通,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格帮助中心;本地部署路径可参考 ds4 引擎与 96GB UMA Mac 部署指南,V4 系列整体定价背景见 V4 满血版发布解读

数据来源:DeepSeek 官方 API 文档与更新日志(api-docs.deepseek.com)、DeepSeek-V4 技术报告及 Hugging Face 模型卡、Artificial Analysis(经财经媒体转引)、21 世纪经济报道、快科技、V2EX 社区讨论、Moonshot AI、智谱/Z.ai、阿里云官方发布信息。发布前请务必核实最新定价、跑分及 V4-Pro/Harness 上线状态,本文所有数据截至 2026 年 8 月 5 日。

FAQ

常见问题

最直接的区别是原生支持 100 万 token 上下文,且长上下文场景下的计算和显存开销大幅降低(官方数据:V4-Pro 在百万 token 上下文下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配了 Claude Code、OpenCode 等主流 Agent 工具。

如果只是普通对话、简单任务或者需要大规模、低成本调用(比如批量处理、Agent 流水线),目前的 V4-Flash-0731 官方版性价比更高,且 Agent 跑分已经反超 V4-Pro 预览版。如果任务涉及更深的世界知识或复杂推理,且预算不敏感,可以先用 V4-Pro 预览版,等官方版上线后再评估是否需要切换。

截至 2026 年 8 月 5 日,还不能。目前上线的官方版只有 V4-Flash-0731,且仅限 API 调用,App 和网页端还是旧版本。V4-Pro 官方版和自研 Harness 框架官方口径是「尽快发布」,没有确切上线日期,网上流传的「8 月 10–20 日」等具体时间是未经证实的传言。

建议区分对待。像 SWE-bench Verified 这类被广泛采用、方法论透明的第三方基准,可信度相对较高;但 Terminal Bench 2.0 等 Agent 类跑分是用 DeepSeek 自研且未公开的 Harness 测出来的,官方自己也提示这类数字对框架选择高度敏感,建议等社区用其他 Agent 工具(Claude Code、Cursor 等)独立复现后再下结论。

如果你在用 OpenAI ChatCompletions 或 Anthropic 格式的 API 接入 DeepSeek,不需要改代码,deepseek-v4-flash 这个 model 名会自动指向新的官方版本。如果你此前用的是已经停用的 deepseek-chatdeepseek-reasoner,需要尽快切换到新命名,官方已在 7 月 24 日正式停用旧名称。