若你正使用 deepseek-chat 或评估 DeepSeek V4 满血版 是否值得切换——2026 年 7 月 20 日 GA 正式版上线,带来 峰谷计费、SWE-bench Verified 80.6%(开源最高)与 1M token 上下文,但 7 月 24 日旧接口永久下线。本文严格覆盖源文档全部要点:4/24 预览至 7/20 GA 时间线、V4-Pro/Flash 架构(CSA+HCA+mHC+Muon)、Benchmark 与 GPT-5.6 / Claude Fable 5 对比、峰谷定价全表、六步 API 迁移代码示例,并附痛点拆解、省钱策略与 FAQ。最后更新:2026-07-20
等了整整三个月,V4 预览版终于「毕业」为满血版。性能升级令人兴奋,但配套的商业化与接口变更也带来了真实摩擦——以下五点是目前集成团队反馈最集中的问题:
旧接口倒计时:deepseek-chat 与 deepseek-reasoner 将于 7 月 24 日 15:59 UTC(北京时间 23:59) 永久下线,未迁移的生产流量将直接 404。
峰谷计费复杂度:GA 首次引入分时电价式定价,工作日 09–12 与 14–18 点(北京时间)费率翻倍,24/7 Agent 流水线账单预测难度上升。
闭源旗舰仍领先最难基准:Claude Fable 5 在 SWE-bench Pro 达 80.3%,V4-Pro 仅 55.4%——极致多文件仓库修复仍须付费旗舰。
自托管硬件门槛:V4-Pro(1.6T/49B 激活)无法在个人笔电运行;V4-Flash 虽可本地推理,但需 96GB+ 统一内存(参见 antirez ds4 + Mac 96GB 实测)。
三种推理模式选型:Non-think / Think High / Think Max 需按任务匹配,误用 Think Max 会消耗 384K+ 上下文配额,成本与延迟双双飙升。
从「近乎免费」到「有规则商业平台」:即使 6 月永久降价 75% 后,峰谷机制意味着调度策略成为新的核心竞争力,而非单纯比价。
| 时间 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版上线 + 开源(MIT),含 V4-Pro(1.6T)与 V4-Flash(284B) |
| 2026-05 | V4-Flash 与 V4-Pro 生产调优版本上线,API 正式可用 |
| 2026-06 | V4-Pro 价格永久降价 75%(输出价 $0.87/M tokens) |
| 2026-06-29 | DeepSeek 向全体 API 用户发邮件,宣布 GA 将于 7 月中旬上线,首次披露峰谷计费 |
| 2026-07-19 | 多位开发者获 GA 灰度内测资格,媒体称「满血版最快明日发布」 |
| 2026-07-20 | GA 正式版上线(本文发布日) |
| 2026-07-24 | 旧接口 deepseek-chat / deepseek-reasoner 永久下线 |
「V4 预览版已经很强,满血版是在 Agent、数学推理与代码生成上的专项提升,同时配套正式商业化计费体系。」
DeepSeek V4 抛弃了 V2/V3 的 MLA(多头潜在注意力),采用 CSA + HCA 混合注意力、mHC 残差与 Muon 优化器,使 1M 上下文在工程上真正可服务。
| 规格 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数量 | 1.6 万亿(1.6T) | 2840 亿(284B) |
| 每 Token 激活 | 490 亿(49B) | 130 亿(13B) |
| Transformer 层数 | 61 层 | 43 层 |
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 384K tokens | 384K tokens |
| 精度 | FP4(专家权重)+ FP8(其余) | FP4 + FP8 混合 |
| 预训练数据量 | 33T+ tokens | 32T+ tokens |
| 开源协议 | MIT | MIT |
| 模式 | 特点 | 适用场景 |
|---|---|---|
| Non-think | 无思维链,极速响应 | 简单问答、路由分发 |
| Think High | 显式推理(<redacted_thinking> 标签) | 中等复杂任务、代码调试 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 复杂数学、长链路 Agent |
官方推荐采样参数(全模式通用):temperature=1.0, top_p=1.0
V4-Pro 在多项基准上刷新开源模型纪录,但与闭源旗舰仍有差距——关键在于每任务成本。
| 基准测试 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 开源最高 | 96.0% | 未单独公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 测试「真实 GitHub 仓库 Bug 修复」,V4-Pro 80.6% 与 Gemini 3.1 Pro 并列开源第一。SWE-bench Pro 更严格,Claude Fable 5 以 80.3% 领先。
信源:DeepSeek 官方文档、arXiv:2606.19348、HuggingFace 模型页、Artificial Analysis、LLMReference。
| 维度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 开源 | ✅ MIT 协议 | ❌ 闭源 | ❌ 闭源 |
| 可自托管 | ✅ 支持 | ❌ | ❌ |
| 上下文窗口 | 1M tokens | 未公开 | 1M tokens |
| 代码能力 | 极强(接近 Fable 5) | 极强 | 最强 |
| API 输出价(平时) | $0.87/M tokens | ~$15/M | $50/M |
| 峰值输出价 | $1.74/M tokens | — | — |
| Agent 能力 | 强,支持多 Agent 编排 | 强 | 最强 |
| 数据隐私 | ✅ 可私有部署 | ❌ | ❌ |
GA 版最受关注的变化:高峰时段(北京时间)工作日 09:00–12:00 与 14:00–18:00,费率翻倍。
| 模型 | 计费项 | 平时(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 输入(缓存命中) | ¥0.025 / $0.0035 / 1M tokens | 翻倍 |
| 输入(缓存未命中) | ¥3.00 / $0.435 / 1M tokens | ¥6.00 / $0.87 | |
| 输出 | ¥6.00 / $0.87 / 1M tokens | ¥12.00 / $1.74 | |
| V4-Flash | 输入(缓存命中) | ¥0.02 / $0.0028 / 1M tokens | 翻倍 |
| 输入(缓存未命中) | ¥1.00 / $0.14 / 1M tokens | ¥2.00 / $0.28 | |
| 输出 | ¥2.00 / $0.28 / 1M tokens | ¥4.00 / $0.56 |
非实时任务排到非高峰:批量文档处理、数据标注、代码审查安排在 18:00 之后或 09:00 之前运行。
善用缓存命中:重复 System Prompt 构建 Prompt Cache,V4-Flash 缓存命中仅 $0.0028/M,接近免费。
Flash 做分流:简单意图识别、路由判断用 V4-Flash,复杂推理再转 V4-Pro,可省 60–80% 推理成本。
关注账单邮件:DeepSeek 承诺计费变更 24 小时前发邮件通知,确保账户邮箱可收信。
即使高峰期,V4-Pro 输出价($1.74/M)仍比 Claude Opus 4.8($15/M)与 GPT-5.6 Sol(~$15/M)便宜 8.6 倍。
重要警告:旧模型名 deepseek-chat 和 deepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC(北京时间 7 月 24 日 23:59) 永久停止访问。
| 旧模型名 | 新模型名 | 备注 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,适合轻量任务 |
deepseek-reasoner | deepseek-v4-flash(思考模式)或 deepseek-v4-pro | 升级 Pro 获取更强推理 |
全仓搜索旧模型名:在代码库中检索 deepseek-chat 与 deepseek-reasoner,含环境变量与 CI 配置。
确定迁移映射:轻量对话 → deepseek-v4-flash;原 reasoner 工作流 → Flash 思考模式或 deepseek-v4-pro。
更新 OpenAI SDK 调用:仅改 model 参数;思考模式通过 extra_body 启用(见下方代码)。
验证 Anthropic SDK 兼容:base_url 保持 https://api.deepseek.com,更新 model 即可。
Staging 回归测试:在 7 月 24 日前于预发环境跑通核心 Agent / RAG 链路,确认峰谷时段账单符合预期。
生产灰度切换:按流量比例逐步切到新模型名,保留回滚开关至截止日前。
Think Max 上下文检查:若启用 Think Max,确保上下文窗口设为 384K+,避免推理截断。
# ❌ 旧写法(7月24日后失效)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# ✅ 新写法
client.chat.completions.create(
model="deepseek-v4-pro", # 或 deepseek-v4-flash
messages=[...],
# 控制思考模式:
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# Anthropic SDK 接入
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
DeepSeek V4 GA 让云端 API 成本大幅下降,但本地跑 V4-Flash 仍需 96GB 统一内存 Mac,廉价 Linux VPS 又无法运行 xcodebuild、notarytool 等 macOS 工具链。若团队同时维护 云端 DeepSeek API 调用与 iOS CI/CD / CLI Agent 长会话,把 macOS 重负载放在可独占的远程节点通常比押注本地硬件更稳——API 定价再低也解决不了 Keychain 隔离与 SSH 会话稳定性问题。对需要稳定 SSH 长会话、可预期带宽的生产环境,NodeMini 的 Mac Mini 云端租赁通常是更优解:无论 V4 峰谷价如何波动,执行层节点保持不变。规格见 租赁价格说明,接入见 帮助中心;本地 Flash 推理可参考 antirez ds4 + 96GB Mac 租赁实测。
最后更新:2026-07-20。请在 7 月 24 日前完成 API 迁移。
架构未变,GA 版在 Agent、数学推理与代码生成上专项提升,并首次引入峰谷计费。旧模型名将于 7 月 24 日下线。迁移期间可参考 租赁价格说明 规划 Agent 执行层预算。
北京时间工作日 09:00–12:00 与 14:00–18:00 为高峰(费率翻倍)。非实时任务排到 18:00 后或 09:00 前,善用 Prompt Cache,简单任务走 V4-Flash 分流。
deepseek-chat → deepseek-v4-flash(非思考);deepseek-reasoner → Flash 思考模式或 deepseek-v4-pro。截止 7 月 24 日 23:59 北京时间。
SWE-bench Verified 上 V4-Pro 80.6% 为开源最高,但 Claude Fable 5 达 96%。若看重成本与自托管,V4-Pro 输出 $0.87/M 约为 GPT-5.6 Sol 的 1/17;若追求极致多文件修复,Fable 5 仍领先。更多远程开发环境见 帮助中心。
可以。ds4 支持在 96GB 统一内存 Mac 上运行 V4-Flash(284B/13B 激活);V4-Pro(1.6T)仍需云端 vLLM/SGLang。详见 antirez ds4 Mac 租赁实测。
简单问答用 Non-think;代码调试用 Think High;复杂数学与长链路 Agent 用 Think Max(需 384K+ 上下文)。全模式推荐 temperature=1.0, top_p=1.0。