DeepSeek V4 滿血版正式發布
峰谷計費 × SWE-bench 80.6% × 7月24日 API 遷移截止(2026)

若你正使用 deepseek-chat 或評估 DeepSeek V4 滿血版 是否值得切換——2026 年 7 月 20 日 GA 正式版上線,帶來 峰谷計費SWE-bench Verified 80.6%(開源最高)與 1M token 上下文,但 7 月 24 日舊介面永久下線。本文嚴格涵蓋源文件全部要點:4/24 預覽至 7/20 GA 時間線、V4-Pro/Flash 架構(CSA+HCA+mHC+Muon)、Benchmark 與 GPT-5.6 / Claude Fable 5 對比、峰谷定價全表、六步 API 遷移程式碼範例,並附痛點拆解、省錢策略與 FAQ最後更新:2026-07-20

01

DeepSeek V4 GA 上線:開發者必須面對的五大痛點

等了整整三個月,V4 預覽版終於「畢業」為滿血版。性能升級令人興奮,但配套的商業化與介面變更也帶來了真實摩擦——以下五點是目前整合團隊回饋最集中的問題:

  1. 01

    舊介面倒數計時:deepseek-chatdeepseek-reasoner 將於 7 月 24 日 15:59 UTC(北京時間 23:59) 永久下線,未遷移的生產流量將直接 404。

  2. 02

    峰谷計費複雜度:GA 首次引入分時電價式定價,工作日 09–12 與 14–18 點(北京時間)費率翻倍,24/7 Agent 流水線帳單預測難度上升。

  3. 03

    閉源旗艦仍領先最難基準:Claude Fable 5 在 SWE-bench Pro 達 80.3%,V4-Pro 僅 55.4%——極致多檔案儲存庫修復仍須付費旗艦。

  4. 04

    自託管硬體門檻:V4-Pro(1.6T/49B 啟用)無法在個人筆電執行;V4-Flash 雖可本地推理,但需 96GB+ 統一記憶體(參見 antirez ds4 + Mac 96GB 實測)。

  5. 05

    三種推理模式選型:Non-think / Think High / Think Max 需按任務匹配,誤用 Think Max 會消耗 384K+ 上下文配額,成本與延遲雙雙飆升。

  6. 06

    從「近乎免費」到「有規則商業平台」:即使 6 月永久降價 75% 後,峰谷機制意味著排程策略成為新的核心競爭力,而非單純比價。

從預覽版到滿血版:完整時間線

時間事件
2026-04-24V4 預覽版上線 + 開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B)
2026-05V4-Flash 與 V4-Pro 生產調優版本上線,API 正式可用
2026-06V4-Pro 價格永久降價 75%(輸出價 $0.87/M tokens)
2026-06-29DeepSeek 向全體 API 使用者發郵件,宣布 GA 將於 7 月中旬上線,首次披露峰谷計費
2026-07-19多位開發者獲 GA 灰度內測資格,媒體稱「滿血版最快明日發布」
2026-07-20GA 正式版上線(本文發布日)
2026-07-24舊介面 deepseek-chat / deepseek-reasoner 永久下線

「V4 預覽版已經很強,滿血版是在 Agent、數學推理與程式碼生成上的專項提升,同時配套正式商業化計費體系。」

02

V4-Pro 與 V4-Flash 架構:CSA + HCA 如何撐起 100 萬 token?

DeepSeek V4 拋棄了 V2/V3 的 MLA(多頭潛在注意力),採用 CSA + HCA 混合注意力mHC 殘差Muon 優化器,使 1M 上下文在工程上真正可服務。

規格V4-ProV4-Flash
總參數量1.6 萬億(1.6T)2840 億(284B)
每 Token 啟用490 億(49B)130 億(13B)
Transformer 層數61 層43 層
上下文視窗1,000,000 tokens1,000,000 tokens
最大輸出384K tokens384K tokens
精度FP4(專家權重)+ FP8(其餘)FP4 + FP8 混合
預訓練資料量33T+ tokens32T+ tokens
開源協議MITMIT

① 壓縮稀疏注意力(CSA)

  • KV 序列經 Softmax 門控池化壓縮 4 倍
  • FP4 精度「閃電索引器」做 top-k 稀疏選擇:V4-Pro top-1024,V4-Flash top-512
  • 保留最近 128 token 滑動視窗
  • 1M 上下文下推理 FLOPs 僅為 V3.2 的 27%

② 重度壓縮注意力(HCA)

  • Token 壓縮 128 倍後進行全域密集注意力,捕獲長程依賴
  • V4-Flash 前 2 層用 HCA,之後 CSA/HCA 交替;V4-Pro 結構類似
  • KV Cache 記憶體僅為 V3.2 的 10%(V4-Flash 低至 7%

③ mHC 與 Muon

  • mHC(流形約束超連接):4 通道殘差流,經滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣,穩定 61 層深網路訊號傳播
  • Muon 優化器:牛頓-舒爾茲正交化梯度,替代 AdamW,收斂更快、訓練更穩

三種推理模式與採樣參數

模式特點適用場景
Non-think無思維鏈,極速回應簡單問答、路由分發
Think High顯式推理(<redacted_thinking> 標籤)中等複雜任務、程式碼除錯
Think Max最大推理力度,需 384K+ 上下文複雜數學、長鏈路 Agent

官方推薦採樣參數(全模式通用):temperature=1.0, top_p=1.0

03

Benchmark 跑分:SWE-bench 80.6% 與 116 倍性價比差距

V4-Pro 在多項基準上刷新開源模型紀錄,但與閉源旗艦仍有差距——關鍵在於每任務成本

基準測試DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ 開源最高96.0%未單獨公布~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified 測試「真實 GitHub 儲存庫 Bug 修復」,V4-Pro 80.6% 與 Gemini 3.1 Pro 並列開源第一。SWE-bench Pro 更嚴格,Claude Fable 5 以 80.3% 領先。

Artificial Analysis 性價比對比

  • Claude Fable 5:Strategy & Ops 指數任務每次 $3.48,得分 50 分
  • DeepSeek V4-Pro:同類任務每次 $0.03,得分 38 分
  • DeepSeek V4-Flash:六類指數任務每次均低於 $0.04
  • 成本倍數:Fable 5 成本是 V4-Pro 的 116 倍,得分僅高約 12 分(31%)
info

信源:DeepSeek 官方文件、arXiv:2606.19348、HuggingFace 模型頁、Artificial Analysis、LLMReference。

04

對標 GPT-5.6 Sol 與 Claude Fable 5:選型決策矩陣

維度DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
開源✅ MIT 協議❌ 閉源❌ 閉源
可自託管✅ 支援
上下文視窗1M tokens未公開1M tokens
程式碼能力極強(接近 Fable 5)極強最強
API 輸出價(平時)$0.87/M tokens~$15/M$50/M
峰值輸出價$1.74/M tokens
Agent 能力強,支援多 Agent 編排最強
資料隱私✅ 可私有部署
  • 預算有限 / 高頻呼叫 / 私有部署:首選 V4-Pro 或 V4-Flash
  • 極致程式碼能力、不在乎成本:Claude Fable 5(SWE-bench Pro 最高)
  • 複雜演算法 + 數學推理:GPT-5.6 Sol / Ultra
  • 超大規模日誌/文件(低成本):V4-Flash 快取命中輸入僅 $0.0028/M

峰谷計費完整價格表(CNY + USD)

GA 版最受關注的變化:高峰時段(北京時間)工作日 09:00–12:00 與 14:00–18:00,費率翻倍。

模型計費項平時(Off-Peak)高峰(Peak)
V4-Pro輸入(快取命中)¥0.025 / $0.0035 / 1M tokens翻倍
輸入(快取未命中)¥3.00 / $0.435 / 1M tokens¥6.00 / $0.87
輸出¥6.00 / $0.87 / 1M tokens¥12.00 / $1.74
V4-Flash輸入(快取命中)¥0.02 / $0.0028 / 1M tokens翻倍
輸入(快取未命中)¥1.00 / $0.14 / 1M tokens¥2.00 / $0.28
輸出¥2.00 / $0.28 / 1M tokens¥4.00 / $0.56

四條省錢策略

  1. 01

    非即時任務排到非高峰:批次文件處理、資料標註、程式碼審查安排在 18:00 之後或 09:00 之前執行。

  2. 02

    善用快取命中:重複 System Prompt 建構 Prompt Cache,V4-Flash 快取命中僅 $0.0028/M,接近免費。

  3. 03

    Flash 做分流:簡單意圖識別、路由判斷用 V4-Flash,複雜推理再轉 V4-Pro,可省 60–80% 推理成本。

  4. 04

    關注帳單郵件:DeepSeek 承諾計費變更 24 小時前發郵件通知,確保帳戶信箱可收信。

即使高峰期,V4-Pro 輸出價($1.74/M)仍比 Claude Opus 4.8($15/M)與 GPT-5.6 Sol(~$15/M)便宜 8.6 倍

05

API 遷移六步指南:7 月 24 日截止前必做清單

warning

重要警告:舊模型名 deepseek-chatdeepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) 永久停止存取。

舊模型名新模型名備註
deepseek-chatdeepseek-v4-flash(非思考模式)速度快,適合輕量任務
deepseek-reasonerdeepseek-v4-flash(思考模式)或 deepseek-v4-pro升級 Pro 獲取更強推理
  1. 01

    全庫搜尋舊模型名:在程式碼庫中檢索 deepseek-chatdeepseek-reasoner,含環境變數與 CI 設定。

  2. 02

    確定遷移對應:輕量對話 → deepseek-v4-flash;原 reasoner 工作流 → Flash 思考模式或 deepseek-v4-pro

  3. 03

    更新 OpenAI SDK 呼叫:僅改 model 參數;思考模式透過 extra_body 啟用(見下方程式碼)。

  4. 04

    驗證 Anthropic SDK 相容:base_url 保持 https://api.deepseek.com,更新 model 即可。

  5. 05

    Staging 迴歸測試:在 7 月 24 日前於預發環境跑通核心 Agent / RAG 鏈路,確認峰谷時段帳單符合預期。

  6. 06

    生產灰度切換:按流量比例逐步切到新模型名,保留回滾開關至截止日前。

  7. 07

    Think Max 上下文檢查:若啟用 Think Max,確保上下文視窗設為 384K+,避免推理截斷。

python
# ❌ 舊寫法(7月24日後失效)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# ✅ 新寫法
client.chat.completions.create(
    model="deepseek-v4-pro",          # 或 deepseek-v4-flash
    messages=[...],
    # 控制思考模式:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
python
# Anthropic SDK 接入
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

可引用硬核資料(EEAT)

  • KV Cache 壓縮:1M 上下文下 V4-Pro KV 記憶體為 V3.2 的 10%,V4-Flash 7%
  • 推理 FLOPs:CSA 使 1M 場景 FLOPs 降至 V3.2 的 27%
  • 6 月永久降價:V4-Pro 輸出從原價降至 $0.87/M(75% off),後再疊加峰谷機制
  • 併發上限:V4-Pro 預設 500 併發,中型 Agent 叢集無需企業銷售流程

DeepSeek V4 GA 讓雲端 API 成本大幅下降,但本地跑 V4-Flash 仍需 96GB 統一記憶體 Mac,廉價 Linux VPS 又無法執行 xcodebuild、notarytool 等 macOS 工具鏈。若團隊同時維護 雲端 DeepSeek API 呼叫iOS CI/CD / CLI Agent 長會話,把 macOS 重負載放在可獨佔的遠端節點通常比押注本地硬體更穩——API 定價再低也解決不了 Keychain 隔離與 SSH 會話穩定性問題。對需要穩定 SSH 長會話、可預期頻寬的生產環境,NodeMini 的 Mac Mini 雲端租賃通常是更優解:無論 V4 峰谷價如何波動,執行層節點保持不變。規格見 租賃價格說明,接入見 說明中心;本地 Flash 推理可參考 antirez ds4 + 96GB Mac 租賃實測

最後更新:2026-07-20。請在 7 月 24 日前完成 API 遷移。

FAQ

常見問題

架構未變,GA 版在 Agent、數學推理與程式碼生成上專項提升,並首次引入峰谷計費。舊模型名將於 7 月 24 日下線。遷移期間可參考 租賃價格說明 規劃 Agent 執行層預算。

北京時間工作日 09:00–12:0014:00–18:00 為高峰(費率翻倍)。非即時任務排到 18:00 後或 09:00 前,善用 Prompt Cache,簡單任務走 V4-Flash 分流。

deepseek-chatdeepseek-v4-flash(非思考);deepseek-reasoner → Flash 思考模式或 deepseek-v4-pro。截止 7 月 24 日 23:59 北京時間

SWE-bench Verified 上 V4-Pro 80.6% 為開源最高,但 Claude Fable 5 達 96%。若看重成本與自託管,V4-Pro 輸出 $0.87/M 約為 GPT-5.6 Sol 的 1/17;若追求極致多檔案修復,Fable 5 仍領先。更多遠端開發環境見 說明中心

可以。ds4 支援在 96GB 統一記憶體 Mac 上執行 V4-Flash(284B/13B 啟用);V4-Pro(1.6T)仍需雲端 vLLM/SGLang。詳見 antirez ds4 Mac 租賃實測

簡單問答用 Non-think;程式碼除錯用 Think High;複雜數學與長鏈路 Agent 用 Think Max(需 384K+ 上下文)。全模式推薦 temperature=1.0, top_p=1.0