DeepSeek V4-Flash 正式版:
跑分逼近 Opus 4.8,Harness 框架與「斩杀线」怎麼看?

2026 年 7 月 31 日,DeepSeek 將 V4-Flash-0731 升級為官方正式版:同一套 284B 總參數、13B 激活架構不變,效能提升完全來自後訓練重做。Agent 類基準(Terminal Bench 2.0 82.7)反超自家更大的 V4-Pro 預覽版(67.9),定價僅 Claude Opus 4.8 的數十分之一。本文面向關注大模型選型Agent 成本的開發者,完整涵蓋:4 月預覽至 7/31 正式版時間線定價表與跑分對照 Opus 4.8Harness 自研框架與 Kimi K3 / GLM-5.2 / Qwen3.8-Max 六方橫向對比跑分爭議「斩杀线」產業背景六步評估清單FAQ。旗艦 V4-Pro 官方版與 Harness 公開版仍「盡快發布」,截至發稿無確切日期。

01

時間線:從 4 月預覽到 7/31 正式版,三個月連續動作

這不是一次「新模型發布」,而是同一套 284B 參數模型重新做了一遍後訓練。以下時間線梳理已確認事件,幫助你在 Kimi K3、Qwen3.8-Max 與 V4-Flash 之間建立參照系。

日期事件
4 月 24 日DeepSeek-V4 預覽版首次發布並開源:V4-Pro(1.6T / 49B 激活)與 V4-Flash(284B / 13B 激活),均支援 100 萬 token 上下文,MIT 協議
7 月 24 日舊介面模型名 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換至 V4 系列命名
7 月 27 日月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造不小競爭壓力
7 月 31 日V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱將隨 V4 正式版一起發布。本次僅限 API,App 與網頁端未同步
8 月 2–3 日阿里 Qwen3.8-Max 正式 GA,2.4T / 950 億激活,API 定價 $2/$6
截至 8 月 5 日V4-Pro 官方版仍「盡快發布」。媒體援引未署名消息稱內部測試於 7 月 28 日那週啟動、GA 窗口可能在 8 月 10–20 日——未經 DeepSeek 官方證實,僅供參考
warning

核實提醒:本文資料截至 2026 年 8 月 5 日。V4-Pro 與 Harness 上線時間、高峰時段加價生效日、第三方復測結果可能隨時更新,生產遷移前請以 DeepSeek 官方 changelog 為準。

02

核心資料一覽:定價表、跑分與 Opus 4.8 對照

模型狀態總/激活參數上下文輸入(快取未命中/命中,每百萬 token)輸出(每百萬 token)協議
V4-Flash-0731官方正式版(7/31)284B / 13B100 萬$0.14 / $0.0028$0.28MIT
V4-Pro預覽版(4/24,官方版未發布)1.6T / 49B100 萬$0.435 / $0.003625$0.87MIT
Kimi K3權重開源(7/27)2.8T / 約 104B(社群估算)約 105 萬$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2開源(2026 年 6 月)約 744B / 約 40B100 萬本文未獨立核實本文未獨立核實MIT
Qwen3.8-MaxAPI GA(8/2),權重待放出2.4T / 95B100 萬$2.00 / 約 $0.17–0.25$6.00承諾開源

註:以上定價均為廠商自報。DeepSeek 已預告未來 API 將啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布生效日期。

與 Claude Opus 4.8 的價格倍率(據 21 世紀經濟報導轉引)

比較維度倍率(V4-Flash 相對 Opus 4.8)
輸入(快取未命中)36 倍便宜
輸入(快取命中)179 倍便宜
輸出89 倍便宜

Agent 跑分:廠商自報(Harness 極簡模式)

基準測試V4-Flash-0731V4-Pro 預覽版備註
Terminal Bench 2.082.767.9Harness minimal mode;max 檔、top_p=0.95、temperature=1.0
Toolathlon 等多項超 V4-Pro同 Harness 設定;官方稱對框架選擇高度敏感

註:Agent 類跑分為 DeepSeek 自報 + 特定 Harness 設定,與 Artificial Analysis 等第三方綜合指數方法不同,不可直接相加比較。

03

深度拆解:架構不變,後訓練與 Harness 才是關鍵

參數規模沒變,變的是後訓練

V4-Flash-0731 在參數規模與模型結構上與 4 月預覽版完全相同,官方明確說明效能提升「完全來自重新進行的後訓練」。284B 總參數、13B 激活的 Flash 版本,在多項 Agent 基準上反而超過參數量是自己好幾倍的 V4-Pro 預覽版——這印證 2026 年下半年的一個趨勢:後訓練資料品質與方法的重要性,正在逼近甚至超過單純堆參數

混合注意力:CSA + HCA、mHC、Muon 優化器

依技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構上的三處關鍵改動沿用至今:

  • 混合注意力架構:結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),對外統稱 DSA 稀疏注意力,降低長上下文場景的計算與顯存開銷
  • 流形約束超連接(mHC):改進傳統殘差連接結構
  • Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性

官方稱在 100 萬 token 上下文下,V4-Pro 相較 V3.2 單 token 推理 FLOPs 僅為 27%,KV 快取佔用僅 10%(V4-Flash 約 7%)。這些為廠商自報技術指標,尚未見獨立第三方復現,但若基本屬實,意味百萬級上下文有機會以接近主流長度的成本大規模商用。

Harness:DeepSeek 首次自研 Agent 框架

7 月 31 日 changelog 首次正式出現 DeepSeek Harness——自研 Agent 執行框架,用於讓模型讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,定位對標 Claude Code。在此之前,DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。官方公布的 Agent 跑分全部是用 Harness「極簡模式」(minimal mode)測出來的,且 Harness 本身尚未公開發布。changelog 主動提示:「跑分對 harness 的選擇非常敏感,不能簡單等同於模型本身能力的提升」——這句話值得正視,而非當成客套話略過。

遷移前六步評估清單

  1. 01

    確認模型命名:若仍使用已停用的 deepseek-chat / deepseek-reasoner,盡快切換至 deepseek-v4-flash;OpenAI / Anthropic 格式接入無需改程式碼

  2. 02

    建立成本基線:按 $0.14/$0.28 與快取命中 $0.0028 估算月度 token 帳單,與 Kimi K3($3/$15)、Qwen3.8-Max($2/$6)對照

  3. 03

    最大化快取命中:將靜態 system prompt 置於前綴,重複前綴可壓至每百萬 token $0.0028,對 Agent 流水線成本影響極大

  4. 04

    區分廠商自報與第三方指數:Terminal Bench 2.0 等 Harness 跑分勿與 Artificial Analysis Intelligence Index 直接橫比;各自獨立解讀

  5. 05

    跑真實業務 A/B:用自有程式碼庫與 Kimi K3、Claude Code 等實際工具鏈盲審,勿僅憑官方表格遷移

  6. 06

    本機部署評估:若需私有化推理,284B Flash 可透過 antirez ds4 引擎在 96GB 以上統一記憶體 Mac 上跑;頻寬與伺服器規格見 Mac Mini 租賃價格

04

橫向對比:六方混戰與 Artificial Analysis 反差

模型實驗室發布/權重總參數AA Intelligence IndexAA 單任務成本
V4-Flash-0731DeepSeek7/31 官方版284B50$0.03
Kimi K3月之暗面7/16 預覽 / 7/27 權重2.8T57$0.86
GLM-5.2智譜 / Z.ai2026 年 6 月約 744B比 V4-Flash 高約 1 分本文未核實
Qwen3.8-Max阿里巴巴8/2 GA(權重待放出)2.4T本文未核實本文未核實
GPT-5.6 SolOpenAI閉源未公開比 V4-Flash 高 9 分以上$1.86
Claude Fable 5Anthropic閉源未公開比 V4-Flash 高 9 分以上$3.15

資料來源:Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測),經財經媒體轉引;DeepSeek 官方 Agent 跑分為廠商自報,兩組資料方法不同,分開列出。

一個值得留意的反差:在 Artificial Analysis 第三方綜合指數上,V4-Flash 的「智能分」並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是夠用的智能 + 極致價格——這也是 V4-Flash 預覽版能在 OpenRouter 連續七週穩坐呼叫量第一的原因:目標用戶是大規模 Agent 與批量任務,而非爭「最強大模型」頭銜。

「智能分不是最高,但單任務成本最低」——這才是 V4-Flash 正式版真正的產品邏輯,跑分逼近 Opus 4.8 的敘事需要放在這個框架裡理解。

05

爭議、斩杀线與產業背景

跑分好看,不代表沒有水分

  • 跑分依賴 Harness,官方自己都在提醒:Terminal Bench 2.0 82.7 等數字基於尚未公開的 Harness 極簡模式,在 Hugging Face 博主、海外開發者論壇復現之前,應視為「廠商自報 + 特定框架」結果
  • 海外開發者回報可用性問題:據 21 世紀經濟報導援引社群回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題,算力與參數儲備仍是限制上限的現實瓶頸
  • V4-Pro 與 Harness 上線時間未證實:媒體報導「8 月 10–20 日 GA」等窗口均來自未署名消息,官方 changelog 原話僅「將盡快發布」
  • 融資與 IPO 傳聞需謹慎:多家媒體報導約 74 億美元融資、估值約 487 億美元及新一輪 IPO 籌備,目前主要來自「據報導」「消息人士稱」,尚無官方或監管備案直接確認

從「梁白開」到「梁圣」:社群情緒的戲謔反轉

V4 正式版發布前,因 Pro 版本遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度把創辦人梁文鋒戲稱為「梁白開」(諧音「白等」「放空炮」)。V4-Flash-0731 上線後實際表現超出預期,網友又把「梁圣」稱號還了回去——這種戲謔式昵稱反轉,本身就是觀察中國 AI 社群情緒的有趣側面。

「斩杀线」(kill line):夠用性能 + 極端低價的門檻

中文開發者社群流傳一個說法:「斩杀线」——DeepSeek 憑「夠用的性能 + 極端低價」給同行設下一條門檻。友商模型若性能沒有明顯超過 DeepSeek,又拿不出更低價格,就可能在市場上失去存在感。這也解釋了近期部分友商(如有報導稱 GPT-5.6 Luna 低價版一次性降價 80%)密集調整定價策略。一位 AI 創業孵化人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」

算力股反應:市場已習慣「DeepSeek 式效率」

V4-Flash 正式版上線當天(7 月 31 日),英偉達、博通、AMD 等算力晶片股並未出現明顯波動——市場似乎已習慣「用更少算力做到同等效果」的敘事,不再簡單把效率突破等同於利空算力股。這與 2025 年初 DeepSeek-R1 發布時引發全球 AI 晶片股集體下跌形成鮮明對比,某程度上說明市場對中國大模型工程創新的認知已相對成熟。

可引用關鍵資料速查

  • 規格:284B 總參數 / 13B 激活 / 100 萬上下文 / MIT 開源權重
  • 定價:輸入 $0.14/$0.0028(快取命中);輸出 $0.28;相對 Opus 4.8 約 36–179 倍價差
  • Agent 跑分:Terminal Bench 2.0 82.7 vs V4-Pro 預覽 67.9(Harness 自報)
  • AA 指數:Intelligence Index 50,單任務 $0.03;落後 Kimi K3(57 / $0.86)但成本極低
  • 待發布:V4-Pro 官方版、Harness 公開版——無確切日期

若你計畫將 V4-Flash 接入 Claude Code、OpenCode 或自建 Agent 流水線,在筆電或不穩定 Linux VPS上跑長工作階段常面臨記憶體不足、SSH 中斷與工具鏈缺失。對於需要穩定遠端 SSH、DerivedData 快取與 iOS CI/CD 自動化的生產環境,在本機 Mac 算力不足時,NodeMini 的 Mac Mini 雲端租賃讓 Agent 與建置任務在同一台真實 Mac 上持續執行——獨佔節點、秒級撥備。詳見 Mac Mini 租賃價格,連線與部署細節見 說明中心。本機推理路徑可參考 antirez ds4 與 96GB UMA Mac 部署指南

資料來源:DeepSeek 官方 API 文件與 changelog、技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》、Hugging Face 模型卡、Artificial Analysis(經財經媒體轉引)、21 世紀經濟報導、快科技、V2EX 社群討論。發布前請核實最新官方公告。

FAQ

常見問題

原生支援 100 萬 token 上下文,長上下文場景下計算與 KV 快取佔用大幅降低(官方稱 V4-Pro 在百萬 token 下 FLOPs 僅為 V3.2 的 27%、快取僅 10%)。V4 系列另針對 Agent 能力優化,可接入 Claude Code、OpenCode 等主流工具鏈。本機部署可參考 ds4 引擎指南

批量處理、Agent 流水線或對成本敏感的大規模呼叫,V4-Flash-0731 官方版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務需要更深的世界知識或複雜推理且預算充裕,可暫用 V4-Pro 預覽版,待官方版 GA 後再評估是否切換。

截至 2026 年 8 月 5 日尚不能。目前官方版僅 V4-Flash-0731,且僅限 API;App 與網頁端未同步。V4-Pro 官方版與 Harness 框架官方口徑為「盡快發布」,網傳 8 月 10–20 日等窗口未經官方證實。伺服器規格與計費見 租賃價格說明

建議區分對待。SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分是用尚未公開的 Harness 極簡模式測得,官方亦提示對框架選擇高度敏感。應等社群用 Claude Code、Cursor 等獨立復現後再下結論。

若已用 OpenAI 或 Anthropic 格式接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向新官方版。若仍使用已於 7 月 24 日停用的 deepseek-chatdeepseek-reasoner,須盡快切換。更多問題見 說明中心