2026 年 7 月 31 日,DeepSeek 將 V4-Flash-0731 升級為官方正式版:同一套 284B 總參數、13B 激活架構不變,效能提升完全來自後訓練重做。Agent 類基準(Terminal Bench 2.0 82.7)反超自家更大的 V4-Pro 預覽版(67.9),定價僅 Claude Opus 4.8 的數十分之一。本文面向關注大模型選型與Agent 成本的開發者,完整涵蓋:4 月預覽至 7/31 正式版時間線、定價表與跑分對照 Opus 4.8、Harness 自研框架、與 Kimi K3 / GLM-5.2 / Qwen3.8-Max 六方橫向對比、跑分爭議、「斩杀线」產業背景、六步評估清單與 FAQ。旗艦 V4-Pro 官方版與 Harness 公開版仍「盡快發布」,截至發稿無確切日期。
這不是一次「新模型發布」,而是同一套 284B 參數模型重新做了一遍後訓練。以下時間線梳理已確認事件,幫助你在 Kimi K3、Qwen3.8-Max 與 V4-Flash 之間建立參照系。
| 日期 | 事件 |
|---|---|
| 4 月 24 日 | DeepSeek-V4 預覽版首次發布並開源:V4-Pro(1.6T / 49B 激活)與 V4-Flash(284B / 13B 激活),均支援 100 萬 token 上下文,MIT 協議 |
| 7 月 24 日 | 舊介面模型名 deepseek-chat 與 deepseek-reasoner 正式停用,全部流量切換至 V4 系列命名 |
| 7 月 27 日 | 月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造不小競爭壓力 |
| 7 月 31 日 | V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱將隨 V4 正式版一起發布。本次僅限 API,App 與網頁端未同步 |
| 8 月 2–3 日 | 阿里 Qwen3.8-Max 正式 GA,2.4T / 950 億激活,API 定價 $2/$6 |
| 截至 8 月 5 日 | V4-Pro 官方版仍「盡快發布」。媒體援引未署名消息稱內部測試於 7 月 28 日那週啟動、GA 窗口可能在 8 月 10–20 日——未經 DeepSeek 官方證實,僅供參考 |
核實提醒:本文資料截至 2026 年 8 月 5 日。V4-Pro 與 Harness 上線時間、高峰時段加價生效日、第三方復測結果可能隨時更新,生產遷移前請以 DeepSeek 官方 changelog 為準。
| 模型 | 狀態 | 總/激活參數 | 上下文 | 輸入(快取未命中/命中,每百萬 token) | 輸出(每百萬 token) | 協議 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 官方正式版(7/31) | 284B / 13B | 100 萬 | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 預覽版(4/24,官方版未發布) | 1.6T / 49B | 100 萬 | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(7/27) | 2.8T / 約 104B(社群估算) | 約 105 萬 | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 開源(2026 年 6 月) | 約 744B / 約 40B | 100 萬 | 本文未獨立核實 | 本文未獨立核實 | MIT |
| Qwen3.8-Max | API GA(8/2),權重待放出 | 2.4T / 95B | 100 萬 | $2.00 / 約 $0.17–0.25 | $6.00 | 承諾開源 |
註:以上定價均為廠商自報。DeepSeek 已預告未來 API 將啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布生效日期。
| 比較維度 | 倍率(V4-Flash 相對 Opus 4.8) |
|---|---|
| 輸入(快取未命中) | 約 36 倍便宜 |
| 輸入(快取命中) | 約 179 倍便宜 |
| 輸出 | 約 89 倍便宜 |
| 基準測試 | V4-Flash-0731 | V4-Pro 預覽版 | 備註 |
|---|---|---|---|
| Terminal Bench 2.0 | 82.7 | 67.9 | Harness minimal mode;max 檔、top_p=0.95、temperature=1.0 |
| Toolathlon 等 | 多項超 V4-Pro | — | 同 Harness 設定;官方稱對框架選擇高度敏感 |
註:Agent 類跑分為 DeepSeek 自報 + 特定 Harness 設定,與 Artificial Analysis 等第三方綜合指數方法不同,不可直接相加比較。
V4-Flash-0731 在參數規模與模型結構上與 4 月預覽版完全相同,官方明確說明效能提升「完全來自重新進行的後訓練」。284B 總參數、13B 激活的 Flash 版本,在多項 Agent 基準上反而超過參數量是自己好幾倍的 V4-Pro 預覽版——這印證 2026 年下半年的一個趨勢:後訓練資料品質與方法的重要性,正在逼近甚至超過單純堆參數。
依技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構上的三處關鍵改動沿用至今:
官方稱在 100 萬 token 上下文下,V4-Pro 相較 V3.2 單 token 推理 FLOPs 僅為 27%,KV 快取佔用僅 10%(V4-Flash 約 7%)。這些為廠商自報技術指標,尚未見獨立第三方復現,但若基本屬實,意味百萬級上下文有機會以接近主流長度的成本大規模商用。
7 月 31 日 changelog 首次正式出現 DeepSeek Harness——自研 Agent 執行框架,用於讓模型讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,定位對標 Claude Code。在此之前,DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。官方公布的 Agent 跑分全部是用 Harness「極簡模式」(minimal mode)測出來的,且 Harness 本身尚未公開發布。changelog 主動提示:「跑分對 harness 的選擇非常敏感,不能簡單等同於模型本身能力的提升」——這句話值得正視,而非當成客套話略過。
確認模型命名:若仍使用已停用的 deepseek-chat / deepseek-reasoner,盡快切換至 deepseek-v4-flash;OpenAI / Anthropic 格式接入無需改程式碼
建立成本基線:按 $0.14/$0.28 與快取命中 $0.0028 估算月度 token 帳單,與 Kimi K3($3/$15)、Qwen3.8-Max($2/$6)對照
最大化快取命中:將靜態 system prompt 置於前綴,重複前綴可壓至每百萬 token $0.0028,對 Agent 流水線成本影響極大
區分廠商自報與第三方指數:Terminal Bench 2.0 等 Harness 跑分勿與 Artificial Analysis Intelligence Index 直接橫比;各自獨立解讀
跑真實業務 A/B:用自有程式碼庫與 Kimi K3、Claude Code 等實際工具鏈盲審,勿僅憑官方表格遷移
本機部署評估:若需私有化推理,284B Flash 可透過 antirez ds4 引擎在 96GB 以上統一記憶體 Mac 上跑;頻寬與伺服器規格見 Mac Mini 租賃價格
| 模型 | 實驗室 | 發布/權重 | 總參數 | AA Intelligence Index | AA 單任務成本 |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 7/31 官方版 | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 7/16 預覽 / 7/27 權重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜 / Z.ai | 2026 年 6 月 | 約 744B | 比 V4-Flash 高約 1 分 | 本文未核實 |
| Qwen3.8-Max | 阿里巴巴 | 8/2 GA(權重待放出) | 2.4T | 本文未核實 | 本文未核實 |
| GPT-5.6 Sol | OpenAI | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | 未公開 | 比 V4-Flash 高 9 分以上 | $3.15 |
資料來源:Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測),經財經媒體轉引;DeepSeek 官方 Agent 跑分為廠商自報,兩組資料方法不同,分開列出。
一個值得留意的反差:在 Artificial Analysis 第三方綜合指數上,V4-Flash 的「智能分」並非最高,甚至落後 Kimi K3 與 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是夠用的智能 + 極致價格——這也是 V4-Flash 預覽版能在 OpenRouter 連續七週穩坐呼叫量第一的原因:目標用戶是大規模 Agent 與批量任務,而非爭「最強大模型」頭銜。
「智能分不是最高,但單任務成本最低」——這才是 V4-Flash 正式版真正的產品邏輯,跑分逼近 Opus 4.8 的敘事需要放在這個框架裡理解。
V4 正式版發布前,因 Pro 版本遲遲未兌現「7 月中旬全量上線」預期,中文 AI 社群一度把創辦人梁文鋒戲稱為「梁白開」(諧音「白等」「放空炮」)。V4-Flash-0731 上線後實際表現超出預期,網友又把「梁圣」稱號還了回去——這種戲謔式昵稱反轉,本身就是觀察中國 AI 社群情緒的有趣側面。
中文開發者社群流傳一個說法:「斩杀线」——DeepSeek 憑「夠用的性能 + 極端低價」給同行設下一條門檻。友商模型若性能沒有明顯超過 DeepSeek,又拿不出更低價格,就可能在市場上失去存在感。這也解釋了近期部分友商(如有報導稱 GPT-5.6 Luna 低價版一次性降價 80%)密集調整定價策略。一位 AI 創業孵化人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」
V4-Flash 正式版上線當天(7 月 31 日),英偉達、博通、AMD 等算力晶片股並未出現明顯波動——市場似乎已習慣「用更少算力做到同等效果」的敘事,不再簡單把效率突破等同於利空算力股。這與 2025 年初 DeepSeek-R1 發布時引發全球 AI 晶片股集體下跌形成鮮明對比,某程度上說明市場對中國大模型工程創新的認知已相對成熟。
若你計畫將 V4-Flash 接入 Claude Code、OpenCode 或自建 Agent 流水線,在筆電或不穩定 Linux VPS上跑長工作階段常面臨記憶體不足、SSH 中斷與工具鏈缺失。對於需要穩定遠端 SSH、DerivedData 快取與 iOS CI/CD 自動化的生產環境,在本機 Mac 算力不足時,NodeMini 的 Mac Mini 雲端租賃讓 Agent 與建置任務在同一台真實 Mac 上持續執行——獨佔節點、秒級撥備。詳見 Mac Mini 租賃價格,連線與部署細節見 說明中心。本機推理路徑可參考 antirez ds4 與 96GB UMA Mac 部署指南。
資料來源:DeepSeek 官方 API 文件與 changelog、技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》、Hugging Face 模型卡、Artificial Analysis(經財經媒體轉引)、21 世紀經濟報導、快科技、V2EX 社群討論。發布前請核實最新官方公告。
原生支援 100 萬 token 上下文,長上下文場景下計算與 KV 快取佔用大幅降低(官方稱 V4-Pro 在百萬 token 下 FLOPs 僅為 V3.2 的 27%、快取僅 10%)。V4 系列另針對 Agent 能力優化,可接入 Claude Code、OpenCode 等主流工具鏈。本機部署可參考 ds4 引擎指南。
批量處理、Agent 流水線或對成本敏感的大規模呼叫,V4-Flash-0731 官方版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務需要更深的世界知識或複雜推理且預算充裕,可暫用 V4-Pro 預覽版,待官方版 GA 後再評估是否切換。
截至 2026 年 8 月 5 日尚不能。目前官方版僅 V4-Flash-0731,且僅限 API;App 與網頁端未同步。V4-Pro 官方版與 Harness 框架官方口徑為「盡快發布」,網傳 8 月 10–20 日等窗口未經官方證實。伺服器規格與計費見 租賃價格說明。
建議區分對待。SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分是用尚未公開的 Harness 極簡模式測得,官方亦提示對框架選擇高度敏感。應等社群用 Claude Code、Cursor 等獨立復現後再下結論。
若已用 OpenAI 或 Anthropic 格式接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向新官方版。若仍使用已於 7 月 24 日停用的 deepseek-chat 或 deepseek-reasoner,須盡快切換。更多問題見 說明中心。