阿里 Qwen3.8-Max 發布:
2.4 萬億參數衝進 Arena 全球前五,下週開源

2026 年 8 月 3 日,阿里巴巴正式發布新一代旗艦大模型 千問 Qwen3.8-Max(總參數 2.4 萬億、激活 950 億100 萬 token 上下文),同步上線 Agent 產品「千問辦公」。本文面向關注大模型選型Agent 工作流成本的開發者,完整涵蓋:7 月–8 月發布時間線核心跑分與定價表MoE 架構深度拆解與 Kimi K3 / DeepSeek V4 / Claude 橫向對比「開源」標籤爭議產業背景六步評估清單FAQ。核心提醒:Arena 文字競技場第 5 名(1496 分,Preliminary)為目前唯一可引用的第三方訊號,其餘跑分均為阿里自測,權重開源承諾「下週」截至發稿尚未落地。

01

時間線:從預覽版到正式發布,兩週內節奏很快

2026 年 7–8 月是中國大模型「萬億參數」密集發布窗口。以下時間線梳理已確認事件與官方口徑,幫助你在 Kimi K3、DeepSeek V4-Flash 與 Qwen3.8-Max 之間建立參照系。

日期事件
7 月 16 日月之暗面發布 Kimi K3,2.8 萬億參數(896 個專家中激活 16 個),主打獨立評測與透明技術報告
7 月 19 日Qwen3.8-Max 以「預覽版」開放,接入 Token Plan / Qoder / QoderWork,價格為預計正式價的 10%,未公布激活參數與跑分表,服務條款禁止自動化生產環境呼叫
7 月 27 日Kimi K3 按承諾開源權重,上線 Hugging Face,並同步開源注意力核心、MoE 通訊函式庫等基礎設施
7 月 31 日DeepSeek 發布 V4-Flash 正式版,參數規模不變,智慧體與程式碼類基準大幅超過自家 V4-Pro 預覽版
8 月 3 日Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 同步上線;阿里港股當日上漲約 7%,美股上漲約 4.5%
預計 8 月 10 日前後Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope——截至發稿,具體日期與開源協議均未公布

開發者最該警惕的六個「資訊陷阱」

  1. 01

    把「Open-Source」標籤當已開源:官網 GA 當天即標註開源,但 Hugging Face / ModelScope 尚無儲存庫與授權條款

  2. 02

    總參數≠激活成本:2.4T 總參數下實際激活 950 億,推理帳單更接近千億級模型

  3. 03

    跑分表多為自測:PaperBench、RecreationBench 等為阿里自建基準,第三方尚未復現 GA 版

  4. 04

    Arena 排名為 Preliminary:1496 分、文字競技場第 5 名仍標註「初步」,非終局定論

  5. 05

    預覽版透明度不足:7 月預覽階段未公開激活參數、模型卡與安全評估,多家機構建議勿遷移生產

  6. 06

    競品腳註含爭議:對比表腳註暗示 Fable 5 跑分可能涉及 fallback,但阿里自身方法論同樣未完全公開

warning

核實提醒:本文資料截至 2026 年 8 月 4 日。開源權重上線時間、Arena 正式排名與第三方復測結果可能隨時更新,生產遷移前請以阿里官方公告與獨立評測為準。

02

核心資料一覽:Qwen3.8-Max 官方規格與跑分表

項目Qwen3.8-Max
發布日期2026 年 8 月 3 日(GA)
總參數 / 激活參數2.4 萬億 / 950 億
架構基於 Qwen3.5 的稀疏 MoE + 混合注意力
上下文視窗100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬)
輸入模態文字 / 圖像 / 影片
API 定價輸入 $2/百萬 token,輸出 $6/百萬 token(隱式快取命中 $0.25,顯式快取寫入 $2.5、讀取 $0.17)
中國大陸定價輸入 12 元/百萬 token,輸出 36 元/百萬 token,快取命中低至 1.5 元
Arena 文字競技場(8/1 快照)第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型
Arena 視覺競技場第 2 名,僅次於 Claude Fable 5
PaperBench(阿里自測)93.0(較上代 +28.2)
OSWorld-Verified(阿里自測)86.1
SWE-bench Pro(阿里自測)67.7(落後 Fable 5 的 80.0)
HLE(阿里自測)43.6(旗艦模型中最低,Fable 5 為 53.3)
權重開源狀態承諾「下週」,截至發稿未上線

註:帶「阿里自測」標註的資料均來自官方發布材料,尚無 Artificial Analysis、Arena.ai 等對正式版的獨立復現。

03

深度拆解:2.4 萬億參數背後,阿里想解決什麼問題?

為什麼是 MoE + 混合注意力,而不是單純堆參數?

Qwen3.8-Max 延續 Qwen3.5 架構路線,透過稀疏 MoE 把總參數做到 2.4 萬億,實際激活量控制在 950 億——推理成本更接近千億級模型,而非真正呼叫 2.4 萬億參數。這也是 API 定價能壓到 $2/$6(明顯低於 Claude Opus 5 的 $5/$25 與 Fable 5 的 $10/$50)的核心原因:用架構效率換價格競爭力

reasoning_effort 三檔設計:成本可控的標配

模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度調節速度與深度,支援 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位。

長程自主任務:賣點與驗證方式

阿里案例包括:16 天無人工介入的自主編碼專案、超過 500 步的晶片設計最佳化,以及自建 RecreationBench(黑箱環境下僅憑互動與視覺回饋還原真實應用程式)。部分過程記錄在 GitHub qwen-code-dev-bot/oh-my-cli 可查,但並非完整第三方稽核。

生態卡位:從模型到 Agent 產品的一體化

Qwen3.8-Max 同步接入「千問辦公」,API 相容 OpenAI 與 Anthropic 兩種協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈,降低遷移成本。

發布前六步評估清單(落地操作)

  1. 01

    區分 API 與權重:目前可透過 QwenCloud 呼叫 API;若需本機部署,等待 Qwen3.8-27B 開源或確認 Max 權重授權條款

  2. 02

    建立成本基線:按 $2/$6 與快取命中 $0.25 估算月度 token 帳單,與 Kimi K3($3/$15)做對照

  3. 03

    設定 reasoning_effort:對延遲敏感任務先用 medium/low,複雜 Agent 任務再開 xhigh

  4. 04

    跑真實業務 A/B:勿僅憑官方跑分遷移;用自有程式碼庫與 Kimi K3 做盲審對比

  5. 05

    追蹤第三方復測:關注 Artificial Analysis、Arena 正式排名與 Hugging Face 權重上線公告

  6. 06

    審查合規與資料出境:企業場景評估阿里雲服務條款、日誌留存與模型輸出稽核要求

04

橫向對比:Qwen3.8-Max、Kimi K3、DeepSeek V4 與 Claude

模型廠商總/激活參數上下文定價(輸入/輸出,每百萬 token)權重開源獨立評測
Qwen3.8-Max阿里巴巴2.4T / 950 億100 萬$2 / $6未開源(承諾中)暫無
Kimi K3月之暗面2.8T / 約 500 億約 104.8 萬$3 / $15已開源(7/27)AA Index ≈ 57.11
DeepSeek V4-ProDeepSeek1.6T / 490 億100 萬未公開完整表已開源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek未變100 萬未公開完整表已開源9 項智慧體/程式碼基準超 V4-Pro
Claude Opus 5Anthropic未公開100 萬$5 / $25閉源Arena 前列
Claude Fable 5Anthropic未公開100 萬$10 / $50閉源Arena 文字第 1

容易被忽略的細節:Kimi K3 與 DeepSeek 均較早公開激活參數量,阿里直到 GA 才補充披露「950 億」,預覽階段透明度不足是 7 月獨立評測機構批評的原因之一。唯一可比的獨立盲測(269 個檔案的真實專案架構任務)中,Kimi K3 得 83 分、Qwen3.8-Max 預覽版得 80 分——同檔位、互有勝負

「躋身全球第一梯隊」「穩壓 GPT-5.6 Sol 和 Fable 5」目前主要還是阿里的一面之詞——需等開源權重落地與第三方跑分上線後才能真正驗證。

05

爭議點與產業背景:「開源」標籤掛得比權重早

  • 官網已標 Open-Source,權重未發布:GA 當天打標,Hugging Face / ModelScope 無儲存庫、授權條款或確切日期
  • 跑分均來自自建框架:QwenSWEBench、CoWorkBench、RecreationBench 等,中立平台尚未復現 GA 版
  • 腳註暗指競品存疑:「Fable 5 的結果可能涉及 fallback」無技術細節支撐,阿里自身方法論同樣未完全公開
  • 預覽階段禁止生產呼叫:7 月 19 日預覽版 ToS 明確限制自動化生產環境,且無模型卡與安全評估

2026 年萬億參數競賽進入新階段

  • 參數競賽 vs 架構效率:DeepSeek V4-Flash 證明不靠堆參數也能大幅提升 Agent 能力,Qwen3.8-Max 的「大容量、低激活」是同一敘事延續
  • 阿里罕見回歸開源:首次承諾開源 Max 級權重,與 Kimi K3、DeepSeek 構成國產頭部「集體開放」格局
  • 消費端落地:Qwen 經壓縮後成為國行 Apple Intelligence 核心引擎,延伸至上億部 iPhone 系統級 AI
  • 資本市場反應:發布日港股漲約 7%、美股漲約 4.5%
  • 中美監管對照:同期白宮召集 OpenAI、Anthropic 等商討 Agent 網路安全測試框架——一邊加速開源,一邊收緊 Agent 審查

可引用關鍵資料速查

  • 規格:2.4T 總參數 / 950 億激活 / 1M 上下文 / 多模態輸入
  • 定價:API $2/$6;中國大陸 12/36 元每百萬 token
  • Arena:文字第 5(1496,Preliminary);視覺第 2
  • 獨立盲測:Kimi K3 83 vs Qwen 預覽 80(架構設計任務)
  • 開源承諾:Qwen3.8-Max + Qwen3.8-27B,預計 8 月 10 日前後

若你計畫將 Qwen3.8-Max 接入 Claude Code、Qoder 或 OpenClaw 等長工作階段 Agent,在筆電或不穩定 Linux VPS上跑 CLI 常面臨記憶體不足、工作階段中斷與 Xcode/Metal 工具鏈缺失。對於需要穩定 SSH 長工作階段、DerivedData 快取與 iOS CI/CD 自動化的生產環境,在本機 Mac 算力不足時,NodeMini 的 Mac Mini 雲端租賃通常是更優解——獨佔節點、秒級撥備,讓 Agent 與建置任務在同一台真實 Mac 上持續執行。詳見 Mac Mini 租賃價格

資料來源:阿里雲官方部落格與新聞稿、Arena.ai 排行榜(2026-08-01 快照)、Apidog / Yotta Labs / TechNode 等獨立分析、Apple Intelligence 中國版相關報導。發布前請核實最新官方公告。

FAQ

常見問題

API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 協定。權重尚未開源,官網雖標註 Open-Source,Hugging Face / ModelScope 儲存庫與協議條款預計「下週」(約 8 月 10 日前後)公布。接入環境可參考 Mac Mini 租賃價格

目前沒有權威統一評測。唯一獨立盲測顯示兩者非常接近(Kimi K3 83 分、Qwen 預覽 80 分),屬同檔位互有勝負。Kimi K3 優勢是已開源且有第三方資料;Qwen3.8-Max 優勢是 API 價格更低、多模態更全面。

需區分總參數與激活參數。實際激活 950 億,API 成本接近千億級模型。本機私有化部署完整版需多節點資料中心,普通開發者更現實的選擇是等待 Qwen3.8-27B 開源。

可作參考,不能當定論。資料來自阿里自建框架,中立平台尚未復現 GA 版。建議關注獨立評測復測,或在自有業務場景做 A/B 測試。

除更便宜的旗艦 API 外,國行 Apple Intelligence 的生成式 AI 能力基於經壓縮的 Qwen 模型本機執行,國內 iPhone 使用者將在系統層面直接受益。更多問題見 說明中心