2026 年 8 月 3 日,阿里巴巴正式發布新一代旗艦大模型 千問 Qwen3.8-Max(總參數 2.4 萬億、激活 950 億、100 萬 token 上下文),同步上線 Agent 產品「千問辦公」。本文面向關注大模型選型與Agent 工作流成本的開發者,完整涵蓋:7 月–8 月發布時間線、核心跑分與定價表、MoE 架構深度拆解、與 Kimi K3 / DeepSeek V4 / Claude 橫向對比、「開源」標籤爭議、產業背景、六步評估清單與 FAQ。核心提醒:Arena 文字競技場第 5 名(1496 分,Preliminary)為目前唯一可引用的第三方訊號,其餘跑分均為阿里自測,權重開源承諾「下週」截至發稿尚未落地。
2026 年 7–8 月是中國大模型「萬億參數」密集發布窗口。以下時間線梳理已確認事件與官方口徑,幫助你在 Kimi K3、DeepSeek V4-Flash 與 Qwen3.8-Max 之間建立參照系。
| 日期 | 事件 |
|---|---|
| 7 月 16 日 | 月之暗面發布 Kimi K3,2.8 萬億參數(896 個專家中激活 16 個),主打獨立評測與透明技術報告 |
| 7 月 19 日 | Qwen3.8-Max 以「預覽版」開放,接入 Token Plan / Qoder / QoderWork,價格為預計正式價的 10%,未公布激活參數與跑分表,服務條款禁止自動化生產環境呼叫 |
| 7 月 27 日 | Kimi K3 按承諾開源權重,上線 Hugging Face,並同步開源注意力核心、MoE 通訊函式庫等基礎設施 |
| 7 月 31 日 | DeepSeek 發布 V4-Flash 正式版,參數規模不變,智慧體與程式碼類基準大幅超過自家 V4-Pro 預覽版 |
| 8 月 3 日 | Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 同步上線;阿里港股當日上漲約 7%,美股上漲約 4.5% |
| 預計 8 月 10 日前後 | Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope——截至發稿,具體日期與開源協議均未公布 |
把「Open-Source」標籤當已開源:官網 GA 當天即標註開源,但 Hugging Face / ModelScope 尚無儲存庫與授權條款
總參數≠激活成本:2.4T 總參數下實際激活 950 億,推理帳單更接近千億級模型
跑分表多為自測:PaperBench、RecreationBench 等為阿里自建基準,第三方尚未復現 GA 版
Arena 排名為 Preliminary:1496 分、文字競技場第 5 名仍標註「初步」,非終局定論
預覽版透明度不足:7 月預覽階段未公開激活參數、模型卡與安全評估,多家機構建議勿遷移生產
競品腳註含爭議:對比表腳註暗示 Fable 5 跑分可能涉及 fallback,但阿里自身方法論同樣未完全公開
核實提醒:本文資料截至 2026 年 8 月 4 日。開源權重上線時間、Arena 正式排名與第三方復測結果可能隨時更新,生產遷移前請以阿里官方公告與獨立評測為準。
| 項目 | Qwen3.8-Max |
|---|---|
| 發布日期 | 2026 年 8 月 3 日(GA) |
| 總參數 / 激活參數 | 2.4 萬億 / 950 億 |
| 架構 | 基於 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文視窗 | 100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬) |
| 輸入模態 | 文字 / 圖像 / 影片 |
| API 定價 | 輸入 $2/百萬 token,輸出 $6/百萬 token(隱式快取命中 $0.25,顯式快取寫入 $2.5、讀取 $0.17) |
| 中國大陸定價 | 輸入 12 元/百萬 token,輸出 36 元/百萬 token,快取命中低至 1.5 元 |
| Arena 文字競技場(8/1 快照) | 第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型 |
| Arena 視覺競技場 | 第 2 名,僅次於 Claude Fable 5 |
| PaperBench(阿里自測) | 93.0(較上代 +28.2) |
| OSWorld-Verified(阿里自測) | 86.1 |
| SWE-bench Pro(阿里自測) | 67.7(落後 Fable 5 的 80.0) |
| HLE(阿里自測) | 43.6(旗艦模型中最低,Fable 5 為 53.3) |
| 權重開源狀態 | 承諾「下週」,截至發稿未上線 |
註:帶「阿里自測」標註的資料均來自官方發布材料,尚無 Artificial Analysis、Arena.ai 等對正式版的獨立復現。
Qwen3.8-Max 延續 Qwen3.5 架構路線,透過稀疏 MoE 把總參數做到 2.4 萬億,實際激活量控制在 950 億——推理成本更接近千億級模型,而非真正呼叫 2.4 萬億參數。這也是 API 定價能壓到 $2/$6(明顯低於 Claude Opus 5 的 $5/$25 與 Fable 5 的 $10/$50)的核心原因:用架構效率換價格競爭力。
模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度調節速度與深度,支援 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位。
阿里案例包括:16 天無人工介入的自主編碼專案、超過 500 步的晶片設計最佳化,以及自建 RecreationBench(黑箱環境下僅憑互動與視覺回饋還原真實應用程式)。部分過程記錄在 GitHub qwen-code-dev-bot/oh-my-cli 可查,但並非完整第三方稽核。
Qwen3.8-Max 同步接入「千問辦公」,API 相容 OpenAI 與 Anthropic 兩種協定,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈,降低遷移成本。
區分 API 與權重:目前可透過 QwenCloud 呼叫 API;若需本機部署,等待 Qwen3.8-27B 開源或確認 Max 權重授權條款
建立成本基線:按 $2/$6 與快取命中 $0.25 估算月度 token 帳單,與 Kimi K3($3/$15)做對照
設定 reasoning_effort:對延遲敏感任務先用 medium/low,複雜 Agent 任務再開 xhigh
跑真實業務 A/B:勿僅憑官方跑分遷移;用自有程式碼庫與 Kimi K3 做盲審對比
追蹤第三方復測:關注 Artificial Analysis、Arena 正式排名與 Hugging Face 權重上線公告
審查合規與資料出境:企業場景評估阿里雲服務條款、日誌留存與模型輸出稽核要求
| 模型 | 廠商 | 總/激活參數 | 上下文 | 定價(輸入/輸出,每百萬 token) | 權重開源 | 獨立評測 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 950 億 | 100 萬 | $2 / $6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 月之暗面 | 2.8T / 約 500 億 | 約 104.8 萬 | $3 / $15 | 已開源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 490 億 | 100 萬 | 未公開完整表 | 已開源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 未變 | 100 萬 | 未公開完整表 | 已開源 | 9 項智慧體/程式碼基準超 V4-Pro |
| Claude Opus 5 | Anthropic | 未公開 | 100 萬 | $5 / $25 | 閉源 | Arena 前列 |
| Claude Fable 5 | Anthropic | 未公開 | 100 萬 | $10 / $50 | 閉源 | Arena 文字第 1 |
容易被忽略的細節:Kimi K3 與 DeepSeek 均較早公開激活參數量,阿里直到 GA 才補充披露「950 億」,預覽階段透明度不足是 7 月獨立評測機構批評的原因之一。唯一可比的獨立盲測(269 個檔案的真實專案架構任務)中,Kimi K3 得 83 分、Qwen3.8-Max 預覽版得 80 分——同檔位、互有勝負。
「躋身全球第一梯隊」「穩壓 GPT-5.6 Sol 和 Fable 5」目前主要還是阿里的一面之詞——需等開源權重落地與第三方跑分上線後才能真正驗證。
若你計畫將 Qwen3.8-Max 接入 Claude Code、Qoder 或 OpenClaw 等長工作階段 Agent,在筆電或不穩定 Linux VPS上跑 CLI 常面臨記憶體不足、工作階段中斷與 Xcode/Metal 工具鏈缺失。對於需要穩定 SSH 長工作階段、DerivedData 快取與 iOS CI/CD 自動化的生產環境,在本機 Mac 算力不足時,NodeMini 的 Mac Mini 雲端租賃通常是更優解——獨佔節點、秒級撥備,讓 Agent 與建置任務在同一台真實 Mac 上持續執行。詳見 Mac Mini 租賃價格。
資料來源:阿里雲官方部落格與新聞稿、Arena.ai 排行榜(2026-08-01 快照)、Apidog / Yotta Labs / TechNode 等獨立分析、Apple Intelligence 中國版相關報導。發布前請核實最新官方公告。
API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 協定。權重尚未開源,官網雖標註 Open-Source,Hugging Face / ModelScope 儲存庫與協議條款預計「下週」(約 8 月 10 日前後)公布。接入環境可參考 Mac Mini 租賃價格。
目前沒有權威統一評測。唯一獨立盲測顯示兩者非常接近(Kimi K3 83 分、Qwen 預覽 80 分),屬同檔位互有勝負。Kimi K3 優勢是已開源且有第三方資料;Qwen3.8-Max 優勢是 API 價格更低、多模態更全面。
需區分總參數與激活參數。實際激活 950 億,API 成本接近千億級模型。本機私有化部署完整版需多節點資料中心,普通開發者更現實的選擇是等待 Qwen3.8-27B 開源。
可作參考,不能當定論。資料來自阿里自建框架,中立平台尚未復現 GA 版。建議關注獨立評測復測,或在自有業務場景做 A/B 測試。
除更便宜的旗艦 API 外,國行 Apple Intelligence 的生成式 AI 能力基於經壓縮的 Qwen 模型本機執行,國內 iPhone 使用者將在系統層面直接受益。更多問題見 說明中心。