阿里 Qwen3.8-Max 发布:
2.4 万亿参数冲进 Arena 全球前五,下周开源

2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 千问 Qwen3.8-Max(总参数 2.4 万亿、激活 950 亿100 万 token 上下文),同步上线 Agent 产品「千问办公」。本文面向关注大模型选型Agent 工作流成本的开发者,完整覆盖:7 月–8 月发布时间线核心跑分与定价表MoE 架构深度拆解与 Kimi K3 / DeepSeek V4 / Claude 横向对比「开源」标签争议行业背景六步评估清单FAQ。核心提醒:Arena 文本竞技场第 5 名(1496 分,Preliminary)为目前唯一可引用的第三方信号,其余跑分均为阿里自测,权重开源承诺「下周」截至发稿尚未落地。

01

时间线:从预览版到正式发布,两周内节奏很快

2026 年 7–8 月是中国大模型「万亿参数」密集发布窗口。以下时间线梳理已确认事件与官方口径,帮助你在 Kimi K3、DeepSeek V4-Flash 与 Qwen3.8-Max 之间建立参照系。

日期事件
7 月 16 日月之暗面发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测与透明技术报告
7 月 19 日Qwen3.8-Max 以「预览版」开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,未公布激活参数与跑分表,服务条款禁止自动化生产环境调用
7 月 27 日Kimi K3 按承诺开源权重,上线 Hugging Face,并同步开源注意力内核、MoE 通信库等基础设施
7 月 31 日DeepSeek 发布 V4-Flash 正式版,参数规模不变,智能体与代码类基准大幅超过自家 V4-Pro 预览版
8 月 3 日Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 同步上线;阿里港股当日上涨约 7%,美股上涨约 4.5%
预计 8 月 10 日前后Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope——截至发稿,具体日期与开源协议均未公布

开发者最该警惕的六个「信息陷阱」

  1. 01

    把「Open-Source」标签当已开源:官网 GA 当天即标注开源,但 Hugging Face / ModelScope 尚无仓库与许可证

  2. 02

    总参数≠激活成本:2.4T 总参数下实际激活 950 亿,推理账单更接近千亿级模型

  3. 03

    跑分表多为自测:PaperBench、RecreationBench 等为阿里自建基准,第三方尚未复现 GA 版

  4. 04

    Arena 排名为 Preliminary:1496 分、文本竞技场第 5 名仍标注「初步」,非终局定论

  5. 05

    预览版透明度不足:7 月预览阶段未公开激活参数、模型卡与安全评估,多家机构建议勿迁移生产

  6. 06

    竞品脚注含争议:对比表脚注暗示 Fable 5 跑分可能涉及 fallback,但阿里自身方法论同样未完全公开

warning

核实提醒:本文数据截至 2026 年 8 月 4 日。开源权重上线时间、Arena 正式排名与第三方复测结果可能随时更新,生产迁移前请以阿里官方公告与独立评测为准。

02

核心数据一览:Qwen3.8-Max 官方规格与跑分表

项目Qwen3.8-Max
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价输入 $2/百万 token,输出 $6/百万 token(隐式缓存命中 $0.25,显式缓存写入 $2.5、读取 $0.17)
国内定价输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元
Arena 文本竞技场(8/1 快照)第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代 +28.2)
OSWorld-Verified(阿里自测)86.1
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
HLE(阿里自测)43.6(旗舰模型中最低,Fable 5 为 53.3)
权重开源状态承诺「下周」,截至发稿未上线

注:带「阿里自测」标注的数据均来自官方发布材料,尚无 Artificial Analysis、Arena.ai 等对正式版的独立复现。

03

深度拆解:2.4 万亿参数背后,阿里想解决什么问题?

为什么是 MoE + 混合注意力,而不是单纯堆参数?

Qwen3.8-Max 延续 Qwen3.5 架构路线,通过稀疏 MoE 把总参数做到 2.4 万亿,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是 API 定价能压到 $2/$6(明显低于 Claude Opus 5 的 $5/$25 与 Fable 5 的 $10/$50)的核心原因:用架构效率换价格竞争力

reasoning_effort 三档设计:成本可控的标配

模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段。

长程自主任务:卖点与验证方式

阿里案例包括:16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)。部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli 可查,但并非完整第三方审计。

生态卡位:从模型到 Agent 产品的一体化

Qwen3.8-Max 同步接入「千问办公」,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链,降低迁移成本。

发布前六步评估清单(落地操作)

  1. 01

    区分 API 与权重:当前可通过 QwenCloud 调用 API;若需本地部署,等待 Qwen3.8-27B 开源或确认 Max 权重许可证

  2. 02

    建立成本基线:按 $2/$6 与缓存命中 $0.25 估算月度 token 账单,与 Kimi K3($3/$15)做对照

  3. 03

    配置 reasoning_effort:对延迟敏感任务先用 medium/low,复杂 Agent 任务再开 xhigh

  4. 04

    跑真实业务 A/B:勿仅凭官方跑分迁移;用自有代码库与 Kimi K3 做盲审对比

  5. 05

    跟踪第三方复测:关注 Artificial Analysis、Arena 正式排名与 Hugging Face 权重上线公告

  6. 06

    审查合规与数据出境:企业场景评估阿里云服务条款、日志留存与模型输出审计要求

04

横向对比:Qwen3.8-Max、Kimi K3、DeepSeek V4 与 Claude

模型厂商总/激活参数上下文定价(输入/输出,每百万 token)权重开源独立评测
Qwen3.8-Max阿里巴巴2.4T / 950 亿100 万$2 / $6未开源(承诺中)暂无
Kimi K3月之暗面2.8T / 约 500 亿约 104.8 万$3 / $15已开源(7/27)AA Index ≈ 57.11
DeepSeek V4-ProDeepSeek1.6T / 490 亿100 万未公开完整表已开源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek未变100 万未公开完整表已开源9 项智能体/代码基准超 V4-Pro
Claude Opus 5Anthropic未公开100 万$5 / $25闭源Arena 前列
Claude Fable 5Anthropic未公开100 万$10 / $50闭源Arena 文本第 1

容易被忽略的细节:Kimi K3 与 DeepSeek 均较早公开激活参数量,阿里直到 GA 才补充披露「950 亿」,预览阶段透明度不足是 7 月独立评测机构批评的原因之一。唯一可比的独立盲测(269 个文件的真实项目架构任务)中,Kimi K3 得 83 分、Qwen3.8-Max 预览版得 80 分——同档位、互有胜负

「跻身全球第一梯队」「稳压 GPT-5.6 Sol 和 Fable 5」目前主要还是阿里的一面之词——需等开源权重落地与第三方跑分上线后才能真正验证。

05

争议点与行业背景:「开源」标签挂得比权重早

  • 官网已标 Open-Source,权重未发布:GA 当天打标,Hugging Face / ModelScope 无仓库、许可证或确切日期
  • 跑分均来自自建框架:QwenSWEBench、CoWorkBench、RecreationBench 等,中立平台尚未复现 GA 版
  • 脚注暗指竞品存疑:「Fable 5 的结果可能涉及 fallback」无技术细节支撑,阿里自身方法论同样未完全公开
  • 预览阶段禁止生产调用:7 月 19 日预览版 ToS 明确限制自动化生产环境,且无模型卡与安全评估

2026 年万亿参数竞赛进入新阶段

  • 参数竞赛 vs 架构效率:DeepSeek V4-Flash 证明不靠堆参数也能大幅提升 Agent 能力,Qwen3.8-Max 的「大容量、低激活」是同一叙事延续
  • 阿里罕见回归开源:首次承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部「集体开放」格局
  • 消费端落地:Qwen 经压缩后成为国行 Apple Intelligence 核心引擎,延伸至上亿部 iPhone 系统级 AI
  • 资本市场反应:发布日港股涨约 7%、美股涨约 4.5%
  • 中美监管对照:同期白宫召集 OpenAI、Anthropic 等商讨 Agent 网络安全测试框架——一边加速开源,一边收紧 Agent 审查

可引用关键数据速查

  • 规格:2.4T 总参数 / 950 亿激活 / 1M 上下文 / 多模态输入
  • 定价:API $2/$6;国内 12/36 元每百万 token
  • Arena:文本第 5(1496,Preliminary);视觉第 2
  • 独立盲测:Kimi K3 83 vs Qwen 预览 80(架构设计任务)
  • 开源承诺:Qwen3.8-Max + Qwen3.8-27B,预计 8 月 10 日前后

若你计划将 Qwen3.8-Max 接入 Claude Code、Qoder 或 OpenClaw 等长会话 Agent,在笔记本或不稳定 Linux VPS上跑 CLI 常面临内存不足、会话中断与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 长会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境,在本地 Mac 算力不足时,NodeMini 的 Mac Mini 云端租赁通常是更优解——独占节点、秒级拨备,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格

数据来源:阿里云官方博客与新闻稿、Arena.ai 排行榜(2026-08-01 快照)、Apidog / Yotta Labs / TechNode 等独立分析、Apple Intelligence 中国版相关报道。发布前请核实最新官方公告。

FAQ

常见问题

API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 协议。权重尚未开源,官网虽标注 Open-Source,Hugging Face / ModelScope 仓库与协议条款预计「下周」(约 8 月 10 日前后)公布。接入环境可参考 Mac Mini 租赁价格

目前没有权威统一评测。唯一独立盲测显示两者非常接近(Kimi K3 83 分、Qwen 预览 80 分),属同档位互有胜负。Kimi K3 优势是已开源且有第三方数据;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。

需区分总参数与激活参数。实际激活 950 亿,API 成本接近千亿级模型。本地私有化部署完整版需多节点数据中心,普通开发者更现实的选择是等待 Qwen3.8-27B 开源。

可作参考,不能当定论。数据来自阿里自建框架,中立平台尚未复现 GA 版。建议关注独立评测复测,或在自有业务场景做 A/B 测试。

除更便宜的旗舰 API 外,国行 Apple Intelligence 的生成式 AI 能力基于经压缩的 Qwen 模型本地运行,国内 iPhone 用户将在系统层面直接受益。更多问题见 帮助中心