2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 千问 Qwen3.8-Max(总参数 2.4 万亿、激活 950 亿、100 万 token 上下文),同步上线 Agent 产品「千问办公」。本文面向关注大模型选型与Agent 工作流成本的开发者,完整覆盖:7 月–8 月发布时间线、核心跑分与定价表、MoE 架构深度拆解、与 Kimi K3 / DeepSeek V4 / Claude 横向对比、「开源」标签争议、行业背景、六步评估清单与 FAQ。核心提醒:Arena 文本竞技场第 5 名(1496 分,Preliminary)为目前唯一可引用的第三方信号,其余跑分均为阿里自测,权重开源承诺「下周」截至发稿尚未落地。
2026 年 7–8 月是中国大模型「万亿参数」密集发布窗口。以下时间线梳理已确认事件与官方口径,帮助你在 Kimi K3、DeepSeek V4-Flash 与 Qwen3.8-Max 之间建立参照系。
| 日期 | 事件 |
|---|---|
| 7 月 16 日 | 月之暗面发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测与透明技术报告 |
| 7 月 19 日 | Qwen3.8-Max 以「预览版」开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,未公布激活参数与跑分表,服务条款禁止自动化生产环境调用 |
| 7 月 27 日 | Kimi K3 按承诺开源权重,上线 Hugging Face,并同步开源注意力内核、MoE 通信库等基础设施 |
| 7 月 31 日 | DeepSeek 发布 V4-Flash 正式版,参数规模不变,智能体与代码类基准大幅超过自家 V4-Pro 预览版 |
| 8 月 3 日 | Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 同步上线;阿里港股当日上涨约 7%,美股上涨约 4.5% |
| 预计 8 月 10 日前后 | Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope——截至发稿,具体日期与开源协议均未公布 |
把「Open-Source」标签当已开源:官网 GA 当天即标注开源,但 Hugging Face / ModelScope 尚无仓库与许可证
总参数≠激活成本:2.4T 总参数下实际激活 950 亿,推理账单更接近千亿级模型
跑分表多为自测:PaperBench、RecreationBench 等为阿里自建基准,第三方尚未复现 GA 版
Arena 排名为 Preliminary:1496 分、文本竞技场第 5 名仍标注「初步」,非终局定论
预览版透明度不足:7 月预览阶段未公开激活参数、模型卡与安全评估,多家机构建议勿迁移生产
竞品脚注含争议:对比表脚注暗示 Fable 5 跑分可能涉及 fallback,但阿里自身方法论同样未完全公开
核实提醒:本文数据截至 2026 年 8 月 4 日。开源权重上线时间、Arena 正式排名与第三方复测结果可能随时更新,生产迁移前请以阿里官方公告与独立评测为准。
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价 | 输入 $2/百万 token,输出 $6/百万 token(隐式缓存命中 $0.25,显式缓存写入 $2.5、读取 $0.17) |
| 国内定价 | 输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元 |
| Arena 文本竞技场(8/1 快照) | 第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型 |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代 +28.2) |
| OSWorld-Verified(阿里自测) | 86.1 |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0) |
| HLE(阿里自测) | 43.6(旗舰模型中最低,Fable 5 为 53.3) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
注:带「阿里自测」标注的数据均来自官方发布材料,尚无 Artificial Analysis、Arena.ai 等对正式版的独立复现。
Qwen3.8-Max 延续 Qwen3.5 架构路线,通过稀疏 MoE 把总参数做到 2.4 万亿,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是 API 定价能压到 $2/$6(明显低于 Claude Opus 5 的 $5/$25 与 Fable 5 的 $10/$50)的核心原因:用架构效率换价格竞争力。
模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段。
阿里案例包括:16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)。部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli 可查,但并非完整第三方审计。
Qwen3.8-Max 同步接入「千问办公」,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链,降低迁移成本。
区分 API 与权重:当前可通过 QwenCloud 调用 API;若需本地部署,等待 Qwen3.8-27B 开源或确认 Max 权重许可证
建立成本基线:按 $2/$6 与缓存命中 $0.25 估算月度 token 账单,与 Kimi K3($3/$15)做对照
配置 reasoning_effort:对延迟敏感任务先用 medium/low,复杂 Agent 任务再开 xhigh
跑真实业务 A/B:勿仅凭官方跑分迁移;用自有代码库与 Kimi K3 做盲审对比
跟踪第三方复测:关注 Artificial Analysis、Arena 正式排名与 Hugging Face 权重上线公告
审查合规与数据出境:企业场景评估阿里云服务条款、日志留存与模型输出审计要求
| 模型 | 厂商 | 总/激活参数 | 上下文 | 定价(输入/输出,每百万 token) | 权重开源 | 独立评测 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 950 亿 | 100 万 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 月之暗面 | 2.8T / 约 500 亿 | 约 104.8 万 | $3 / $15 | 已开源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T / 490 亿 | 100 万 | 未公开完整表 | 已开源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 未变 | 100 万 | 未公开完整表 | 已开源 | 9 项智能体/代码基准超 V4-Pro |
| Claude Opus 5 | Anthropic | 未公开 | 100 万 | $5 / $25 | 闭源 | Arena 前列 |
| Claude Fable 5 | Anthropic | 未公开 | 100 万 | $10 / $50 | 闭源 | Arena 文本第 1 |
容易被忽略的细节:Kimi K3 与 DeepSeek 均较早公开激活参数量,阿里直到 GA 才补充披露「950 亿」,预览阶段透明度不足是 7 月独立评测机构批评的原因之一。唯一可比的独立盲测(269 个文件的真实项目架构任务)中,Kimi K3 得 83 分、Qwen3.8-Max 预览版得 80 分——同档位、互有胜负。
「跻身全球第一梯队」「稳压 GPT-5.6 Sol 和 Fable 5」目前主要还是阿里的一面之词——需等开源权重落地与第三方跑分上线后才能真正验证。
若你计划将 Qwen3.8-Max 接入 Claude Code、Qoder 或 OpenClaw 等长会话 Agent,在笔记本或不稳定 Linux VPS上跑 CLI 常面临内存不足、会话中断与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 长会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境,在本地 Mac 算力不足时,NodeMini 的 Mac Mini 云端租赁通常是更优解——独占节点、秒级拨备,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格。
数据来源:阿里云官方博客与新闻稿、Arena.ai 排行榜(2026-08-01 快照)、Apidog / Yotta Labs / TechNode 等独立分析、Apple Intelligence 中国版相关报道。发布前请核实最新官方公告。
API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 协议。权重尚未开源,官网虽标注 Open-Source,Hugging Face / ModelScope 仓库与协议条款预计「下周」(约 8 月 10 日前后)公布。接入环境可参考 Mac Mini 租赁价格。
目前没有权威统一评测。唯一独立盲测显示两者非常接近(Kimi K3 83 分、Qwen 预览 80 分),属同档位互有胜负。Kimi K3 优势是已开源且有第三方数据;Qwen3.8-Max 优势是 API 价格更低、多模态更全面。
需区分总参数与激活参数。实际激活 950 亿,API 成本接近千亿级模型。本地私有化部署完整版需多节点数据中心,普通开发者更现实的选择是等待 Qwen3.8-27B 开源。
可作参考,不能当定论。数据来自阿里自建框架,中立平台尚未复现 GA 版。建议关注独立评测复测,或在自有业务场景做 A/B 测试。
除更便宜的旗舰 API 外,国行 Apple Intelligence 的生成式 AI 能力基于经压缩的 Qwen 模型本地运行,国内 iPhone 用户将在系统层面直接受益。更多问题见 帮助中心。