7 月 27 日晚,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施——这是全球首个被完整开放的 3 万亿参数级别模型,Hugging Face 权重约 1.56TB,上线半小时登顶趋势榜第一。本文面向关注开放权重许可、MoE 架构创新与自部署可行性的开发者,完整覆盖:11 天从 API 首发到权重全面开源的时间线、KDA/AttnRes/Per-Head Muon 架构解析、三大 Infra 开源能力、SWE-bench 与 AA Index 跑分对比、许可证两道商业门槛、API 定价与 64 卡自部署真相、六步评估接入清单与 FAQ。核心结论:K3 是开源阵营能力天花板,但不是性价比最优选——官方从未自称「开源」,而是坚持使用 open weight(开放权重) 表述。
开发者最困惑的三件事:7/16 已经能调 API,7/27 又发布了什么?「开源」和「开放权重」差在哪?自部署到底要多少卡? 以下时间线帮你一次理清。
| 日期 | 事件 |
|---|---|
| 7/16 夜 | Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首发,权重尚未公开 |
| 7/17 | 新华社报道称其为「目前全球参数最大的开源模型」;行业密集分析架构 |
| 7/22–23 | 美方指控月之暗面对 Anthropic Fable 模型进行「工业化蒸馏」,威胁制裁 |
| 7/27 23:00 | 完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源) |
| 7/28 | 中国商务部回应中美 AI 争端;国内媒体跟进报道开源细节 |
许可误读风险:媒体普遍写「开源」,但官方从未使用 open source,自定义许可证含 MaaS 收入与规模展示两道门槛
自部署幻觉:1.56TB 权重 + 896 专家 MoE,消费级 GPU 完全无法承载,盲目采购硬件是最大隐性成本
跑分误用:厂商自报与第三方复测差异大,须优先引用 Vals AI、Artificial Analysis 等独立数据
缓存定价陷阱:表头输入 $3/M,但 Mooncake 架构在编程负载上缓存命中率超 90%,实际成本更接近 $0.30/M
地缘合规:中美「模型蒸馏」争端叠加 WAIC 2026 窗口,权重公开不等于训练过程可审计
Agent 运行环境:长会话编码 Agent 需要稳定算力与工具链,笔记本或低配 VPS 难以支撑生产级流水线
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE),896 路由专家,每 token 激活 16 个 |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 open source) |
传统 Gated DeltaNet 用标量级遗忘门,KDA 改为逐通道门控——每个特征维度独立衰减,配合 chunkwise DPLR 公式实现线性时间递归,与少量 Gated MLA 层交替混合,支撑 100 万 token 上下文同时将 KV Cache 压到极低。
传统残差连接均匀累加各层输出,深层易稀释早期信息。AttnRes 改为输入依赖的动态聚合,每层仅增 RMSNorm 与一个伪查询向量,带来约 25% 训练效率提升,参数开销不到 2%。
Per-Head Muon 让每个注意力头独立优化收敛路径;MoE 层 896 选 16(稀疏度约 1.8%),配合 Quantile Balancing 与 MoonEP 从数学上证明冗余专家数上界,解决大规模 MoE 负载不均衡。
月之暗面重构了注意力、残差连接与优化器三大传统组件——这才是 K3 区别于「简单堆参数」的关键,而非仅靠 2.8T 规模。
这次发布不只甩权重,而是把支撑 K3 训练效率的三项关键基础设施一并开源——这也是开发者社区评价较高的原因。
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 通信库 | 临时复制过载专家,保证每节点均等 token 数;证明冗余专家数理论上界 |
| FlashKDA | 基于 CUTLASS 的 KDA 高性能算子 | H20 上 prefill 较基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端 |
| AgentEnv | Firecracker microVM 智能体沙箱 | checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(官方数据) |
确认使用路径:绝大多数团队应走 API(`https://api.moonshot.ai/v1`,模型 ID `kimi-k3`),仅数据驻留/微调/超大规模推理考虑自部署
逐条阅读 LICENSE:核对 MaaS 年收入 2000 万美元门槛与月活 1 亿/月收入 2000 万美元展示义务
验证 Hugging Face 权重完整性:约 1.56TB,确认 MXFP4 格式与分片清单
评估硬件门槛:官方建议 64 卡及以上超节点;勿按消费级 GPU 规划
接入 FlashKDA:现有 flash-linear-attention 项目可无缝切换 chunk_kda 后端获加速
对照独立跑分:以 Vals AI SWE-bench Verified(K3 93.4%)与 AA Index(约 57,全球第 3)为选型基准,勿只看厂商自报
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| GLM-5.2(此前开源第一) | — | AA Index 51 |
| 维度 | Kimi K3 | Claude Fable 5 | GLM-5.2 |
|---|---|---|---|
| AA Intelligence Index | 约 57(全球第 3,开源第 1) | 60 | 51 |
| 单任务成本 | 约 $0.95 | 约 $2.4 | 约 $0.47 |
| 上下文 | 100 万 token | 较短 | 较短 |
| 权重可下载 | 是(1.56TB) | 否 | 是 |
| 定位 | 开源阵营能力天花板 | 闭源综合最强之一 | 开源性价比最优 |
许可证两道商业门槛(K2 时代没有):① 运营 MaaS 业务且连续 12 个月收入超 2000 万美元,须与月之暗面另行签署商业协议;② 月活超 1 亿或月收入超 2000 万美元,须在界面显著展示「Kimi K3」字样。对绝大多数中小团队无影响;若计划与 kimi.com 直接竞争的模型服务,法务须重点审查。
| Token 类型 | 价格 |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
Kimi K3 开源节点卡在 WAIC 2026 窗口期,叠加升级中的中美「模型蒸馏」争端——美方指控月之暗面工业化蒸馏 Anthropic Fable 训练 K3 并威胁制裁;中国商务部 7 月 28 日回应指责「AI 霸权主义」。在此背景下全面公开权重、技术报告与三项 Infra,是用工程细节自证技术路径独立性的态度表达。三天后阿里巴巴发布 24 万亿参数 Qwen3.8-Max-Preview,国产大模型竞争正式进入「3T 俱乐部」阶段。
若你计划将 K3 接入 Kimi Code 类长会话 Agent 或 iOS CI 流水线,在笔记本或不稳定 Linux VPS上跑 CLI Agent 常面临内存不足、会话中断与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 长会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境,NodeMini 的 Mac Mini 云端租赁通常是更优解——独占节点、秒级拨备,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格。
严格来说不是。它属于开放权重(open weight)模型:权重、技术报告和部分 Infra 工具公开,但训练数据和完整训练代码未公开,不符合 OSI「开源」定义。月之暗面官方材料从未使用 open source 一词。
绝大多数商业场景不受限制。但若运营 MaaS 业务且年收入超 2000 万美元,或月活超 1 亿/月收入超 2000 万美元,须满足许可证特定条款。部署环境可参考 Mac Mini 租赁价格。
官方建议 64 卡及以上超节点集群。个人与大部分企业更现实的路径是通过官方 API 或 OpenRouter 等第三方平台调用(目前已有 7 家服务商上线)。
开源阵营综合能力最强:AA Index 全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于 GLM-5.2,属于「天花板最高、非性价比最优」。更多运维问题见 帮助中心。
K3 参数约为 K2.5 的 3 倍,新增 Attention Residuals 与 Per-Head Muon,上下文与多模态大幅提升;许可证从 K2 的 Modified MIT 改为自定义文件,新增 MaaS 收入门槛。