Kimi K3 全面开源
2.8 万亿参数、百万上下文,月之暗面这次放了什么大招

7 月 27 日晚,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施——这是全球首个被完整开放的 3 万亿参数级别模型,Hugging Face 权重约 1.56TB,上线半小时登顶趋势榜第一。本文面向关注开放权重许可MoE 架构创新自部署可行性的开发者,完整覆盖:11 天从 API 首发到权重全面开源的时间线KDA/AttnRes/Per-Head Muon 架构解析三大 Infra 开源能力SWE-bench 与 AA Index 跑分对比许可证两道商业门槛API 定价与 64 卡自部署真相六步评估接入清单FAQ。核心结论:K3 是开源阵营能力天花板,但不是性价比最优选——官方从未自称「开源」,而是坚持使用 open weight(开放权重) 表述。

01

从 API 首发到全面开源:Kimi K3 只用了 11 天,背后有哪些痛点?

开发者最困惑的三件事:7/16 已经能调 API,7/27 又发布了什么?「开源」和「开放权重」差在哪?自部署到底要多少卡? 以下时间线帮你一次理清。

日期事件
7/16 夜Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首发,权重尚未公开
7/17新华社报道称其为「目前全球参数最大的开源模型」;行业密集分析架构
7/22–23美方指控月之暗面对 Anthropic Fable 模型进行「工业化蒸馏」,威胁制裁
7/27 23:00完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源)
7/28中国商务部回应中美 AI 争端;国内媒体跟进报道开源细节

企业用户最关心的三个隐性成本

  1. 01

    许可误读风险:媒体普遍写「开源」,但官方从未使用 open source,自定义许可证含 MaaS 收入与规模展示两道门槛

  2. 02

    自部署幻觉:1.56TB 权重 + 896 专家 MoE,消费级 GPU 完全无法承载,盲目采购硬件是最大隐性成本

  3. 03

    跑分误用:厂商自报与第三方复测差异大,须优先引用 Vals AI、Artificial Analysis 等独立数据

  4. 04

    缓存定价陷阱:表头输入 $3/M,但 Mooncake 架构在编程负载上缓存命中率超 90%,实际成本更接近 $0.30/M

  5. 05

    地缘合规:中美「模型蒸馏」争端叠加 WAIC 2026 窗口,权重公开不等于训练过程可审计

  6. 06

    Agent 运行环境:长会话编码 Agent 需要稳定算力与工具链,笔记本或低配 VPS 难以支撑生产级流水线

02

Kimi K3 核心参数与架构创新:KDA、AttnRes、Stable LatentMoE 一览

项目参数
总参数量2.8 万亿(2.8T)
激活参数量约 1040 亿
架构类型混合专家模型(MoE),896 路由专家,每 token 激活 16 个
注意力机制Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口100 万 token
多模态原生视觉理解(ViT-V2,27 层)
权重格式MXFP4 权重 + MXFP8 激活(量化感知训练)
权重体积约 1.56TB(Hugging Face)
License自定义许可证(官方称 open weight,非 open source)

Kimi Delta Attention(KDA):逐通道精细遗忘

传统 Gated DeltaNet 用标量级遗忘门,KDA 改为逐通道门控——每个特征维度独立衰减,配合 chunkwise DPLR 公式实现线性时间递归,与少量 Gated MLA 层交替混合,支撑 100 万 token 上下文同时将 KV Cache 压到极低。

Attention Residuals(AttnRes):选择性残差聚合

传统残差连接均匀累加各层输出,深层易稀释早期信息。AttnRes 改为输入依赖的动态聚合,每层仅增 RMSNorm 与一个伪查询向量,带来约 25% 训练效率提升,参数开销不到 2%。

Per-Head Muon 与 Stable LatentMoE

Per-Head Muon 让每个注意力头独立优化收敛路径;MoE 层 896 选 16(稀疏度约 1.8%),配合 Quantile Balancing 与 MoonEP 从数学上证明冗余专家数上界,解决大规模 MoE 负载不均衡。

月之暗面重构了注意力、残差连接与优化器三大传统组件——这才是 K3 区别于「简单堆参数」的关键,而非仅靠 2.8T 规模。

03

MoonEP、FlashKDA、AgentEnv:三大 Infra 开源与六步接入清单

这次发布不只甩权重,而是把支撑 K3 训练效率的三项关键基础设施一并开源——这也是开发者社区评价较高的原因。

技术定位关键能力
MoonEP超大规模细粒度 MoE 通信库临时复制过载专家,保证每节点均等 token 数;证明冗余专家数理论上界
FlashKDA基于 CUTLASS 的 KDA 高性能算子H20 上 prefill 较基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端
AgentEnvFirecracker microVM 智能体沙箱checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(官方数据)

六步评估与接入实操清单

  1. 01

    确认使用路径:绝大多数团队应走 API(`https://api.moonshot.ai/v1`,模型 ID `kimi-k3`),仅数据驻留/微调/超大规模推理考虑自部署

  2. 02

    逐条阅读 LICENSE:核对 MaaS 年收入 2000 万美元门槛与月活 1 亿/月收入 2000 万美元展示义务

  3. 03

    验证 Hugging Face 权重完整性:约 1.56TB,确认 MXFP4 格式与分片清单

  4. 04

    评估硬件门槛:官方建议 64 卡及以上超节点;勿按消费级 GPU 规划

  5. 05

    接入 FlashKDA:现有 flash-linear-attention 项目可无缝切换 chunk_kda 后端获加速

  6. 06

    对照独立跑分:以 Vals AI SWE-bench Verified(K3 93.4%)与 AA Index(约 57,全球第 3)为选型基准,勿只看厂商自报

python
from openai import OpenAI
client = OpenAI(
    api_key="YOUR_MOONSHOT_KEY",
    base_url="https://api.moonshot.ai/v1"
)
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(resp.choices[0].message.content)
04

跑分对比与许可证门槛:K3 vs GPT-5.6、Claude、GLM-5.2 怎么选?

SWE-bench Verified(Vals AI 独立复测,2026 年 7 月)

模型分数发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
GLM-5.2(此前开源第一)AA Index 51

成本与能力决策矩阵

维度Kimi K3Claude Fable 5GLM-5.2
AA Intelligence Index约 57(全球第 3,开源第 1)6051
单任务成本约 $0.95约 $2.4约 $0.47
上下文100 万 token较短较短
权重可下载是(1.56TB)
定位开源阵营能力天花板闭源综合最强之一开源性价比最优
warning

许可证两道商业门槛(K2 时代没有):① 运营 MaaS 业务且连续 12 个月收入超 2000 万美元,须与月之暗面另行签署商业协议;② 月活超 1 亿或月收入超 2000 万美元,须在界面显著展示「Kimi K3」字样。对绝大多数中小团队无影响;若计划与 kimi.com 直接竞争的模型服务,法务须重点审查。

API 定价(每百万 token)

Token 类型价格
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出(含推理过程)$15.00
05

中美 AI 竞赛背景与可引用数据:K3 开源释放了什么信号?

Kimi K3 开源节点卡在 WAIC 2026 窗口期,叠加升级中的中美「模型蒸馏」争端——美方指控月之暗面工业化蒸馏 Anthropic Fable 训练 K3 并威胁制裁;中国商务部 7 月 28 日回应指责「AI 霸权主义」。在此背景下全面公开权重、技术报告与三项 Infra,是用工程细节自证技术路径独立性的态度表达。三天后阿里巴巴发布 24 万亿参数 Qwen3.8-Max-Preview,国产大模型竞争正式进入「3T 俱乐部」阶段。

可引用关键数据速查

  • 规模:2.8T 总参数,896 专家激活 16 个,激活参数约 1040 亿,1M token 上下文
  • 跑分:SWE-bench Verified 93.4%(Vals AI);AA Index 约 57,全球第 3、开源第 1
  • 成本:单任务约 $0.95,比 Fable 5 便宜约 60%,但比 GLM-5.2($0.47)更贵
  • 编码:Frontend Code Arena 榜单第 1;Mooncake 缓存命中率编程负载超 90%
  • 自部署:1.56TB 权重,官方建议 64+ 卡超节点;OpenRouter 等 7 家第三方已托管
  • 许可:自定义 open weight 许可,非 OSI 开源;含 MaaS 收入与规模展示两道门槛

若你计划将 K3 接入 Kimi Code 类长会话 Agent 或 iOS CI 流水线,在笔记本或不稳定 Linux VPS上跑 CLI Agent 常面临内存不足、会话中断与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 长会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境,NodeMini 的 Mac Mini 云端租赁通常是更优解——独占节点、秒级拨备,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格

FAQ

常见问题

严格来说不是。它属于开放权重(open weight)模型:权重、技术报告和部分 Infra 工具公开,但训练数据和完整训练代码未公开,不符合 OSI「开源」定义。月之暗面官方材料从未使用 open source 一词。

绝大多数商业场景不受限制。但若运营 MaaS 业务且年收入超 2000 万美元,或月活超 1 亿/月收入超 2000 万美元,须满足许可证特定条款。部署环境可参考 Mac Mini 租赁价格

官方建议 64 卡及以上超节点集群。个人与大部分企业更现实的路径是通过官方 API 或 OpenRouter 等第三方平台调用(目前已有 7 家服务商上线)。

开源阵营综合能力最强:AA Index 全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于 GLM-5.2,属于「天花板最高、非性价比最优」。更多运维问题见 帮助中心

K3 参数约为 K2.5 的 3 倍,新增 Attention Residuals 与 Per-Head Muon,上下文与多模态大幅提升;许可证从 K2 的 Modified MIT 改为自定义文件,新增 MaaS 收入门槛。