Kimi K3 开源权重
7 月 27 日发布:2.8 万亿参数,闭源溢价还守得住吗?

2026 年 7 月 27 日完整权重公开还有 5 天:月之暗面(Moonshot AI)将于 Hugging Face 以 Modified MIT 许可发布 2.8 万亿参数 Kimi K3 权重——全球首个 3T 级开源权重模型。本文面向关注K3 权重下载本地部署可行性闭源模型溢价的开发者,完整覆盖:7/16 API 上线 vs 7/27 权重公开两阶段时间线模型规格与跑分对比API 定价与缓存真实成本open weights 与 open source 辨析1.4TB 自部署硬件真相发布日六步核对清单行业意义FAQ。核心结论:K3 不是「Fable 5 杀手」,综合智能排第三,但以约 1/3 成本达到接近前沿能力,且拥有闭源给不了的两样东西——开源权重 + 100 万 token 上下文

01

Kimi K3 发布时间表:API 上线 vs 开源权重,别搞混两个日期

当前最大搜索困惑是「K3 已经能用了,7 月 27 日还要发布什么?」——答案是:7 月 16 日上线的是 API 与 Kimi 全家桶产品;7 月 27 日才公开可下载的完整模型权重与技术报告。

日期事件
2026-07-16Kimi K3 通过 API、Kimi App、Kimi Work、Kimi Code 上线;Artificial Analysis 同日发布独立评测
2026-07-17上海世界人工智能大会(WAIC)开幕;新华社将 K3 发布定调为「国家级里程碑」
2026-07-27完整权重公开下载(Hugging Face,Modified MIT 许可)+ 技术报告(架构、训练、评估细节)

Kimi K3 核心规格一览

项目数据
总参数量2.8 万亿(2.8T),史上最大开源权重模型
架构稀疏 MoE:Stable LatentMoE,896 专家中每 token 激活 16 个
注意力Kimi Delta Attention(KDA)+ Attention Residuals(AttnRes)+ Gated MLA
上下文1,048,576 tokens(约 100 万)
模态原生视觉理解(文本 + 图像,产品端支持视频),输出为文本
权重格式MXFP4 权重 + MXFP8 激活(4-bit 量化接近训练精度)
扩展效率较 K2 提升约 2.5 倍(同等算力换更多智能)
训练稳定性Quantile Balancing、Per-Head Muon 优化器、SiTU 激活函数
长上下文解码KDA 在百万 token 上下文中最高 6.3 倍解码加速

K3 不是「Fable 5 杀手」——综合智能仍排第三,但以约 1/3 的成本达到「接近前沿」的能力,且拥有闭源模型给不了的两样东西:开源权重 + 100 万 token 上下文。

为什么 7/27 权重发布值得提前关注?

  1. 01

    数据驻留:严格合规场景需要权重落地而非 API 调用

  2. 02

    微调需求:在自有数据上继续训练必须拿到完整权重

  3. 03

    调用量极大:超大规模推理时自建硬件可能更划算

  4. 04

    生态对齐:vLLM 对 KDA / prefix caching 将随权重落地

  5. 05

    量化跟进:预期 Ollama、GGUF 版本将像 K2 系列一样陆续出现

  6. 06

    许可确认:Modified MIT 原文需在发布日核对,不可提前假设条款

02

Kimi K3 跑分对比:哪里领先 Claude Fable 5 和 GPT-5.6?

Artificial Analysis Intelligence Index(7 月 16 日独立评测)给出综合排名:

模型AA Intelligence Index排名
Claude Fable 559.9第 1
GPT-5.6 Sol58.9第 2
Kimi K357.1第 3 / 189

K3 领先或打平的基准

  • Frontend Code Arena:第 1(盲测中开发者偏好其 UI 代码超过 Fable 和 Sol)
  • Automation Bench、SpreadsheetBench 2:第 1
  • BrowseComp:91.2(第 1;配合 1M 上下文无压缩策略可达 90.4+)
  • SWE Marathon(超长编码会话):42.0,明显领先(GPT-5.5 / GLM-5.2 在此崩到十几分)
  • Terminal Bench 2.1:88.3,与 GPT-5.6 Sol 的 88.8 基本打平
  • Program Bench:77.8,微超 Sol 的 77.6
  • FrontierSWE:81.2,大幅超 Sol 的 71.3(但落后 Fable 5 的 86.6)

K3 仍落后的领域

  • GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748(长程判断力仍是 Fable 的天下)
  • DeepSWE:67.5 vs Sol 的 73.0
  • 幻觉率:较 K2.6 有所上升(官方承认);Reddit 有用户反馈接入自建应用后「幻觉明显多于顶级闭源模型」
  • 对话打磨度与稳定性:单次会话方差仍逊于 Fable 5 / Sol
info

官方的诚实态度(值得引用):月之暗面罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板——对 harness 传回推理内容敏感、意图模糊时过于主动等。不同模型使用了各自的推理 harness,独立第三方复现仍在进行中。

03

Kimi K3 API 定价:表面单价 vs 缓存命中后的真实成本

项目价格(每百万 tokens)
输入(缓存未命中)$3.00
输入(缓存命中,自动缓存)$0.30
输出$15.00

K3 定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是目前中国大模型厂商中最高的 API 定价,但仍显著低于 Claude Opus 4.8 的单任务成本。Artificial Analysis 实测单任务成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%。编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价。

方案适合谁7/27 前7/27 后
API($3/$15)绝大多数开发者与企业✅ 可用✅ 仍推荐
自部署(64+ 加速器)数据驻留 / 微调 / 超大规模调用❌ 权重未公开⚠️ 仅三类场景成立
消费级本地 GPU个人实验❌ 4-bit 约 1.4 TB
04

Kimi K3 是开源模型吗?Open Weights vs Open Source

英文社区严格区分 open weights(只放权重)与 open source(含训练代码/数据)。Kimi K3 属于前者——7 月 27 日公开的是完整模型权重(Modified MIT 许可证,具体条款待发布日确认),而非训练代码与数据集的全栈开源。

7 月 27 日开源发布具体会发生什么

  • 完整 2.8T 权重上架 Moonshot 的 Hugging Face 组织
  • 同步发布技术报告(架构、训练、评估细节)
  • vLLM 对 KDA / prefix caching 的支持将随权重一起落地
  • 预期后续:Ollama、GGUF 量化版本会像 K2 系列一样陆续跟进
warning

自部署现实(别被「本地跑大模型」标题党误导):4-bit 权重约 1.4 TB,官方建议 64+ 加速器的「超节点」部署,需要专家并行 + 张量并行的分布式推理。参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB 显存;K3 是它的 2.8 倍。对绝大多数人正确答案是 API($3/$15)

7 月 27 日发布日六步核对清单

  1. 01

    HF 仓库文件是否齐全:检查 Moonshot Hugging Face 组织下的完整文件清单

  2. 02

    LICENSE 原文:逐条阅读 Modified MIT 具体条款,确认商用与再分发限制

  3. 03

    量化版本:关注 MXFP4/NVFP4 等官方或社区量化包

  4. 04

    vLLM / SGLang 启动命令:核对 KDA 与 prefix caching 的官方示例

  5. 05

    最低可行硬件:对照技术报告中的分布式推理要求,勿按消费级 GPU 规划

  6. 06

    独立长上下文复测:关注社区首批独立 benchmark 与 r/LocalLLaMA 复现讨论

05

7 月 27 日权重发布为何动摇闭源溢价?行业意义与可引用数据

四个评论角度

  1. 01

    开源与闭源能力差距在前沿基本闭合:差距从「数百分」缩到「两三分」,闭源厂商很难再纯靠能力证明溢价

  2. 02

    地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢复)——「监管可以关掉闭源模型,但关不掉已发布的开源权重」成为新论据

  3. 03

    中国厂商梯队集体逼近:Z.ai GLM-5.2(编码对标 Opus 4.8、价格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等,K3 是这波浪潮的最高点

  4. 04

    月之暗面的翻身仗:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的开源路线重建地位

可引用关键数据速查

  • 规模:2.8T 总参数,896 专家激活 16 个,1M token 上下文(1,048,576)
  • 综合智能:AA Index 57.1 / Sol 58.9 / Fable 5 59.9(第 3 名/189)
  • 单任务成本:K3 $0.94,比 Fable 5 低 65.8%
  • API:$3 输入 / $0.30 缓存命中 / $15 输出(每百万 tokens)
  • 自部署:4-bit 权重约 1.4 TB;官方建议 64+ 加速器
  • 编码亮点:Frontend Code Arena 第 1;SWE Marathon 42.0
  • 已知短板:官方承认综合能力仍落后 Fable 5 / GPT-5.6 Sol,幻觉率较 K2.6 上升

信源:官方 kimi.com 技术博客platform.kimi.ai;独立评测 Artificial Analysis(7 月 16 日);深度报道 VentureBeat、Northflank;社区 r/LocalLLaMA、Hacker News。更多架构细节可参考本站 Kimi K3 深度评测

若你计划在 7/27 后将 K3 接入 Kimi Code 类长会话 Agent 或 iOS CI 流水线,在笔记本或不稳定 Linux VPS上跑 CLI Agent 常面临内存不足、会话中断与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 长会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境,NodeMini 的 Mac Mini 云端租赁通常是更优解——独占节点、秒级拨备,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格

FAQ

常见问题

完整 2.8T 权重计划于 2026 年 7 月 27 日在 Moonshot 的 Hugging Face 组织上架,同步发布技术报告。API 与 Kimi 全家桶已于 7 月 16 日上线。

准确说法是 open weights(开源权重),非 fully open source。综合智能 K3 更强(2.8T vs DeepSeek V4 Pro 1.6T、1M vs 128K 上下文),但 DeepSeek 输出仅 $3.48/M,成本显著更低。成本敏感选 DeepSeek,长代码/文档理解选 K3。

kimi.com 免费账号可用 K3;API 为 $3/$15 per 1M tokens,缓存命中 $0.30/M。若需稳定 Agent 运行环境,可参考 Mac Mini 租赁价格

4-bit 权重大约 1.4 TB,官方建议 64+ 加速器超节点,消费级 GPU 无法承载。自部署仅在数据驻留、微调或超大规模调用三种场景成立;其余用 API。

综合智能 K3 排第三(57.1),落后 Fable 5(59.9)和 GPT-5.6 Sol(58.9)。K3 在 Frontend Code Arena、SWE Marathon、BrowseComp 等编码基准领先;长程推理与幻觉控制仍逊于顶级闭源。更多运维问题见 帮助中心

Modified MIT 许可证,具体条款待 7 月 27 日发布日确认原文。发布日务必逐条核对 LICENSE 文件。