距2026 年 7 月 27 日完整权重公开还有 5 天:月之暗面(Moonshot AI)将于 Hugging Face 以 Modified MIT 许可发布 2.8 万亿参数 Kimi K3 权重——全球首个 3T 级开源权重模型。本文面向关注K3 权重下载、本地部署可行性与闭源模型溢价的开发者,完整覆盖:7/16 API 上线 vs 7/27 权重公开两阶段时间线、模型规格与跑分对比、API 定价与缓存真实成本、open weights 与 open source 辨析、1.4TB 自部署硬件真相、发布日六步核对清单、行业意义与 FAQ。核心结论:K3 不是「Fable 5 杀手」,综合智能排第三,但以约 1/3 成本达到接近前沿能力,且拥有闭源给不了的两样东西——开源权重 + 100 万 token 上下文。
当前最大搜索困惑是「K3 已经能用了,7 月 27 日还要发布什么?」——答案是:7 月 16 日上线的是 API 与 Kimi 全家桶产品;7 月 27 日才公开可下载的完整模型权重与技术报告。
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 通过 API、Kimi App、Kimi Work、Kimi Code 上线;Artificial Analysis 同日发布独立评测 |
| 2026-07-17 | 上海世界人工智能大会(WAIC)开幕;新华社将 K3 发布定调为「国家级里程碑」 |
| 2026-07-27 | 完整权重公开下载(Hugging Face,Modified MIT 许可)+ 技术报告(架构、训练、评估细节) |
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T),史上最大开源权重模型 |
| 架构 | 稀疏 MoE:Stable LatentMoE,896 专家中每 token 激活 16 个 |
| 注意力 | Kimi Delta Attention(KDA)+ Attention Residuals(AttnRes)+ Gated MLA |
| 上下文 | 1,048,576 tokens(约 100 万) |
| 模态 | 原生视觉理解(文本 + 图像,产品端支持视频),输出为文本 |
| 权重格式 | MXFP4 权重 + MXFP8 激活(4-bit 量化接近训练精度) |
| 扩展效率 | 较 K2 提升约 2.5 倍(同等算力换更多智能) |
| 训练稳定性 | Quantile Balancing、Per-Head Muon 优化器、SiTU 激活函数 |
| 长上下文解码 | KDA 在百万 token 上下文中最高 6.3 倍解码加速 |
K3 不是「Fable 5 杀手」——综合智能仍排第三,但以约 1/3 的成本达到「接近前沿」的能力,且拥有闭源模型给不了的两样东西:开源权重 + 100 万 token 上下文。
数据驻留:严格合规场景需要权重落地而非 API 调用
微调需求:在自有数据上继续训练必须拿到完整权重
调用量极大:超大规模推理时自建硬件可能更划算
生态对齐:vLLM 对 KDA / prefix caching 将随权重落地
量化跟进:预期 Ollama、GGUF 版本将像 K2 系列一样陆续出现
许可确认:Modified MIT 原文需在发布日核对,不可提前假设条款
Artificial Analysis Intelligence Index(7 月 16 日独立评测)给出综合排名:
| 模型 | AA Intelligence Index | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | 第 1 |
| GPT-5.6 Sol | 58.9 | 第 2 |
| Kimi K3 | 57.1 | 第 3 / 189 |
官方的诚实态度(值得引用):月之暗面罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板——对 harness 传回推理内容敏感、意图模糊时过于主动等。不同模型使用了各自的推理 harness,独立第三方复现仍在进行中。
| 项目 | 价格(每百万 tokens) |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中,自动缓存) | $0.30 |
| 输出 | $15.00 |
K3 定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是目前中国大模型厂商中最高的 API 定价,但仍显著低于 Claude Opus 4.8 的单任务成本。Artificial Analysis 实测单任务成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%。编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价。
| 方案 | 适合谁 | 7/27 前 | 7/27 后 |
|---|---|---|---|
| API($3/$15) | 绝大多数开发者与企业 | ✅ 可用 | ✅ 仍推荐 |
| 自部署(64+ 加速器) | 数据驻留 / 微调 / 超大规模调用 | ❌ 权重未公开 | ⚠️ 仅三类场景成立 |
| 消费级本地 GPU | 个人实验 | ❌ | ❌ 4-bit 约 1.4 TB |
英文社区严格区分 open weights(只放权重)与 open source(含训练代码/数据)。Kimi K3 属于前者——7 月 27 日公开的是完整模型权重(Modified MIT 许可证,具体条款待发布日确认),而非训练代码与数据集的全栈开源。
自部署现实(别被「本地跑大模型」标题党误导):4-bit 权重约 1.4 TB,官方建议 64+ 加速器的「超节点」部署,需要专家并行 + 张量并行的分布式推理。参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB 显存;K3 是它的 2.8 倍。对绝大多数人正确答案是 API($3/$15)。
HF 仓库文件是否齐全:检查 Moonshot Hugging Face 组织下的完整文件清单
LICENSE 原文:逐条阅读 Modified MIT 具体条款,确认商用与再分发限制
量化版本:关注 MXFP4/NVFP4 等官方或社区量化包
vLLM / SGLang 启动命令:核对 KDA 与 prefix caching 的官方示例
最低可行硬件:对照技术报告中的分布式推理要求,勿按消费级 GPU 规划
独立长上下文复测:关注社区首批独立 benchmark 与 r/LocalLLaMA 复现讨论
开源与闭源能力差距在前沿基本闭合:差距从「数百分」缩到「两三分」,闭源厂商很难再纯靠能力证明溢价
地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢复)——「监管可以关掉闭源模型,但关不掉已发布的开源权重」成为新论据
中国厂商梯队集体逼近:Z.ai GLM-5.2(编码对标 Opus 4.8、价格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等,K3 是这波浪潮的最高点
月之暗面的翻身仗:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的开源路线重建地位
信源:官方 kimi.com 技术博客、platform.kimi.ai;独立评测 Artificial Analysis(7 月 16 日);深度报道 VentureBeat、Northflank;社区 r/LocalLLaMA、Hacker News。更多架构细节可参考本站 Kimi K3 深度评测。
若你计划在 7/27 后将 K3 接入 Kimi Code 类长会话 Agent 或 iOS CI 流水线,在笔记本或不稳定 Linux VPS上跑 CLI Agent 常面临内存不足、会话中断与 Xcode/Metal 工具链缺失。对于需要稳定 SSH 长会话、DerivedData 缓存与 iOS CI/CD 自动化的生产环境,NodeMini 的 Mac Mini 云端租赁通常是更优解——独占节点、秒级拨备,让 Agent 与构建任务在同一台真实 Mac 上持续运行。详见 Mac Mini 租赁价格。
完整 2.8T 权重计划于 2026 年 7 月 27 日在 Moonshot 的 Hugging Face 组织上架,同步发布技术报告。API 与 Kimi 全家桶已于 7 月 16 日上线。
准确说法是 open weights(开源权重),非 fully open source。综合智能 K3 更强(2.8T vs DeepSeek V4 Pro 1.6T、1M vs 128K 上下文),但 DeepSeek 输出仅 $3.48/M,成本显著更低。成本敏感选 DeepSeek,长代码/文档理解选 K3。
kimi.com 免费账号可用 K3;API 为 $3/$15 per 1M tokens,缓存命中 $0.30/M。若需稳定 Agent 运行环境,可参考 Mac Mini 租赁价格。
4-bit 权重大约 1.4 TB,官方建议 64+ 加速器超节点,消费级 GPU 无法承载。自部署仅在数据驻留、微调或超大规模调用三种场景成立;其余用 API。
综合智能 K3 排第三(57.1),落后 Fable 5(59.9)和 GPT-5.6 Sol(58.9)。K3 在 Frontend Code Arena、SWE Marathon、BrowseComp 等编码基准领先;长程推理与幻觉控制仍逊于顶级闭源。更多运维问题见 帮助中心。
Modified MIT 许可证,具体条款待 7 月 27 日发布日确认原文。发布日务必逐条核对 LICENSE 文件。