距2026 年 7 月 27 日完整權重公開還有 5 天:月之暗面(Moonshot AI)將於 Hugging Face 以 Modified MIT 許可發布 2.8 萬億參數 Kimi K3 權重——全球首個 3T 級開源權重模型。本文面向關注K3 權重下載、本地部署可行性與閉源模型溢價的開發者,完整涵蓋:7/16 API 上線 vs 7/27 權重公開兩階段時間線、模型規格與跑分對比、API 定價與快取真實成本、open weights 與 open source 辨析、1.4TB 自部署硬體真相、發布日六步核對清單、產業意義與 FAQ。核心結論:K3 不是「Fable 5 殺手」,綜合智能排第三,但以約 1/3 成本達到接近前沿能力,且擁有閉源給不了的兩樣東西——開源權重 + 100 萬 token 上下文。
當前最大搜尋困惑是「K3 已經能用了,7 月 27 日還要發布什麼?」——答案是:7 月 16 日上線的是 API 與 Kimi 全家桶產品;7 月 27 日才公開可下載的完整模型權重與技術報告。
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 透過 API、Kimi App、Kimi Work、Kimi Code 上線;Artificial Analysis 同日發布獨立評測 |
| 2026-07-17 | 上海世界人工智慧大會(WAIC)開幕;新華社將 K3 發布定調為「國家級里程碑」 |
| 2026-07-27 | 完整權重公開下載(Hugging Face,Modified MIT 許可)+ 技術報告(架構、訓練、評估細節) |
| 項目 | 資料 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T),史上最大開源權重模型 |
| 架構 | 稀疏 MoE:Stable LatentMoE,896 專家中每 token 啟動 16 個 |
| 注意力 | Kimi Delta Attention(KDA)+ Attention Residuals(AttnRes)+ Gated MLA |
| 上下文 | 1,048,576 tokens(約 100 萬) |
| 模態 | 原生視覺理解(文字 + 影像,產品端支援影片),輸出為文字 |
| 權重格式 | MXFP4 權重 + MXFP8 啟動(4-bit 量化接近訓練精度) |
| 擴展效率 | 較 K2 提升約 2.5 倍(同等算力換更多智能) |
| 訓練穩定性 | Quantile Balancing、Per-Head Muon 最佳化器、SiTU 啟動函數 |
| 長上下文解碼 | KDA 在百萬 token 上下文中最高 6.3 倍解碼加速 |
K3 不是「Fable 5 殺手」——綜合智能仍排第三,但以約 1/3 的成本達到「接近前沿」的能力,且擁有閉源模型給不了的兩樣東西:開源權重 + 100 萬 token 上下文。
資料駐留:嚴格合規場景需要權重落地而非 API 呼叫
微調需求:在自有資料上繼續訓練必須拿到完整權重
呼叫量極大:超大規模推理時自建硬體可能更划算
生態對齊:vLLM 對 KDA / prefix caching 將隨權重落地
量化跟進:預期 Ollama、GGUF 版本將像 K2 系列一樣陸續出現
許可確認:Modified MIT 原文需在發布日核對,不可提前假設條款
Artificial Analysis Intelligence Index(7 月 16 日獨立評測)給出綜合排名:
| 模型 | AA Intelligence Index | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | 第 1 |
| GPT-5.6 Sol | 58.9 | 第 2 |
| Kimi K3 | 57.1 | 第 3 / 189 |
官方誠實態度(值得引用):月之暗面罕見地主動承認綜合性能仍落後 Fable 5 和 GPT-5.6 Sol,並列出已知短板——對 harness 傳回推理內容敏感、意圖模糊時過於主動等。不同模型使用了各自的推理 harness,獨立第三方複現仍在進行中。
| 項目 | 價格(每百萬 tokens) |
|---|---|
| 輸入(快取未命中) | $3.00 |
| 輸入(快取命中,自動快取) | $0.30 |
| 輸出 | $15.00 |
K3 定價刻意對齊西方標準(走「品質牌」而非「低價牌」),是目前中國大模型廠商中最高的 API 定價,但仍顯著低於 Claude Opus 4.8 的單任務成本。Artificial Analysis 實測單任務成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%。編碼類工作負載快取命中率據稱超 90%,實際成本遠低於表面單價。
| 方案 | 適合誰 | 7/27 前 | 7/27 後 |
|---|---|---|---|
| API($3/$15) | 絕大多數開發者與企業 | 可用 | 仍推薦 |
| 自部署(64+ 加速器) | 資料駐留 / 微調 / 超大規模呼叫 | 權重未公開 | 僅限三類場景 |
| 消費級本地 GPU | 個人實驗 | 不可用 | 不可用(4-bit 約 1.4 TB) |
英文社群嚴格區分 open weights(只放權重)與 open source(含訓練程式碼/資料)。Kimi K3 屬於前者——7 月 27 日公開的是完整模型權重(Modified MIT 許可證,具體條款待發布日確認),而非訓練程式碼與資料集的全棧開源。
自部署現實(別被「本地跑大模型」標題黨誤導):4-bit 權重約 1.4 TB,官方建議 64+ 加速器的「超節點」部署,需要專家並行 + 張量並行的分散式推理。參照:上一代 1T 參數的 K2.7 Code,INT4 也要約 577 GB 顯存;K3 是它的 2.8 倍。對絕大多數人正確答案是 API($3/$15)。
HF 儲存庫檔案是否齊全:檢查 Moonshot Hugging Face 組織下的完整檔案清單
LICENSE 原文:逐條閱讀 Modified MIT 具體條款,確認商用與再分發限制
量化版本:關注 MXFP4/NVFP4 等官方或社群量化套件
vLLM / SGLang 啟動命令:核對 KDA 與 prefix caching 的官方範例
最低可行硬體:對照技術報告中的分散式推理要求,勿按消費級 GPU 規劃
獨立長上下文複測:關注社群首批獨立 benchmark 與 r/LocalLLaMA 複現討論
開源與閉源能力差距在前沿基本閉合:差距從「數百分」縮到「兩三分」,閉源廠商很難再純靠能力證明溢價
地緣背景:發布趕在 WAIC 前;一個月前美國政府曾短暫下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢復)——「監管可以關掉閉源模型,但關不掉已發布的開源權重」成為新論據
中國廠商梯隊集體逼近:Z.ai GLM-5.2(編碼對標 Opus 4.8、價格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等,K3 是這波浪潮的最高點
月之暗面的翻身仗:2025 年初被 DeepSeek R1 衝擊後排名跌至國內第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的開源路線重建地位
信源:官方 kimi.com 技術博客、platform.kimi.ai;獨立評測 Artificial Analysis(7 月 16 日);深度報導 VentureBeat、Northflank;社群 r/LocalLLaMA、Hacker News。更多架構細節可參考本站 Kimi K3 深度評測。
若你計畫在 7/27 後將 K3 接入 Kimi Code 類長會話 Agent 或 iOS CI 流水線,在筆電或不穩定 Linux VPS上跑 CLI Agent 常面臨記憶體不足、會話中斷與 Xcode/Metal 工具鏈缺失。對於需要穩定 SSH 長會話、DerivedData 快取與 iOS CI/CD 自動化的生產環境,NodeMini 的 Mac Mini 雲端租賃通常是更優解——獨佔節點、秒級撥備,讓 Agent 與建置任務在同一台真實 Mac 上持續執行。詳見 Mac Mini 租賃價格。
完整 2.8T 權重計畫於 2026 年 7 月 27 日在 Moonshot 的 Hugging Face 組織上架,同步發布技術報告。API 與 Kimi 全家桶已於 7 月 16 日上線。
準確說法是 open weights(開源權重),非 fully open source。綜合智能 K3 更強(2.8T vs DeepSeek V4 Pro 1.6T、1M vs 128K 上下文),但 DeepSeek 輸出僅 $3.48/M,成本顯著更低。成本敏感選 DeepSeek,長程式碼/文件理解選 K3。
kimi.com 免費帳號可用 K3;API 為 $3/$15 per 1M tokens,快取命中 $0.30/M。若需穩定 Agent 執行環境,可參考 Mac Mini 租賃價格。
4-bit 權重大約 1.4 TB,官方建議 64+ 加速器超節點,消費級 GPU 無法承載。自部署僅在資料駐留、微調或超大規模呼叫三種場景成立;其餘用 API。
綜合智能 K3 排第三(57.1),落後 Fable 5(59.9)和 GPT-5.6 Sol(58.9)。K3 在 Frontend Code Arena、SWE Marathon、BrowseComp 等編碼基準領先;長程推理與幻覺控制仍遜於頂級閉源。更多維運問題見 幫助中心。
Modified MIT 許可證,具體條款待 7 月 27 日發布日確認原文。發布日務必逐條核對 LICENSE 檔案。