7 月 27 日晚,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——這是全球首個被完整開放的 3 萬億參數級別模型,Hugging Face 權重約 1.56TB,上線半小時登頂趨勢榜第一。本文面向關注開放權重許可、MoE 架構創新與自部署可行性的開發者,完整涵蓋:11 天從 API 首發到權重全面開源的時間線、KDA/AttnRes/Per-Head Muon 架構解析、三大 Infra 開源能力、SWE-bench 與 AA Index 跑分對比、許可證兩道商業門檻、API 定價與 64 卡自部署真相、六步評估接入清單與 FAQ。核心結論:K3 是開源陣營能力天花板,但不是性價比最優選——官方從未自稱「開源」,而是堅持使用 open weight(開放權重) 表述。
開發者最困惑的三件事:7/16 已經能調 API,7/27 又發布了什麼?「開源」和「開放權重」差在哪?自部署到底要多少卡? 以下時間線幫你一次理清。
| 日期 | 事件 |
|---|---|
| 7/16 夜 | Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首發,權重尚未公開 |
| 7/17 | 新華社報導稱其為「目前全球參數最大的開源模型」;業界密集分析架構 |
| 7/22–23 | 美方指控月之暗面對 Anthropic Fable 模型進行「工業化蒸餾」,威脅制裁 |
| 7/27 23:00 | 完整權重、技術報告發布;MoonEP、AgentEnv 開源(FlashKDA 此前已開源) |
| 7/28 | 中國商務部回應中美 AI 爭端;國內媒體跟進報導開源細節 |
許可誤讀風險:媒體普遍寫「開源」,但官方從未使用 open source,自訂許可證含 MaaS 收入與規模展示兩道門檻
自部署幻覺:1.56TB 權重 + 896 專家 MoE,消費級 GPU 完全無法承載,盲目採購硬體是最大隱性成本
跑分誤用:廠商自報與第三方複測差異大,須優先引用 Vals AI、Artificial Analysis 等獨立資料
快取定價陷阱:表頭輸入 $3/M,但 Mooncake 架構在程式設計負載上快取命中率超 90%,實際成本更接近 $0.30/M
地緣合規:中美「模型蒸餾」爭端疊加 WAIC 2026 視窗,權重公開不等於訓練過程可審計
Agent 執行環境:長會話編碼 Agent 需要穩定算力與工具鏈,筆電或低配 VPS 難以支撐生產級流水線
| 項目 | 參數 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T) |
| 啟動參數量 | 約 1040 億 |
| 架構類型 | 混合專家模型(MoE),896 路由專家,每 token 啟動 16 個 |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA) |
| 上下文視窗 | 100 萬 token |
| 多模態 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 啟動(量化感知訓練) |
| 權重體積 | 約 1.56TB(Hugging Face) |
| License | 自訂許可證(官方稱 open weight,非 open source) |
傳統 Gated DeltaNet 用標量級遺忘門,KDA 改為逐通道門控——每個特徵維度獨立衰減,配合 chunkwise DPLR 公式實現線性時間遞迴,與少量 Gated MLA 層交替混合,支撐 100 萬 token 上下文同時將 KV Cache 壓到極低。
傳統殘差連接均勻累加各層輸出,深層易稀釋早期資訊。AttnRes 改為輸入依賴的動態聚合,每層僅增 RMSNorm 與一個偽查詢向量,帶來約 25% 訓練效率提升,參數開銷不到 2%。
Per-Head Muon 讓每個注意力頭獨立最佳化收斂路徑;MoE 層 896 選 16(稀疏度約 1.8%),配合 Quantile Balancing 與 MoonEP 從數學上證明冗餘專家數上界,解決大規模 MoE 負載不均衡。
月之暗面重構了注意力、殘差連接與最佳化器三大傳統元件——這才是 K3 區別於「簡單堆參數」的關鍵,而非僅靠 2.8T 規模。
這次發布不只釋出權重,而是把支撐 K3 訓練效率的三項關鍵基礎設施一併開源——這也是開發者社群評價較高的原因。
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 通訊庫 | 臨時複製過載專家,保證每節點均等 token 數;證明冗餘專家數理論上界 |
| FlashKDA | 基於 CUTLASS 的 KDA 高效能算子 | H20 上 prefill 較基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端 |
| AgentEnv | Firecracker microVM 智慧體沙箱 | checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(官方資料) |
確認使用路徑:絕大多數團隊應走 API(`https://api.moonshot.ai/v1`,模型 ID `kimi-k3`),僅資料駐留/微調/超大規模推理考慮自部署
逐條閱讀 LICENSE:核對 MaaS 年收入 2000 萬美元門檻與月活 1 億/月收入 2000 萬美元展示義務
驗證 Hugging Face 權重完整性:約 1.56TB,確認 MXFP4 格式與分片清單
評估硬體門檻:官方建議 64 卡及以上超節點;勿按消費級 GPU 規劃
接入 FlashKDA:現有 flash-linear-attention 專案可無縫切換 chunk_kda 後端獲加速
對照獨立跑分:以 Vals AI SWE-bench Verified(K3 93.4%)與 AA Index(約 57,全球第 3)為選型基準,勿只看廠商自報
| 模型 | 分數 | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| GLM-5.2(此前開源第一) | — | AA Index 51 |
| 維度 | Kimi K3 | Claude Fable 5 | GLM-5.2 |
|---|---|---|---|
| AA Intelligence Index | 約 57(全球第 3,開源第 1) | 60 | 51 |
| 單任務成本 | 約 $0.95 | 約 $2.4 | 約 $0.47 |
| 上下文 | 100 萬 token | 較短 | 較短 |
| 權重可下載 | 是(1.56TB) | 否 | 是 |
| 定位 | 開源陣營能力天花板 | 閉源綜合最強之一 | 開源性價比最優 |
許可證兩道商業門檻(K2 時代沒有):① 營運 MaaS 業務且連續 12 個月收入超 2000 萬美元,須與月之暗面另行簽署商業協議;② 月活超 1 億或月收入超 2000 萬美元,須在介面顯著展示「Kimi K3」字樣。對絕大多數中小團隊無影響;若計畫與 kimi.com 直接競爭的模型服務,法務須重點審查。
| Token 類型 | 價格 |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
Kimi K3 開源節點卡在 WAIC 2026 視窗期,疊加升級中的中美「模型蒸餾」爭端——美方指控月之暗面工業化蒸餾 Anthropic Fable 訓練 K3 並威脅制裁;中國商務部 7 月 28 日回應指責「AI 霸權主義」。在此背景下全面公開權重、技術報告與三項 Infra,是用工程細節自證技術路徑獨立性的態度表達。三天後阿里巴巴發布 24 萬億參數 Qwen3.8-Max-Preview,國產大模型競爭正式進入「3T 俱樂部」階段。
若你計畫將 K3 接入 Kimi Code 類長會話 Agent 或 iOS CI 流水線,在筆電或不穩定 Linux VPS上跑 CLI Agent 常面臨記憶體不足、會話中斷與 Xcode/Metal 工具鏈缺失。對於需要穩定 SSH 長會話、DerivedData 快取與 iOS CI/CD 自動化的生產環境,NodeMini 的 Mac Mini 雲端租賃通常是更優解——獨佔節點、秒級撥備,讓 Agent 與建置任務在同一台真實 Mac 上持續執行。詳見 Mac Mini 租賃價格。
嚴格來說不是。它屬於開放權重(open weight)模型:權重、技術報告和部分 Infra 工具公開,但訓練資料和完整訓練程式碼未公開,不符合 OSI「開源」定義。月之暗面官方材料從未使用 open source 一詞。
絕大多數商業場景不受限制。但若營運 MaaS 業務且年收入超 2000 萬美元,或月活超 1 億/月收入超 2000 萬美元,須滿足許可證特定條款。部署環境可參考 Mac Mini 租賃價格。
官方建議 64 卡及以上超節點叢集。個人與大部分企業更現實的路徑是透過官方 API 或 OpenRouter 等第三方平台呼叫(目前已有 7 家服務商上線)。
開源陣營綜合能力最強:AA Index 全球第 3,僅次於 Claude Fable 5 和 GPT-5.6 Sol;但成本高於 GLM-5.2,屬於「天花板最高、非性價比最優」。更多維運問題見 幫助中心。
K3 參數約為 K2.5 的 3 倍,新增 Attention Residuals 與 Per-Head Muon,上下文與多模態大幅提升;許可證從 K2 的 Modified MIT 改為自訂檔案,新增 MaaS 收入門檻。