Kimi K3 全面開源
2.8 萬億參數、百萬上下文,月之暗面這次放了什麼大招

7 月 27 日晚,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,並同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——這是全球首個被完整開放的 3 萬億參數級別模型,Hugging Face 權重約 1.56TB,上線半小時登頂趨勢榜第一。本文面向關注開放權重許可MoE 架構創新自部署可行性的開發者,完整涵蓋:11 天從 API 首發到權重全面開源的時間線KDA/AttnRes/Per-Head Muon 架構解析三大 Infra 開源能力SWE-bench 與 AA Index 跑分對比許可證兩道商業門檻API 定價與 64 卡自部署真相六步評估接入清單FAQ。核心結論:K3 是開源陣營能力天花板,但不是性價比最優選——官方從未自稱「開源」,而是堅持使用 open weight(開放權重) 表述。

01

從 API 首發到全面開源:Kimi K3 只用了 11 天,背後有哪些痛點?

開發者最困惑的三件事:7/16 已經能調 API,7/27 又發布了什麼?「開源」和「開放權重」差在哪?自部署到底要多少卡? 以下時間線幫你一次理清。

日期事件
7/16 夜Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首發,權重尚未公開
7/17新華社報導稱其為「目前全球參數最大的開源模型」;業界密集分析架構
7/22–23美方指控月之暗面對 Anthropic Fable 模型進行「工業化蒸餾」,威脅制裁
7/27 23:00完整權重、技術報告發布;MoonEP、AgentEnv 開源(FlashKDA 此前已開源)
7/28中國商務部回應中美 AI 爭端;國內媒體跟進報導開源細節

企業用戶最關心的三個隱性成本

  1. 01

    許可誤讀風險:媒體普遍寫「開源」,但官方從未使用 open source,自訂許可證含 MaaS 收入與規模展示兩道門檻

  2. 02

    自部署幻覺:1.56TB 權重 + 896 專家 MoE,消費級 GPU 完全無法承載,盲目採購硬體是最大隱性成本

  3. 03

    跑分誤用:廠商自報與第三方複測差異大,須優先引用 Vals AI、Artificial Analysis 等獨立資料

  4. 04

    快取定價陷阱:表頭輸入 $3/M,但 Mooncake 架構在程式設計負載上快取命中率超 90%,實際成本更接近 $0.30/M

  5. 05

    地緣合規:中美「模型蒸餾」爭端疊加 WAIC 2026 視窗,權重公開不等於訓練過程可審計

  6. 06

    Agent 執行環境:長會話編碼 Agent 需要穩定算力與工具鏈,筆電或低配 VPS 難以支撐生產級流水線

02

Kimi K3 核心參數與架構創新:KDA、AttnRes、Stable LatentMoE 一覽

項目參數
總參數量2.8 萬億(2.8T)
啟動參數量約 1040 億
架構類型混合專家模型(MoE),896 路由專家,每 token 啟動 16 個
注意力機制Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗100 萬 token
多模態原生視覺理解(ViT-V2,27 層)
權重格式MXFP4 權重 + MXFP8 啟動(量化感知訓練)
權重體積約 1.56TB(Hugging Face)
License自訂許可證(官方稱 open weight,非 open source)

Kimi Delta Attention(KDA):逐通道精細遺忘

傳統 Gated DeltaNet 用標量級遺忘門,KDA 改為逐通道門控——每個特徵維度獨立衰減,配合 chunkwise DPLR 公式實現線性時間遞迴,與少量 Gated MLA 層交替混合,支撐 100 萬 token 上下文同時將 KV Cache 壓到極低。

Attention Residuals(AttnRes):選擇性殘差聚合

傳統殘差連接均勻累加各層輸出,深層易稀釋早期資訊。AttnRes 改為輸入依賴的動態聚合,每層僅增 RMSNorm 與一個偽查詢向量,帶來約 25% 訓練效率提升,參數開銷不到 2%。

Per-Head Muon 與 Stable LatentMoE

Per-Head Muon 讓每個注意力頭獨立最佳化收斂路徑;MoE 層 896 選 16(稀疏度約 1.8%),配合 Quantile Balancing 與 MoonEP 從數學上證明冗餘專家數上界,解決大規模 MoE 負載不均衡。

月之暗面重構了注意力、殘差連接與最佳化器三大傳統元件——這才是 K3 區別於「簡單堆參數」的關鍵,而非僅靠 2.8T 規模。

03

MoonEP、FlashKDA、AgentEnv:三大 Infra 開源與六步接入清單

這次發布不只釋出權重,而是把支撐 K3 訓練效率的三項關鍵基礎設施一併開源——這也是開發者社群評價較高的原因。

技術定位關鍵能力
MoonEP超大規模細粒度 MoE 通訊庫臨時複製過載專家,保證每節點均等 token 數;證明冗餘專家數理論上界
FlashKDA基於 CUTLASS 的 KDA 高效能算子H20 上 prefill 較基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端
AgentEnvFirecracker microVM 智慧體沙箱checkpoint 延遲低至 133ms、恢復 49ms、記憶體超分最高 6.5 倍(官方資料)

六步評估與接入實操清單

  1. 01

    確認使用路徑:絕大多數團隊應走 API(`https://api.moonshot.ai/v1`,模型 ID `kimi-k3`),僅資料駐留/微調/超大規模推理考慮自部署

  2. 02

    逐條閱讀 LICENSE:核對 MaaS 年收入 2000 萬美元門檻與月活 1 億/月收入 2000 萬美元展示義務

  3. 03

    驗證 Hugging Face 權重完整性:約 1.56TB,確認 MXFP4 格式與分片清單

  4. 04

    評估硬體門檻:官方建議 64 卡及以上超節點;勿按消費級 GPU 規劃

  5. 05

    接入 FlashKDA:現有 flash-linear-attention 專案可無縫切換 chunk_kda 後端獲加速

  6. 06

    對照獨立跑分:以 Vals AI SWE-bench Verified(K3 93.4%)與 AA Index(約 57,全球第 3)為選型基準,勿只看廠商自報

python
from openai import OpenAI
client = OpenAI(
    api_key="YOUR_MOONSHOT_KEY",
    base_url="https://api.moonshot.ai/v1"
)
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(resp.choices[0].message.content)
04

跑分對比與許可證門檻:K3 vs GPT-5.6、Claude、GLM-5.2 怎麼選?

SWE-bench Verified(Vals AI 獨立複測,2026 年 7 月)

模型分數發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
GLM-5.2(此前開源第一)AA Index 51

成本與能力決策矩陣

維度Kimi K3Claude Fable 5GLM-5.2
AA Intelligence Index約 57(全球第 3,開源第 1)6051
單任務成本約 $0.95約 $2.4約 $0.47
上下文100 萬 token較短較短
權重可下載是(1.56TB)
定位開源陣營能力天花板閉源綜合最強之一開源性價比最優
warning

許可證兩道商業門檻(K2 時代沒有):① 營運 MaaS 業務且連續 12 個月收入超 2000 萬美元,須與月之暗面另行簽署商業協議;② 月活超 1 億或月收入超 2000 萬美元,須在介面顯著展示「Kimi K3」字樣。對絕大多數中小團隊無影響;若計畫與 kimi.com 直接競爭的模型服務,法務須重點審查。

API 定價(每百萬 token)

Token 類型價格
輸入(快取命中)$0.30
輸入(快取未命中)$3.00
輸出(含推理過程)$15.00
05

中美 AI 競賽背景與可引用資料:K3 開源釋放了什麼訊號?

Kimi K3 開源節點卡在 WAIC 2026 視窗期,疊加升級中的中美「模型蒸餾」爭端——美方指控月之暗面工業化蒸餾 Anthropic Fable 訓練 K3 並威脅制裁;中國商務部 7 月 28 日回應指責「AI 霸權主義」。在此背景下全面公開權重、技術報告與三項 Infra,是用工程細節自證技術路徑獨立性的態度表達。三天後阿里巴巴發布 24 萬億參數 Qwen3.8-Max-Preview,國產大模型競爭正式進入「3T 俱樂部」階段。

可引用關鍵資料速查

  • 規模:2.8T 總參數,896 專家啟動 16 個,啟動參數約 1040 億,1M token 上下文
  • 跑分:SWE-bench Verified 93.4%(Vals AI);AA Index 約 57,全球第 3、開源第 1
  • 成本:單任務約 $0.95,比 Fable 5 便宜約 60%,但比 GLM-5.2($0.47)更貴
  • 編碼:Frontend Code Arena 榜單第 1;Mooncake 快取命中率程式設計負載超 90%
  • 自部署:1.56TB 權重,官方建議 64+ 卡超節點;OpenRouter 等 7 家第三方已託管
  • 許可:自訂 open weight 許可,非 OSI 開源;含 MaaS 收入與規模展示兩道門檻

若你計畫將 K3 接入 Kimi Code 類長會話 Agent 或 iOS CI 流水線,在筆電或不穩定 Linux VPS上跑 CLI Agent 常面臨記憶體不足、會話中斷與 Xcode/Metal 工具鏈缺失。對於需要穩定 SSH 長會話、DerivedData 快取與 iOS CI/CD 自動化的生產環境,NodeMini 的 Mac Mini 雲端租賃通常是更優解——獨佔節點、秒級撥備,讓 Agent 與建置任務在同一台真實 Mac 上持續執行。詳見 Mac Mini 租賃價格

FAQ

常見問題

嚴格來說不是。它屬於開放權重(open weight)模型:權重、技術報告和部分 Infra 工具公開,但訓練資料和完整訓練程式碼未公開,不符合 OSI「開源」定義。月之暗面官方材料從未使用 open source 一詞。

絕大多數商業場景不受限制。但若營運 MaaS 業務且年收入超 2000 萬美元,或月活超 1 億/月收入超 2000 萬美元,須滿足許可證特定條款。部署環境可參考 Mac Mini 租賃價格

官方建議 64 卡及以上超節點叢集。個人與大部分企業更現實的路徑是透過官方 API 或 OpenRouter 等第三方平台呼叫(目前已有 7 家服務商上線)。

開源陣營綜合能力最強:AA Index 全球第 3,僅次於 Claude Fable 5 和 GPT-5.6 Sol;但成本高於 GLM-5.2,屬於「天花板最高、非性價比最優」。更多維運問題見 幫助中心

K3 參數約為 K2.5 的 3 倍,新增 Attention Residuals 與 Per-Head Muon,上下文與多模態大幅提升;許可證從 K2 的 Modified MIT 改為自訂檔案,新增 MaaS 收入門檻。