Kimi K3 開源權重
7 月 27 日發布:2.8 萬億參數,閉源溢價還守得住嗎?

2026 年 7 月 27 日完整權重公開還有 5 天:月之暗面(Moonshot AI)將於 Hugging Face 以 Modified MIT 許可發布 2.8 萬億參數 Kimi K3 權重——全球首個 3T 級開源權重模型。本文面向關注K3 權重下載本地部署可行性閉源模型溢價的開發者,完整涵蓋:7/16 API 上線 vs 7/27 權重公開兩階段時間線模型規格與跑分對比API 定價與快取真實成本open weights 與 open source 辨析1.4TB 自部署硬體真相發布日六步核對清單產業意義FAQ。核心結論:K3 不是「Fable 5 殺手」,綜合智能排第三,但以約 1/3 成本達到接近前沿能力,且擁有閉源給不了的兩樣東西——開源權重 + 100 萬 token 上下文

01

Kimi K3 發布時間表:API 上線 vs 開源權重,別搞混兩個日期

當前最大搜尋困惑是「K3 已經能用了,7 月 27 日還要發布什麼?」——答案是:7 月 16 日上線的是 API 與 Kimi 全家桶產品;7 月 27 日才公開可下載的完整模型權重與技術報告。

日期事件
2026-07-16Kimi K3 透過 API、Kimi App、Kimi Work、Kimi Code 上線;Artificial Analysis 同日發布獨立評測
2026-07-17上海世界人工智慧大會(WAIC)開幕;新華社將 K3 發布定調為「國家級里程碑」
2026-07-27完整權重公開下載(Hugging Face,Modified MIT 許可)+ 技術報告(架構、訓練、評估細節)

Kimi K3 核心規格一覽

項目資料
總參數量2.8 萬億(2.8T),史上最大開源權重模型
架構稀疏 MoE:Stable LatentMoE,896 專家中每 token 啟動 16 個
注意力Kimi Delta Attention(KDA)+ Attention Residuals(AttnRes)+ Gated MLA
上下文1,048,576 tokens(約 100 萬)
模態原生視覺理解(文字 + 影像,產品端支援影片),輸出為文字
權重格式MXFP4 權重 + MXFP8 啟動(4-bit 量化接近訓練精度)
擴展效率較 K2 提升約 2.5 倍(同等算力換更多智能)
訓練穩定性Quantile Balancing、Per-Head Muon 最佳化器、SiTU 啟動函數
長上下文解碼KDA 在百萬 token 上下文中最高 6.3 倍解碼加速

K3 不是「Fable 5 殺手」——綜合智能仍排第三,但以約 1/3 的成本達到「接近前沿」的能力,且擁有閉源模型給不了的兩樣東西:開源權重 + 100 萬 token 上下文。

為什麼 7/27 權重發布值得提前關注?

  1. 01

    資料駐留:嚴格合規場景需要權重落地而非 API 呼叫

  2. 02

    微調需求:在自有資料上繼續訓練必須拿到完整權重

  3. 03

    呼叫量極大:超大規模推理時自建硬體可能更划算

  4. 04

    生態對齊:vLLM 對 KDA / prefix caching 將隨權重落地

  5. 05

    量化跟進:預期 Ollama、GGUF 版本將像 K2 系列一樣陸續出現

  6. 06

    許可確認:Modified MIT 原文需在發布日核對,不可提前假設條款

02

Kimi K3 跑分對比:哪裡領先 Claude Fable 5 和 GPT-5.6?

Artificial Analysis Intelligence Index(7 月 16 日獨立評測)給出綜合排名:

模型AA Intelligence Index排名
Claude Fable 559.9第 1
GPT-5.6 Sol58.9第 2
Kimi K357.1第 3 / 189

K3 領先或打平的基準

  • Frontend Code Arena:第 1(盲測中開發者偏好其 UI 程式碼超過 Fable 和 Sol)
  • Automation Bench、SpreadsheetBench 2:第 1
  • BrowseComp:91.2(第 1;配合 1M 上下文無壓縮策略可達 90.4+)
  • SWE Marathon(超長編碼會話):42.0,明顯領先(GPT-5.5 / GLM-5.2 在此崩到十幾分)
  • Terminal Bench 2.1:88.3,與 GPT-5.6 Sol 的 88.8 基本打平
  • Program Bench:77.8,微超 Sol 的 77.6
  • FrontierSWE:81.2,大幅超 Sol 的 71.3(但落後 Fable 5 的 86.6)

K3 仍落後的領域

  • GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748(長程判斷力仍是 Fable 的天下)
  • DeepSWE:67.5 vs Sol 的 73.0
  • 幻覺率:較 K2.6 有所上升(官方承認);Reddit 有使用者回饋接入自建應用後「幻覺明顯多於頂級閉源模型」
  • 對話打磨度與穩定性:單次會話方差仍遜於 Fable 5 / Sol
info

官方誠實態度(值得引用):月之暗面罕見地主動承認綜合性能仍落後 Fable 5 和 GPT-5.6 Sol,並列出已知短板——對 harness 傳回推理內容敏感、意圖模糊時過於主動等。不同模型使用了各自的推理 harness,獨立第三方複現仍在進行中。

03

Kimi K3 API 定價:表面單價 vs 快取命中後的真實成本

項目價格(每百萬 tokens)
輸入(快取未命中)$3.00
輸入(快取命中,自動快取)$0.30
輸出$15.00

K3 定價刻意對齊西方標準(走「品質牌」而非「低價牌」),是目前中國大模型廠商中最高的 API 定價,但仍顯著低於 Claude Opus 4.8 的單任務成本。Artificial Analysis 實測單任務成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%。編碼類工作負載快取命中率據稱超 90%,實際成本遠低於表面單價。

方案適合誰7/27 前7/27 後
API($3/$15)絕大多數開發者與企業可用仍推薦
自部署(64+ 加速器)資料駐留 / 微調 / 超大規模呼叫權重未公開僅限三類場景
消費級本地 GPU個人實驗不可用不可用(4-bit 約 1.4 TB)
04

Kimi K3 是開源模型嗎?Open Weights vs Open Source

英文社群嚴格區分 open weights(只放權重)與 open source(含訓練程式碼/資料)。Kimi K3 屬於前者——7 月 27 日公開的是完整模型權重(Modified MIT 許可證,具體條款待發布日確認),而非訓練程式碼與資料集的全棧開源。

7 月 27 日開源發布具體會發生什麼

  • 完整 2.8T 權重上架 Moonshot 的 Hugging Face 組織
  • 同步發布技術報告(架構、訓練、評估細節)
  • vLLM 對 KDA / prefix caching 的支援將隨權重一起落地
  • 預期後續:Ollama、GGUF 量化版本會像 K2 系列一樣陸續跟進
warning

自部署現實(別被「本地跑大模型」標題黨誤導):4-bit 權重約 1.4 TB,官方建議 64+ 加速器的「超節點」部署,需要專家並行 + 張量並行的分散式推理。參照:上一代 1T 參數的 K2.7 Code,INT4 也要約 577 GB 顯存;K3 是它的 2.8 倍。對絕大多數人正確答案是 API($3/$15)

7 月 27 日發布日六步核對清單

  1. 01

    HF 儲存庫檔案是否齊全:檢查 Moonshot Hugging Face 組織下的完整檔案清單

  2. 02

    LICENSE 原文:逐條閱讀 Modified MIT 具體條款,確認商用與再分發限制

  3. 03

    量化版本:關注 MXFP4/NVFP4 等官方或社群量化套件

  4. 04

    vLLM / SGLang 啟動命令:核對 KDA 與 prefix caching 的官方範例

  5. 05

    最低可行硬體:對照技術報告中的分散式推理要求,勿按消費級 GPU 規劃

  6. 06

    獨立長上下文複測:關注社群首批獨立 benchmark 與 r/LocalLLaMA 複現討論

05

7 月 27 日權重發布為何動搖閉源溢價?產業意義與可引用資料

四個評論角度

  1. 01

    開源與閉源能力差距在前沿基本閉合:差距從「數百分」縮到「兩三分」,閉源廠商很難再純靠能力證明溢價

  2. 02

    地緣背景:發布趕在 WAIC 前;一個月前美國政府曾短暫下架 Anthropic 的 Fable/Mythos 模型(7 月 1 日恢復)——「監管可以關掉閉源模型,但關不掉已發布的開源權重」成為新論據

  3. 03

    中國廠商梯隊集體逼近:Z.ai GLM-5.2(編碼對標 Opus 4.8、價格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等,K3 是這波浪潮的最高點

  4. 04

    月之暗面的翻身仗:2025 年初被 DeepSeek R1 衝擊後排名跌至國內第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 的開源路線重建地位

可引用關鍵資料速查

  • 規模:2.8T 總參數,896 專家啟動 16 個,1M token 上下文(1,048,576)
  • 綜合智能:AA Index 57.1 / Sol 58.9 / Fable 5 59.9(第 3 名/189)
  • 單任務成本:K3 $0.94,比 Fable 5 低 65.8%
  • API:$3 輸入 / $0.30 快取命中 / $15 輸出(每百萬 tokens)
  • 自部署:4-bit 權重約 1.4 TB;官方建議 64+ 加速器
  • 編碼亮點:Frontend Code Arena 第 1;SWE Marathon 42.0
  • 已知短板:官方承認綜合能力仍落後 Fable 5 / GPT-5.6 Sol,幻覺率較 K2.6 上升

信源:官方 kimi.com 技術博客platform.kimi.ai;獨立評測 Artificial Analysis(7 月 16 日);深度報導 VentureBeat、Northflank;社群 r/LocalLLaMA、Hacker News。更多架構細節可參考本站 Kimi K3 深度評測

若你計畫在 7/27 後將 K3 接入 Kimi Code 類長會話 Agent 或 iOS CI 流水線,在筆電或不穩定 Linux VPS上跑 CLI Agent 常面臨記憶體不足、會話中斷與 Xcode/Metal 工具鏈缺失。對於需要穩定 SSH 長會話、DerivedData 快取與 iOS CI/CD 自動化的生產環境,NodeMini 的 Mac Mini 雲端租賃通常是更優解——獨佔節點、秒級撥備,讓 Agent 與建置任務在同一台真實 Mac 上持續執行。詳見 Mac Mini 租賃價格

FAQ

常見問題

完整 2.8T 權重計畫於 2026 年 7 月 27 日在 Moonshot 的 Hugging Face 組織上架,同步發布技術報告。API 與 Kimi 全家桶已於 7 月 16 日上線。

準確說法是 open weights(開源權重),非 fully open source。綜合智能 K3 更強(2.8T vs DeepSeek V4 Pro 1.6T、1M vs 128K 上下文),但 DeepSeek 輸出僅 $3.48/M,成本顯著更低。成本敏感選 DeepSeek,長程式碼/文件理解選 K3。

kimi.com 免費帳號可用 K3;API 為 $3/$15 per 1M tokens,快取命中 $0.30/M。若需穩定 Agent 執行環境,可參考 Mac Mini 租賃價格

4-bit 權重大約 1.4 TB,官方建議 64+ 加速器超節點,消費級 GPU 無法承載。自部署僅在資料駐留、微調或超大規模呼叫三種場景成立;其餘用 API。

綜合智能 K3 排第三(57.1),落後 Fable 5(59.9)和 GPT-5.6 Sol(58.9)。K3 在 Frontend Code Arena、SWE Marathon、BrowseComp 等編碼基準領先;長程推理與幻覺控制仍遜於頂級閉源。更多維運問題見 幫助中心

Modified MIT 許可證,具體條款待 7 月 27 日發布日確認原文。發布日務必逐條核對 LICENSE 檔案。