2026 年 7 月 27 日の完全ウェイト公開まであと 5 日:Moonshot AI(月之暗面)は Hugging Face で Modified MIT ライセンスの 2.8 兆パラメータ Kimi K3 ウェイトを公開します——世界初の 3T 級オープンウェイトモデルです。本記事は、K3 ウェイトのダウンロード、ローカルデプロイの実現性、クローズドモデルのプレミアムに関心のある開発者向けに、7/16 API 公開 vs 7/27 ウェイト公開の 2 段階タイムライン、モデル仕様とベンチマーク比較、API 料金とキャッシュ後の実コスト、open weights と open source の整理、1.4TB 自己ホスティングの現実、公開日 6 ステップチェックリスト、業界インパクト、FAQを網羅します。結論として、K3 は「Fable 5 キラー」ではありません——総合知能は第 3 位ですが、約 1/3 のコストで最先端に近い能力を実現し、クローズドモデルにはない 2 つの強み——オープンウェイト + 100 万トークンコンテキスト——を持っています。
現在の最大の検索混乱は「K3 はすでに使えるのに、7 月 27 日に何が公開されるのか?」です——答えは:7 月 16 日に公開されたのは API と Kimi ファミリー製品、7 月 27 日に公開されるのはダウンロード可能な完全モデルウェイトと技術レポートです。
| 日付 | イベント |
|---|---|
| 2026-07-16 | Kimi K3 が API、Kimi App、Kimi Work、Kimi Code で利用開始;Artificial Analysis が同日に独立評価を公開 |
| 2026-07-17 | 上海世界人工知能大会(WAIC)開幕;新華社が K3 公開を「国家的マイルストーン」と位置づけ |
| 2026-07-27 | 完全ウェイトの公開ダウンロード(Hugging Face、Modified MIT ライセンス)+ 技術レポート(アーキテクチャ、学習、評価の詳細) |
| 項目 | データ |
|---|---|
| 総パラメータ数 | 2.8 兆(2.8T)、史上最大のオープンウェイトモデル |
| アーキテクチャ | スパース MoE:Stable LatentMoE、896 エキスパート中 16 をトークンごとに活性化 |
| アテンション | Kimi Delta Attention(KDA)+ Attention Residuals(AttnRes)+ Gated MLA |
| コンテキスト | 1,048,576 トークン(約 100 万) |
| モダリティ | ネイティブ視覚理解(テキスト + 画像、製品側は動画対応)、出力はテキスト |
| ウェイト形式 | MXFP4 ウェイト + MXFP8 活性化(4-bit 量子化で学習精度に近い) |
| スケール効率 | K2 比で約 2.5 倍向上(同等算力でより多くの知能) |
| 学習安定性 | Quantile Balancing、Per-Head Muon オプティマイザ、SiTU 活性化関数 |
| 長コンテキストデコード | KDA により 100 万トークンコンテキストで最大 6.3 倍のデコード加速 |
K3 は「Fable 5 キラー」ではありません——総合知能は依然として第 3 位ですが、約 1/3 のコストで「最先端に近い」能力を実現し、クローズドモデルにはない 2 つの強みを持っています:オープンウェイト + 100 万トークンコンテキスト。
データレジデンシー:厳格なコンプライアンス要件では API 呼び出しではなくウェイトのオンプレミス配置が必要
ファインチューニング:自社データでの継続学習には完全ウェイトが不可欠
超大規模呼び出し:推論量が極端に大きい場合、自前インフラの方が経済的になる可能性
エコシステム整合:vLLM の KDA / prefix caching 対応はウェイト公開と連動
量子化フォロー:Ollama、GGUF 版は K2 シリーズ同様に順次登場が予想される
ライセンス確認:Modified MIT 原文は公開日に確認が必要で、条項を事前に想定してはならない
Artificial Analysis Intelligence Index(7 月 16 日の独立評価)による総合ランキングは次のとおりです。
| モデル | AA Intelligence Index | 順位 |
|---|---|---|
| Claude Fable 5 | 59.9 | 第 1 |
| GPT-5.6 Sol | 58.9 | 第 2 |
| Kimi K3 | 57.1 | 第 3 / 189 |
公式の誠実な姿勢(引用に値する):Moonshot AI は珍しく、総合性能が Fable 5 と GPT-5.6 Sol に後れを取ることを自ら認め、既知の弱点——harness から返される推論内容への過敏さ、意図が曖昧な場合の過剰な能動性など——を列挙しています。各モデルは異なる推論 harness を使用しており、独立した第三者による再現検証は進行中です。
| 項目 | 価格(100 万トークンあたり) |
|---|---|
| 入力(キャッシュ未ヒット) | $3.00 |
| 入力(キャッシュヒット、自動キャッシュ) | $0.30 |
| 出力 | $15.00 |
K3 の料金は意図的に Western 標準に合わせています(「低価格路線」ではなく「品質路線」)。中国大モデルベンダーの中では最高水準の API 料金ですが、Claude Opus 4.8 の単一タスクコストよりは依然として大幅に低くなります。Artificial Analysis の実測では単一タスクコスト $0.94:GPT-5.6 Sol より 9.4% 低く、Claude Fable 5 より 65.8% 低い。コーディング系ワークロードではキャッシュヒット率が 90% 超とされ、実コストは表面単価を大きく下回ります。
| 方式 | 対象 | 7/27 前 | 7/27 後 |
|---|---|---|---|
| API($3/$15) | 大多数の開発者と企業 | 利用可能 | 引き続き推奨 |
| 自己ホスティング(64+ アクセラレータ) | データレジデンシー / ファインチューニング / 超大規模呼び出し | ウェイト未公開 | 3 つのシーンのみ成立 |
| 消費者向けローカル GPU | 個人実験 | 不可 | 不可(4-bit 約 1.4 TB) |
英語圏では open weights(ウェイトのみ公開)と open source(学習コード/データを含む)を厳密に区別します。Kimi K3 は前者に該当します——7 月 27 日に公開されるのは完全なモデルウェイト(Modified MIT ライセンス、具体条項は公開日に確認)であり、学習コードとデータセットのフルスタックオープンソースではありません。
自己ホスティングの現実(「ローカルで大モデル」系の釣りタイトルに惑わされない):4-bit ウェイトは約 1.4 TB、公式は 64+ アクセラレータの「スーパーノード」デプロイを推奨し、エキスパート並列 + テンソル並列の分散推論が必要です。参考:前世代 1T パラメータの K2.7 Code でも INT4 で約 577 GB の VRAM が必要;K3 はその 2.8 倍です。大多数にとって正解は API($3/$15)です。
HF リポジトリのファイル完整性:Moonshot Hugging Face 組織の完全ファイル一覧を確認
LICENSE 原文:Modified MIT の具体条項を逐条確認し、商用・再配布制限を把握
量子化版:MXFP4/NVFP4 など公式またはコミュニティ量子化パッケージを注視
vLLM / SGLang 起動コマンド:KDA と prefix caching の公式サンプルを確認
最小実行可能ハードウェア:技術レポートの分散推論要件と照合し、消費者向け GPU で計画しない
独立長コンテキスト再検証:コミュニティ初回独立ベンチマークと r/LocalLLaMA の再現議論を注視
オープンとクローズドの能力差が最先端でほぼ閉じた:差は「数百点」から「2〜3 点」に縮小し、クローズドベンダーは能力だけでプレミアムを正当化しにくくなった
地政学的背景:公開は WAIC 前に間に合わせ;1 か月前に米政府が Anthropic の Fable/Mythos モデルを一時的に下架(7 月 1 日に復旧)——「規制はクローズドモデルを止められるが、公開済みオープンウェイトは止められない」が新たな論拠に
中国ベンダーの集団的接近:Z.ai GLM-5.2(コーディング Opus 4.8 相当、価格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax など、K3 はこの波の頂点
Moonshot AI の巻き返し:2025 年初頭に DeepSeek R1 の衝撃で国内第 7 位に後退後、K2(2025-07)→ K2.5(2026-01)→ K3 のオープン路線で地位を再構築
出典:公式 kimi.com 技術ブログ、platform.kimi.ai;独立評価 Artificial Analysis(7 月 16 日);詳細報道 VentureBeat、Northflank;コミュニティ r/LocalLLaMA、Hacker News。アーキテクチャの詳細は当サイトの Kimi K3 徹底レビューも参照してください。
7/27 以降に K3 を Kimi Code 型の長セッション Agent や iOS CI パイプラインに統合する場合、ノート PC や不安定な Linux VPS上で CLI Agent を動かすと、メモリ不足、セッション中断、Xcode/Metal ツールチェーンの欠如に直面しがちです。安定した SSH 長セッション、DerivedData キャッシュ、iOS CI/CD 自動化が必要な本番環境では、NodeMini の Mac Mini クラウドレンタルが通常はより優れた選択です——専有ノードと秒単位のプロビジョニングにより、Agent とビルドタスクを同一の実機 Mac 上で継続実行できます。詳細は Mac Mini レンタル料金をご確認ください。
完全 2.8T ウェイトは 2026 年 7 月 27 日に Moonshot の Hugging Face 組織で公開され、技術レポートも同時にリリースされます。API と Kimi ファミリー製品は 7 月 16 日にすでに利用可能です。
正確には open weights(オープンウェイト)であり、fully open source ではありません。総合知能は K3 が優位(2.8T vs DeepSeek V4 Pro 1.6T、1M vs 128K コンテキスト)ですが、DeepSeek の出力は $3.48/M のみで、コストは大幅に低くなります。コスト重視なら DeepSeek、長コード/文書理解なら K3 を選びます。
kimi.com の無料アカウントで K3 を利用できます。API は $3/$15 per 1M tokens、キャッシュヒット $0.30/M です。安定した Agent 実行環境が必要な場合は Mac Mini レンタル料金をご確認ください。
4-bit ウェイトは約 1.4 TB、公式は 64+ アクセラレータのスーパーノードを推奨し、消費者向け GPU では実行できません。自己ホスティングはデータレジデンシー、ファインチューニング、超大規模呼び出しの 3 シーンのみ成立します。それ以外は API を利用してください。
総合知能は K3 が第 3 位(57.1)、Fable 5(59.9)と GPT-5.6 Sol(58.9)に後れます。K3 は Frontend Code Arena、SWE Marathon、BrowseComp などのコーディングベンチマークで先行していますが、長期推論と幻覚制御はトップクラスのクローズドモデルに劣ります。運用に関する詳細は ヘルプセンターをご参照ください。
Modified MIT ライセンスです。具体的な条項は 7 月 27 日の公開日に原文を確認してください。公開日には LICENSE ファイルを逐条確認することが重要です。