Kimi K3 Open Weights
27. Juli 2026: 2,8 Billionen Parameter — hält die Closed-Source-Prämie stand?

Noch 5 Tage bis zum 27. Juli 2026: Moonshot AI (月之暗面) veröffentlicht auf Hugging Face unter Modified MIT die vollständigen 2,8-Billionen-Parameter-Gewichte von Kimi K3 — das weltweit erste Open-Weights-Modell im 3T-Bereich. Für Entwickler, die K3-Gewichte herunterladen, Self-Hosting-Feasibility und die Closed-Source-Prämie bewerten, deckt dieser Leitfaden ab: Zeitplan 16.7. API vs. 27.7. Gewichte, Modellspezifikationen und Benchmarks, API-Preise mit Cache-Kosten, Open Weights vs. Open Source, 1,4-TB-Hardwarerealität, Sechs-Schritte-Checkliste für den Release-Tag, Branchenbedeutung und FAQ. Kernergebnis: K3 ist kein „Fable-5-Killer", rangiert gesamtintelligent auf Platz 3, liefert aber bei ca. 1/3 der Kosten nahezu Frontier-Niveau — plus zwei Vorteile, die Closed Source nicht bietet: Open Weights + 1M Token Kontext.

01

Kimi K3 Release-Zeitplan: API live vs. Open Weights — zwei Daten, nicht verwechseln

Die häufigste Suchverwirrung: „K3 ist schon nutzbar — was kommt am 27. Juli?" Antwort: Am 16. Juli 2026 gingen API und Kimi-Produktsuite live; am 27. Juli folgen die herunterladbaren vollständigen Gewichte plus Technikbericht.

DatumEreignis
2026-07-16Kimi K3 via API, Kimi App, Kimi Work, Kimi Code; Artificial Analysis veröffentlicht unabhängigen Benchmark
2026-07-17WAIC Shanghai; Xinhua stuft K3 als nationalen Meilenstein ein
2026-07-27Vollständige Gewichte (Hugging Face, Modified MIT) + Technikbericht (Architektur, Training, Evaluation)

Kimi K3 Kerndaten auf einen Blick

ParameterWert
Gesamtparameter2,8 Billionen (2,8T) — größtes Open-Weights-Modell weltweit
ArchitekturSparse MoE: Stable LatentMoE, 896 Experten, 16 pro Token aktiv
AttentionKimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA
Kontext1.048.576 Tokens (ca. 1M)
ModalitätNative Vision (Text + Bild; Video produktseitig), Ausgabe Text
GewichtsformatMXFP4-Gewichte + MXFP8-Aktivierungen (4-Bit nahe Trainingspräzision)
SkalierungseffizienzCa. 2,5× gegenüber K2 bei gleicher Compute
TrainingsstabilitätQuantile Balancing, Per-Head-Muon-Optimierer, SiTU-Aktivierung
Long-Context-DecodeKDA: bis 6,3× Decode-Beschleunigung bei 1M Kontext

K3 ist kein „Fable-5-Killer" — gesamtintelligent Rang 3, aber bei ca. 1/3 der Kosten nahe Frontier-Niveau, plus Open Weights und 1M Token Kontext, die Closed Source nicht liefern kann.

Warum der 27.7.-Release frühzeitig relevant ist

  1. 01

    Datenresidenz / DSGVO: Compliance-Szenarien erfordern Gewichte on-prem statt API-Aufrufe

  2. 02

    Fine-Tuning: Weitertraining auf eigenen Daten setzt vollständige Gewichte voraus

  3. 03

    Extrem hohes Volumen: Bei Massen-Inferenz kann eigene Hardware günstiger sein

  4. 04

    Ökosystem: vLLM-Support für KDA / Prefix Caching folgt mit Gewichts-Release

  5. 05

    Quantisierung: Ollama- und GGUF-Varianten wie bei K2 erwartet

  6. 06

    Lizenzprüfung: Modified-MIT-Originaltext am Release-Tag verifizieren, nicht vorab annehmen

02

Kimi K3 Benchmarks: Wo führt K3 Claude Fable 5 und GPT-5.6 an?

Der Artificial Analysis Intelligence Index (unabhängiger Test vom 16. Juli) ergibt folgende Gesamtrangfolge:

ModellAA Intelligence IndexRang
Claude Fable 559,91
GPT-5.6 Sol58,92
Kimi K357,13 / 189

Benchmarks, bei denen K3 führt oder gleichzieht

  • Frontend Code Arena: Platz 1 (Blindtest: Entwickler bevorzugen UI-Code gegenüber Fable und Sol)
  • Automation Bench, SpreadsheetBench 2: Platz 1
  • BrowseComp: 91,2 (Platz 1; mit 1M-Kontext ohne Kompression 90,4+)
  • SWE Marathon (ultralange Coding-Sessions): 42,0 — deutlich vor GPT-5.5 / GLM-5.2 (niedrige zweistellige Werte)
  • Terminal Bench 2.1: 88,3 — nahezu gleich GPT-5.6 Sol (88,8)
  • Program Bench: 77,8 — knapp über Sol (77,6)
  • FrontierSWE: 81,2 vs. Sol 71,3 (hinter Fable 5 mit 86,6)

Bereiche, in denen K3 zurückliegt

  • GDPval v2 Elo: 1668–1687 vs. Fable 5 (1760), Sol (1748) — Langzeiturteil bleibt Fables Stärke
  • DeepSWE: 67,5 vs. Sol 73,0
  • Halluzinationsrate: gegenüber K2.6 gestiegen (offiziell bestätigt); Reddit-Berichte über mehr Halluzinationen als Top-Closed-Source in Self-Hosted-Apps
  • Dialogqualität und Stabilität: Varianz pro Session höher als Fable 5 / Sol
info

Offizielle Ehrlichkeit (zitierwürdig): Moonshot räumt selten offen ein, dass die Gesamtleistung hinter Fable 5 und GPT-5.6 Sol liegt — inklusive bekannter Schwächen: Sensitivität gegenüber Harness-Reasoning-Output, zu proaktiv bei vagen Intents. Unterschiedliche Modelle nutzen unterschiedliche Reasoning-Harnesses; unabhängige Reproduktion läuft noch.

03

Kimi K3 API-Preise: Listenpreis vs. realer Cache-Kosten

PostenPreis (pro Million Tokens)
Eingabe (Cache-Miss)3,00 $
Eingabe (Cache-Hit, automatisch)0,30 $
Ausgabe15,00 $

K3 orientiert sich bewusst an westlichen Qualitätsbenchmarks — höchste API-Preise unter chinesischen Anbietern, aber deutlich unter Claude Opus 4.8 pro Aufgabe. Artificial Analysis misst 0,94 $ pro Aufgabe: 9,4 % günstiger als GPT-5.6 Sol, 65,8 % günstiger als Claude Fable 5. Bei Coding-Workloads soll die Cache-Hit-Rate über 90 % liegen — effektive Kosten liegen weit unter dem Listenpreis.

OptionZielgruppeVor 27.7.Ab 27.7.
API (3 $ / 15 $)Meiste Entwickler und UnternehmenVerfügbarWeiter empfohlen
Self-Hosting (64+ Beschleuniger)Datenresidenz / Fine-Tuning / MassenvolumenGewichte fehlenNur drei Szenarien sinnvoll
Consumer-GPU lokalPrivatexperimenteNeinNein — 4-Bit ca. 1,4 TB
04

Ist Kimi K3 Open Source? Open Weights vs. Open Source

Die englischsprachige Community trennt strikt open weights (nur Gewichte) von open source (inkl. Trainingscode/-daten). Kimi K3 ist ersteres — am 27. Juli erscheinen vollständige Modellgewichte unter Modified MIT (Details am Release-Tag), nicht der Full-Stack.

Was am 27. Juli konkret passiert

  • Vollständige 2,8T-Gewichte in Moonshots Hugging-Face-Organisation
  • Technikbericht synchron (Architektur, Training, Evaluation)
  • vLLM-Support für KDA / Prefix Caching mit Gewichten
  • Erwartet: Ollama-, GGUF-Quantisierungen wie bei K2
warning

Self-Hosting-Realität (nicht von Clickbait täuschen lassen): 4-Bit-Gewichte ca. 1,4 TB; Moonshot empfiehlt 64+ Beschleuniger im Supernode mit Expert-Parallelismus + Tensor-Parallelismus. Referenz: K2.7 Code (1T) benötigt INT4 ca. 577 GB VRAM; K3 ist 2,8× größer. Für die Mehrheit gilt: API (3 $ / 15 $).

Sechs-Schritte-Checkliste für den Release-Tag 27. Juli

  1. 01

    HF-Repository: Vollständige Dateiliste in Moonshots Hugging-Face-Org prüfen

  2. 02

    LICENSE: Modified-MIT-Klauseln Zeile für Zeile — kommerzielle Nutzung und Weiterverteilung

  3. 03

    Quantisierungen: MXFP4/NVFP4 offizielle oder Community-Pakete verfolgen

  4. 04

    vLLM / SGLang: Startbefehle für KDA und Prefix Caching gegen Docs abgleichen

  5. 05

    Mindest-Hardware: Distributed-Inference-Anforderungen aus Technikbericht — nicht nach Consumer-GPU planen

  6. 06

    Unabhängige Long-Context-Tests: Community-Benchmarks und r/LocalLLaMA-Reproduktionen beobachten

05

Warum der 27.7.-Release die Closed-Source-Prämie erschüttert

Vier analytische Perspektiven

  1. 01

    Frontier-Lücke schließt sich: Abstand von „Hunderten Punkten" auf „zwei bis drei" — reine Leistung rechtfertigt Premium kaum noch

  2. 02

    Geopolitik: Release vor WAIC; US-Regierung entfernte kurz Anthropic Fable/Mythos (1.7., Wiederherstellung) — „Regulierung kann Closed Source abschalten, nicht veröffentlichte Open Weights"

  3. 03

    Chinesische Anbieter-Welle: Z.ai GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 ist der Höhepunkt

  4. 04

    Moonshots Comeback: Nach DeepSeek R1 Anfang 2025 auf Platz 7 in China — K2 (07/2025) → K2.5 (01/2026) → K3 Open-Weights-Route

Zitierfähige Kennzahlen

  • Skala: 2,8T Parameter, 896 Experten / 16 aktiv, 1M Kontext (1.048.576)
  • Gesamtintelligenz: AA Index 57,1 / Sol 58,9 / Fable 5 59,9 (Rang 3/189)
  • Kosten pro Aufgabe: K3 0,94 $ — 65,8 % unter Fable 5
  • API: 3 $ Eingabe / 0,30 $ Cache / 15 $ Ausgabe pro M Tokens
  • Self-Hosting: 4-Bit ca. 1,4 TB; 64+ Beschleuniger empfohlen
  • Coding: Frontend Code Arena Platz 1; SWE Marathon 42,0
  • Bekannte Schwächen: Hinter Fable 5 / Sol; Halluzinationsrate vs. K2.6 gestiegen

Quellen: Offiziell kimi.com Technikblog, platform.kimi.ai; unabhängig Artificial Analysis (16.7.); VentureBeat, Northflank; Community r/LocalLLaMA, Hacker News. Architekturdetails: Kimi K3 Deep-Dive.

Wer K3 ab 27.7. in Kimi-Code-ähnlichen Langsession-Agenten oder iOS-CI-Pipelines integriert, stößt auf Laptops oder instabilen Linux-VPS oft an RAM-Limits, Session-Abbrüche und fehlende Xcode/Metal-Toolchains. Für stabile SSH-Langsessions, DerivedData-Cache und iOS-CI/CD-Automatisierung in Produktion ist NodeMini Mac Mini Cloud-Miete meist die bessere Wahl — dedizierter Node, Sekunden-Provisioning, Agent und Build auf derselben echten Mac-Hardware. Details: Mac Mini Mietpreise.

FAQ

Häufige Fragen

Die vollständigen 2,8T-Gewichte erscheinen am 27. Juli 2026 in Moonshots Hugging-Face-Organisation, zusammen mit dem Technikbericht. API und Kimi-Suite sind seit dem 16. Juli live.

Korrekt: open weights, nicht fully open source. Gesamtintelligenz: K3 stärker (2,8T vs. DeepSeek V4 Pro 1,6T; 1M vs. 128K Kontext). DeepSeek kostet nur 3,48 $/M Ausgabe — deutlich günstiger. Kostenoptimiert DeepSeek; lange Code-/Dokumentenaufgaben K3.

kimi.com Free-Tier nutzt K3; API: 3 $/15 $ pro M Tokens, Cache-Hit 0,30 $/M. Für stabile Agent-Umgebungen: Mac Mini Mietpreise.

4-Bit-Gewichte ca. 1,4 TB; Moonshot empfiehlt 64+ Beschleuniger im Supernode. Consumer-GPU scheidet aus. Self-Hosting nur bei Datenresidenz, Fine-Tuning oder Massenvolumen; sonst API.

Gesamtintelligenz: K3 Rang 3 (57,1), hinter Fable 5 (59,9) und GPT-5.6 Sol (58,9). K3 führt bei Frontend Code Arena, SWE Marathon, BrowseComp; Langzeitreasoning und Halluzinationen schwächer. Ops-Fragen: Hilfezentrum.

Modified MIT — Originaltext am 27. Juli prüfen. LICENSE-Datei Zeile für Zeile am Release-Tag lesen.