Noch 5 Tage bis zum 27. Juli 2026: Moonshot AI (月之暗面) veröffentlicht auf Hugging Face unter Modified MIT die vollständigen 2,8-Billionen-Parameter-Gewichte von Kimi K3 — das weltweit erste Open-Weights-Modell im 3T-Bereich. Für Entwickler, die K3-Gewichte herunterladen, Self-Hosting-Feasibility und die Closed-Source-Prämie bewerten, deckt dieser Leitfaden ab: Zeitplan 16.7. API vs. 27.7. Gewichte, Modellspezifikationen und Benchmarks, API-Preise mit Cache-Kosten, Open Weights vs. Open Source, 1,4-TB-Hardwarerealität, Sechs-Schritte-Checkliste für den Release-Tag, Branchenbedeutung und FAQ. Kernergebnis: K3 ist kein „Fable-5-Killer", rangiert gesamtintelligent auf Platz 3, liefert aber bei ca. 1/3 der Kosten nahezu Frontier-Niveau — plus zwei Vorteile, die Closed Source nicht bietet: Open Weights + 1M Token Kontext.
Die häufigste Suchverwirrung: „K3 ist schon nutzbar — was kommt am 27. Juli?" Antwort: Am 16. Juli 2026 gingen API und Kimi-Produktsuite live; am 27. Juli folgen die herunterladbaren vollständigen Gewichte plus Technikbericht.
| Datum | Ereignis |
|---|---|
| 2026-07-16 | Kimi K3 via API, Kimi App, Kimi Work, Kimi Code; Artificial Analysis veröffentlicht unabhängigen Benchmark |
| 2026-07-17 | WAIC Shanghai; Xinhua stuft K3 als nationalen Meilenstein ein |
| 2026-07-27 | Vollständige Gewichte (Hugging Face, Modified MIT) + Technikbericht (Architektur, Training, Evaluation) |
| Parameter | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) — größtes Open-Weights-Modell weltweit |
| Architektur | Sparse MoE: Stable LatentMoE, 896 Experten, 16 pro Token aktiv |
| Attention | Kimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA |
| Kontext | 1.048.576 Tokens (ca. 1M) |
| Modalität | Native Vision (Text + Bild; Video produktseitig), Ausgabe Text |
| Gewichtsformat | MXFP4-Gewichte + MXFP8-Aktivierungen (4-Bit nahe Trainingspräzision) |
| Skalierungseffizienz | Ca. 2,5× gegenüber K2 bei gleicher Compute |
| Trainingsstabilität | Quantile Balancing, Per-Head-Muon-Optimierer, SiTU-Aktivierung |
| Long-Context-Decode | KDA: bis 6,3× Decode-Beschleunigung bei 1M Kontext |
K3 ist kein „Fable-5-Killer" — gesamtintelligent Rang 3, aber bei ca. 1/3 der Kosten nahe Frontier-Niveau, plus Open Weights und 1M Token Kontext, die Closed Source nicht liefern kann.
Datenresidenz / DSGVO: Compliance-Szenarien erfordern Gewichte on-prem statt API-Aufrufe
Fine-Tuning: Weitertraining auf eigenen Daten setzt vollständige Gewichte voraus
Extrem hohes Volumen: Bei Massen-Inferenz kann eigene Hardware günstiger sein
Ökosystem: vLLM-Support für KDA / Prefix Caching folgt mit Gewichts-Release
Quantisierung: Ollama- und GGUF-Varianten wie bei K2 erwartet
Lizenzprüfung: Modified-MIT-Originaltext am Release-Tag verifizieren, nicht vorab annehmen
Der Artificial Analysis Intelligence Index (unabhängiger Test vom 16. Juli) ergibt folgende Gesamtrangfolge:
| Modell | AA Intelligence Index | Rang |
|---|---|---|
| Claude Fable 5 | 59,9 | 1 |
| GPT-5.6 Sol | 58,9 | 2 |
| Kimi K3 | 57,1 | 3 / 189 |
Offizielle Ehrlichkeit (zitierwürdig): Moonshot räumt selten offen ein, dass die Gesamtleistung hinter Fable 5 und GPT-5.6 Sol liegt — inklusive bekannter Schwächen: Sensitivität gegenüber Harness-Reasoning-Output, zu proaktiv bei vagen Intents. Unterschiedliche Modelle nutzen unterschiedliche Reasoning-Harnesses; unabhängige Reproduktion läuft noch.
| Posten | Preis (pro Million Tokens) |
|---|---|
| Eingabe (Cache-Miss) | 3,00 $ |
| Eingabe (Cache-Hit, automatisch) | 0,30 $ |
| Ausgabe | 15,00 $ |
K3 orientiert sich bewusst an westlichen Qualitätsbenchmarks — höchste API-Preise unter chinesischen Anbietern, aber deutlich unter Claude Opus 4.8 pro Aufgabe. Artificial Analysis misst 0,94 $ pro Aufgabe: 9,4 % günstiger als GPT-5.6 Sol, 65,8 % günstiger als Claude Fable 5. Bei Coding-Workloads soll die Cache-Hit-Rate über 90 % liegen — effektive Kosten liegen weit unter dem Listenpreis.
| Option | Zielgruppe | Vor 27.7. | Ab 27.7. |
|---|---|---|---|
| API (3 $ / 15 $) | Meiste Entwickler und Unternehmen | Verfügbar | Weiter empfohlen |
| Self-Hosting (64+ Beschleuniger) | Datenresidenz / Fine-Tuning / Massenvolumen | Gewichte fehlen | Nur drei Szenarien sinnvoll |
| Consumer-GPU lokal | Privatexperimente | Nein | Nein — 4-Bit ca. 1,4 TB |
Die englischsprachige Community trennt strikt open weights (nur Gewichte) von open source (inkl. Trainingscode/-daten). Kimi K3 ist ersteres — am 27. Juli erscheinen vollständige Modellgewichte unter Modified MIT (Details am Release-Tag), nicht der Full-Stack.
Self-Hosting-Realität (nicht von Clickbait täuschen lassen): 4-Bit-Gewichte ca. 1,4 TB; Moonshot empfiehlt 64+ Beschleuniger im Supernode mit Expert-Parallelismus + Tensor-Parallelismus. Referenz: K2.7 Code (1T) benötigt INT4 ca. 577 GB VRAM; K3 ist 2,8× größer. Für die Mehrheit gilt: API (3 $ / 15 $).
HF-Repository: Vollständige Dateiliste in Moonshots Hugging-Face-Org prüfen
LICENSE: Modified-MIT-Klauseln Zeile für Zeile — kommerzielle Nutzung und Weiterverteilung
Quantisierungen: MXFP4/NVFP4 offizielle oder Community-Pakete verfolgen
vLLM / SGLang: Startbefehle für KDA und Prefix Caching gegen Docs abgleichen
Mindest-Hardware: Distributed-Inference-Anforderungen aus Technikbericht — nicht nach Consumer-GPU planen
Unabhängige Long-Context-Tests: Community-Benchmarks und r/LocalLLaMA-Reproduktionen beobachten
Frontier-Lücke schließt sich: Abstand von „Hunderten Punkten" auf „zwei bis drei" — reine Leistung rechtfertigt Premium kaum noch
Geopolitik: Release vor WAIC; US-Regierung entfernte kurz Anthropic Fable/Mythos (1.7., Wiederherstellung) — „Regulierung kann Closed Source abschalten, nicht veröffentlichte Open Weights"
Chinesische Anbieter-Welle: Z.ai GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 ist der Höhepunkt
Moonshots Comeback: Nach DeepSeek R1 Anfang 2025 auf Platz 7 in China — K2 (07/2025) → K2.5 (01/2026) → K3 Open-Weights-Route
Quellen: Offiziell kimi.com Technikblog, platform.kimi.ai; unabhängig Artificial Analysis (16.7.); VentureBeat, Northflank; Community r/LocalLLaMA, Hacker News. Architekturdetails: Kimi K3 Deep-Dive.
Wer K3 ab 27.7. in Kimi-Code-ähnlichen Langsession-Agenten oder iOS-CI-Pipelines integriert, stößt auf Laptops oder instabilen Linux-VPS oft an RAM-Limits, Session-Abbrüche und fehlende Xcode/Metal-Toolchains. Für stabile SSH-Langsessions, DerivedData-Cache und iOS-CI/CD-Automatisierung in Produktion ist NodeMini Mac Mini Cloud-Miete meist die bessere Wahl — dedizierter Node, Sekunden-Provisioning, Agent und Build auf derselben echten Mac-Hardware. Details: Mac Mini Mietpreise.
Die vollständigen 2,8T-Gewichte erscheinen am 27. Juli 2026 in Moonshots Hugging-Face-Organisation, zusammen mit dem Technikbericht. API und Kimi-Suite sind seit dem 16. Juli live.
Korrekt: open weights, nicht fully open source. Gesamtintelligenz: K3 stärker (2,8T vs. DeepSeek V4 Pro 1,6T; 1M vs. 128K Kontext). DeepSeek kostet nur 3,48 $/M Ausgabe — deutlich günstiger. Kostenoptimiert DeepSeek; lange Code-/Dokumentenaufgaben K3.
kimi.com Free-Tier nutzt K3; API: 3 $/15 $ pro M Tokens, Cache-Hit 0,30 $/M. Für stabile Agent-Umgebungen: Mac Mini Mietpreise.
4-Bit-Gewichte ca. 1,4 TB; Moonshot empfiehlt 64+ Beschleuniger im Supernode. Consumer-GPU scheidet aus. Self-Hosting nur bei Datenresidenz, Fine-Tuning oder Massenvolumen; sonst API.
Gesamtintelligenz: K3 Rang 3 (57,1), hinter Fable 5 (59,9) und GPT-5.6 Sol (58,9). K3 führt bei Frontend Code Arena, SWE Marathon, BrowseComp; Langzeitreasoning und Halluzinationen schwächer. Ops-Fragen: Hilfezentrum.
Modified MIT — Originaltext am 27. Juli prüfen. LICENSE-Datei Zeile für Zeile am Release-Tag lesen.