In einem Fünf-Tage-Fenster haben drei der führenden chinesischen KI-Labs Schritte unternommen, die sich an der Oberfläche widersprechen. DeepSeek hat API-Preise in einzelnen Stufen um bis zu ~1100% angehoben. Alibaba hat ein 2.4T-Parameter-Flagschiff als Open Weight veröffentlicht, das zuvor nie öffentlich lag. Zhipu hat GLM-5.3 ausgeliefert und Coding-Benchmarks auf demselben Basismodell um rund 6x verbessert — ohne erneutes Pretraining. Dieser Text führt Entwickler und Einkäufer durch Zeitlinie, Preistabelle, die drei Strategien, den Direktvergleich, die strittigen Behauptungen und die FAQ. Das gemeinsame Signal: Chinas Labs konkurrieren nicht mehr nur über den Preis, sondern über Preissetzungsmacht.
Der häufigste Fehler ist, ~1100% mit der gesamten Rechnung gleichzusetzen. Zuerst die Daten, dann Abrechnungsdimension, Lizenztyp und Benchmark-Quelle getrennt halten.
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | Moonshot AI veröffentlicht Kimi K3 als Open Weight (2.8T Parameter) und zieht US-Sicherheitsprüfungen auf sich |
| 2.–3. August 2026 | Alibaba kündigt Qwen3.8-Max an und startet das Modell als gehostete API |
| 10. August 2026 | Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flagschiff Muse Spark 1.2 an |
| 12. August 2026 | Alibaba stellt Qwen3.8-2.4T-A95B Open Weights auf Hugging Face / ModelScope bereit; xAI liefert Grok 4.6 aus |
| 13. August 2026 | DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung zum 17. August an; Google liefert vergünstigtes Gemini 3.7 Flash |
| 14. August 2026 | Zhipu liefert GLM-5.3 aus und nutzt die 743B-Basis von GLM-5.2 weiter |
| 17. August 2026, 00:00 Peking-Zeit | DeepSeeks neue Preise treten in Kraft |
Der weitere Rahmen: Am 30. Juli senkte OpenAI die Preise der günstigsten Stufe (GPT-5.6 Luna, minus 80%), machte Luna am 6.–7. August zum kostenlosen Default mit unbegrenzten Textchats. Während chinesische Labs Preise anhoben und Flagship-Weights öffneten, senkten US-Labs Preise und gingen auf der Verbraucherebene auf Gratis — zur selben Zeit. Das sind zwei Seiten desselben Preiskampfs.
~1100% als gesamte Rechnung lesen. Die Zahl gilt für Cache-Hit-Input in der Spitzenzeit, die Stufe, die zuvor am nächsten an kostenlos lag.
Pekinger Peak-Fenster ignorieren. Spitzenzeiten sind 9–12 und 14–18 Peking-Zeit. Die Ankündigung fordert eine Lastverschiebung.
Jeden offenen Checkpoint als Apache 2.0 bezeichnen. Qwen3.8-Max erscheint unter einer eigenen Lizenz. Muse Glimmer ist eine andere Wette.
Das Geo-Ban-Gerücht wiederholen. Die veröffentlichte Lizenz enthält keine territoriale Klausel für USA / EU / UK / Korea.
GLM-5.3 als neues Foundation-Modell lesen. Dieselbe 743B-Basis wie 5.2. Der Sprung kommt aus skalierter Post-Training-RL.
Chinesisches Modell mit günstigstem Modell gleichsetzen. DeepSeek in der Nebenzeit unterbietet weiter Claude Opus 5. Luna und Qwen international unterbieten inzwischen DeepSeek.
Die Preise stammen aus DeepSeeks offizieller Ankündigung, gegencheckt gegen Wall Street CN, IT Home und V2EX. GLM-Werte sind Zhipus eigene Angaben. Ein unabhängiger Dritt-Rerun ist bislang nicht veröffentlicht.
Wirksam 17. August 2026, 00:00 Peking-Zeit. Spitzenzeiten: 9–12 und 14–18 Peking-Zeit. Einheit: pro 1M Tokens.
| Abrechnungsposition | Alter Preis | Neu Nebenzeit | Neu Spitze | Anstieg Spitze |
|---|---|---|---|---|
| V4-Flash Cache-Hit (Input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash Cache-Miss (Input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash Output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro Cache-Hit (Input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1100% |
| V4-Pro Cache-Miss (Input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro Output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Kontext: Die Schlagzeile ~1100% gilt für Cache-Hit-Input in der Spitzenzeit. Output-Preise, die die meisten realen Rechnungen dominieren, stiegen um 350%. Eine unabhängige Kostenmodellierung für eine realistische Schwerlast (rund 84M Tokens/Monat, überwiegend Nebenzeit, zur Hälfte Cache-Hits) ergibt einen Rechnungsanstieg näher an 1.8x.
| Spezifikation | Detail |
|---|---|
| Parameter | 2.4T gesamt, 95B aktiv pro Token (MoE, 512 Experts, 10 routed + 1 shared) |
| Kontextfenster | 262,144 Tokens nativ (offener Checkpoint), erweiterbar auf ~1.01M; gehostete Max-Version standardmäßig 1M |
| Release-Takt | Preview 2. August → API live 3. August → Open Weights 12. August |
| API-Preis (international) | $2/M Input, $6/M Output |
| Lizenz | Nicht Apache 2.0 — eine eigene Qwen3.8-Max License |
| Warum es zählt | Erstmals hat Alibaba ein Max-Flagschiff als Open Weight veröffentlicht; Qwen3.5 / 3.6 / 3.7 Max blieben API-only |
| Benchmark | GLM-5.2 | GLM-5.3 | Änderung |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Einschränkung: Das sind Zhipus eigene Angaben. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34.6%) und Claude Fable 5 (33.7%). Es ist ein Spitzenergebnis unter Open-Weight-Modellen, kein uneingeschränkter Frontier-Sieg.
Drei Labs. Drei Züge. Eine Frage darunter: Wenn Nutzung schneller skaliert als GPUs und Pretraining-Erträge abflachen, wer behält Preissetzungsmacht.
Die einfachste Fehldeutung lautet: „Chinas günstigstes Modell ist dem Margendruck gewichen.“ Die Tarifstruktur liest sich eher umgekehrt: ein Unternehmen macht Rechenengpässe in der Preisliste sichtbar. Flache, dauerhaft günstige Preise funktionierten als Kundengewinnung, solange GPU-Kapazität mithielt. Als die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden. „Flexiblere Lastplanung anregen“ ist Konzernsprache für „Spitzenzeit-Compute ist knapp, verschieben Sie die Last selbst“.
Ein Detail, das die internationale Berichterstattung weitgehend überging: In der Spitzenzeit liegt DeepSeeks offizieller API-Preis nun über mehreren Drittanbieter-Resellern (GMI Cloud, Novita und andere listen V4 Pro derzeit unter DeepSeeks neuem Spitzentarif). Die Annahme, die offizielle API sei stets der günstigste Weg, DeepSeek zu betreiben, ist zum ersten Mal gebrochen.
Alibaba hat zwei Dinge gleichzeitig getan. Es hat den vollständigen 2.4T-Parameter-Checkpoint zum kostenlosen Download veröffentlicht und eine eigene Lizenz angehängt — nicht das permissive Apache 2.0 der kleineren Qwen-Modelle. Jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit über $50M Umsatz in einem beliebigen 12-Monats-Zeitraum muss eine separate Kommerzlizenz verhandeln. Produkte mit 100M MAU oder $20M Monatsumsatz müssen den Modellnamen prominent anzeigen.
Weights verschenken, um Entwickler-Mindshare zu gewinnen, besonders international. Preissetzungsmacht über die wenigen Unternehmen behalten, die darauf ein konkurrierendes Inferenzgeschäft bauen können. Das ist eine substantiell andere Wette als Metas Muse Glimmer, das unter uneingeschränktem Apache 2.0 erscheint.
Gerücht beenden: Behauptungen, Alibabas Lizenz verbiete Downloads aus den USA, der EU, dem UK und Südkorea, sind falsch. Der veröffentlichte Lizenztext enthält keinerlei geografische oder territoriale Klausel. Die LICENSE-Datei prüfen, nicht den Ankündigungsthread.
Die interessanteste Tatsache ist die Methode: dieselbe 743B-Parameter-Basis wie GLM-5.2, kein erneutes Pretraining, und ein Sprung von rund 6x auf Terminal-Bench 3.0 (4.6% → 28.3%) durch Skalierung der Reinforcement-Learning-Umgebungen im Post-Training. Während Pretraining-Skalierungsgesetze abnehmende Erträge zeigen, wird Post-Training-RL zu einem eigenständigen Leistungshebel mit deutlich niedrigerer Kostenschwelle als das Retraining eines neuen Foundation-Modells. Labs der mittleren Liga ohne OpenAI-skalierte Compute-Budgets können den Abstand bei agentischen und Coding-Benchmarks weiter schließen.
Chinas KI-Labs wechseln vom reinen Preiswettbewerb zum Wettbewerb um Preissetzungsmacht selbst.
RMB-USD-Umrechnung bei etwa ¥7.15/$1, näherungsweise. Offizielle Ankündigungen gelten bei Abweichungen.
| Modell | Input (pro 1M Tokens) | Output (pro 1M Tokens) | Open Weights? |
|---|---|---|---|
| DeepSeek V4-Pro (Spitze) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Nein |
| DeepSeek V4-Pro (Nebenzeit) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Nein |
| Qwen3.8-Max (internationale API) | $2.00 | $6.00 | Ja (eigene Lizenz) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Nein |
| Claude Opus 5 (impliziert, nach Alibabas Vergleichsverhältnis) | ~$5.00 | ~$25.00 | Nein |
Die kurze Antwort: nein. Der Nebenzeit-Tarif von DeepSeek V4-Pro liegt weiter klar unter Claude Opus 5, ist aber nicht mehr die uneingeschränkt günstigste Option. Der internationale Qwen3.8-Max-Tarif und OpenAIs Luna unterbieten DeepSeeks Nebenzeit-Preis. „Chinesisches Modell = günstigstes Modell“ galt für den Großteil von 2025 und das frühe 2026. Das ist keine sichere Annahme mehr.
Die Rechnung in drei Spalten teilen. Cache-Hit-Input, Cache-Miss-Input und Output. Nicht aus einer einzelnen ~1100%-Schlagzeile budgetieren.
Jobs auf Pekinger Spitzenzeiten mappen. 9–12 und 14–18 Peking-Zeit werden als Peak abgerechnet. Was möglich ist, in die übrigen 17 Stunden legen.
Die Cache-Hit-Rate messen. Eine modellierte Schwerlast (~84M Tokens/Monat, überwiegend Nebenzeit, zur Hälfte Hits) landet nahe 1.8x, nicht 12x.
Offiziellen Peak mit Resellern vergleichen. GMI Cloud und Novita listen V4 Pro derzeit unter DeepSeeks neuem Peak. Offiziell ist nicht mehr automatisch am günstigsten.
Die LICENSE-Datei vor kommerzieller Nutzung lesen. Die Qwen-Schwellen sind $50M MaaS- / AI-Work-Assistant-Umsatz und 100M MAU oder $20M Monatsumsatz für Attribution. Kein Geo-Ban.
GLM-5.3 als Post-Training-Hebel akzeptieren. Offizielles Terminal-Bench 3.0: 28.3% gegen 4.6%. Weiter hinter Sol 34.6% und Fable 5 mit 33.7%. Auf dieser Basis validieren.
# DeepSeek V4-Pro Output (pro 1M Tokens, offizielle Karte) Alter Flattarif: ¥6.0 Neue Nebenzeit: ¥13.5 (+125% vs. alt; Hälfte der Spitze) Neue Spitze: ¥27.0 (+350% vs. alt) # Drei Fragen vor jeder Schlagzeile 1) Cache-Hit-Input, Cache-Miss-Input oder Output? 2) Spitze oder Nebenzeit? 3) Wie hoch ist meine reale Cache-Hit-Rate?
Im groben Verlauf des vergangenen Monats haben Chinas führende Labs Major-Releases in einem Takt ausgeliefert, den inländische Finanzmedien bereits „drei Modell-Updates pro Woche“ (一周三更) nennen — DeepSeek, Alibaba und Zhipu, dazu Moonshots Kimi K3 (Open Weight am 16. Juli, 2.8T Parameter) und MiniMax H3. Die chinesische Berichterstattung rahmt das weitgehend so: chinesische Open-Weight-Releases erzwingen eine globale Neubepreisung der KI-Branche.
US-Labs fahren auf der Verbraucherebene den gegenteiligen Zug: OpenAI senkte die Preise der günstigsten Stufe um 80% (30. Juli) und machte das Modell eine Woche später kostenlos und unbegrenzt (6.–7. August); Google lieferte ein coding-fokussiertes Modell zum halben Preis des drei Wochen alten Vorgängers (13. August). Chinesische Labs öffnen Flagship-Weights und führen gestufte, höhere Preise am compute-knappen oberen Ende ein. US-Labs rennen am Verbraucherende Richtung gratis und günstig.
Es gibt außerdem eine geopolitische Schicht, die vorsichtig zu benennen ist. Moonshots Open-Weighting von Kimi K3 im Juli hat bereits US-Sicherheitsprüfungen ausgelöst. Dass Alibaba ausgerechnet in diesem Fenster ein 2.4T-Flagschiff öffnet, lesen manche Analysten als Versuch, internationalen Mindshare und eine Erzählung technologischer Parität festzuziehen, bevor eine mögliche regulatorische Verschärfung greift. Das ist eine informierte Interpretation, kein bestätigter Fakt — und leicht zu übersehen, wenn man nur englischsprachige Produktposts liest.
Quellen: DeepSeeks offizielle Preisankündigung, gegencheckt gegen Wall Street CN, IT Home, AIGC.cn und V2EX; Alibabas offizielle Qwen-Repositories (Hugging Face / ModelScope) und South China Morning Post zu den Lizenzbedingungen; Zhipu (Z.ai) GLM-5.3-Technikseite, plus VentureBeat und StableLearn; offizieller Blog von Meta AI Research; chinesische Finanzmedien (Yicai, Sohu Finance) zum Release-Takt. Aktuelle offizielle Preise und Lizenzbedingungen vor einer Weiterveröffentlichung prüfen. Oben als unbestätigt markierte Details sind nicht unabhängig bestätigt.
Peak- und Nebenzeit-API-Preise machen dauerhafte Flagship-Inferenz teurer und schwerer zu prognostizieren — auch für Teams, die API-Abrechnung und Datenverarbeitung unter der DSGVO planbar halten müssen. Ein 2.4T-MoE selbst zu hosten ist ein Rechenzentrumsproblem, kein Laptop-Problem. Reseller können den Spitzentarif unterbieten, aber Produktions-Agents, Xcode-Builds und lange Sitzungen auf einer geteilten Inferenz-Queue lassen schwache Isolation. Für eine stabilere Produktionsumgebung, die zu iOS-CI/CD und KI-Agent-Automatisierung passt, ist die Mac-Mini-Cloud-Miete von NodeMini in der Regel die bessere Wahl — dediziertes Apple Silicon, Abrechnung pro Node, ohne denselben GPU-Peak wie in Peking.
Der Nebenzeit-Tarif liegt weiter unter Claude Opus 5, ist aber nicht mehr die günstigste Option insgesamt. GPT-5.6 Luna von OpenAI ($0.20/$1.20 pro Million Tokens) und der internationale Qwen3.8-Max-Tarif von Alibaba ($2/$6) unterbieten DeepSeeks neue Nebenzeit-Preise in mindestens einer Dimension. Wenn Coding-Agents von der gemeinsamen Peak-Queue weg sollen, die Mac-Mini-Mietpreise vergleichen.
Ja, in den meisten Fällen. Persönliche Projekte und interne Unternehmensnutzung bleiben unberührt. Die Einschränkung gilt nur, wenn Sie ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreiben, das in einem beliebigen zusammenhängenden 12-Monats-Zeitraum über $50M Umsatz erzielt hat.
Nein. Diese Behauptung kursierte online, ist aber falsch. Die veröffentlichte Lizenz enthält keinerlei geografische Beschränkung. Die Auflagen sind umsatzbezogen, nicht an den Standort von Ihnen oder Ihren Nutzern gebunden.
Auf Ebene des Basismodells nichts. Beide nutzen dasselbe Foundation-Modell mit 743B Parametern. Die Leistungsgewinne (rund 6x auf Terminal-Bench 3.0) stammen vollständig aus skalierter Reinforcement Learning in der Post-Training-Phase.
Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas echtes Flagschiff. Mark Zuckerberg hat Open Weights für Muse Spark 1.2 für bald angekündigt. Zum Redaktionsschluss ist diese Veröffentlichung nicht erfolgt. Hinweise zu Isolation und Zugang stehen im Hilfezentrum.