DeepSeek-Preiserhöhung erklärt
Chinas Open-Weight-Preiskampf im August 2026

In einem Fünf-Tage-Fenster haben drei der führenden chinesischen KI-Labs Schritte unternommen, die sich an der Oberfläche widersprechen. DeepSeek hat API-Preise in einzelnen Stufen um bis zu ~1100% angehoben. Alibaba hat ein 2.4T-Parameter-Flagschiff als Open Weight veröffentlicht, das zuvor nie öffentlich lag. Zhipu hat GLM-5.3 ausgeliefert und Coding-Benchmarks auf demselben Basismodell um rund 6x verbessert — ohne erneutes Pretraining. Dieser Text führt Entwickler und Einkäufer durch Zeitlinie, Preistabelle, die drei Strategien, den Direktvergleich, die strittigen Behauptungen und die FAQ. Das gemeinsame Signal: Chinas Labs konkurrieren nicht mehr nur über den Preis, sondern über Preissetzungsmacht.

01

Zeitlinie: was passiert ist — und wann

Der häufigste Fehler ist, ~1100% mit der gesamten Rechnung gleichzusetzen. Zuerst die Daten, dann Abrechnungsdimension, Lizenztyp und Benchmark-Quelle getrennt halten.

DatumEreignis
16. Juli 2026Moonshot AI veröffentlicht Kimi K3 als Open Weight (2.8T Parameter) und zieht US-Sicherheitsprüfungen auf sich
2.–3. August 2026Alibaba kündigt Qwen3.8-Max an und startet das Modell als gehostete API
10. August 2026Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flagschiff Muse Spark 1.2 an
12. August 2026Alibaba stellt Qwen3.8-2.4T-A95B Open Weights auf Hugging Face / ModelScope bereit; xAI liefert Grok 4.6 aus
13. August 2026DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung zum 17. August an; Google liefert vergünstigtes Gemini 3.7 Flash
14. August 2026Zhipu liefert GLM-5.3 aus und nutzt die 743B-Basis von GLM-5.2 weiter
17. August 2026, 00:00 Peking-ZeitDeepSeeks neue Preise treten in Kraft

Der weitere Rahmen: Am 30. Juli senkte OpenAI die Preise der günstigsten Stufe (GPT-5.6 Luna, minus 80%), machte Luna am 6.–7. August zum kostenlosen Default mit unbegrenzten Textchats. Während chinesische Labs Preise anhoben und Flagship-Weights öffneten, senkten US-Labs Preise und gingen auf der Verbraucherebene auf Gratis — zur selben Zeit. Das sind zwei Seiten desselben Preiskampfs.

Sechs Fehldeutungen, die vor jeder Schlagzeile entfallen sollten

  1. 01

    ~1100% als gesamte Rechnung lesen. Die Zahl gilt für Cache-Hit-Input in der Spitzenzeit, die Stufe, die zuvor am nächsten an kostenlos lag.

  2. 02

    Pekinger Peak-Fenster ignorieren. Spitzenzeiten sind 9–12 und 14–18 Peking-Zeit. Die Ankündigung fordert eine Lastverschiebung.

  3. 03

    Jeden offenen Checkpoint als Apache 2.0 bezeichnen. Qwen3.8-Max erscheint unter einer eigenen Lizenz. Muse Glimmer ist eine andere Wette.

  4. 04

    Das Geo-Ban-Gerücht wiederholen. Die veröffentlichte Lizenz enthält keine territoriale Klausel für USA / EU / UK / Korea.

  5. 05

    GLM-5.3 als neues Foundation-Modell lesen. Dieselbe 743B-Basis wie 5.2. Der Sprung kommt aus skalierter Post-Training-RL.

  6. 06

    Chinesisches Modell mit günstigstem Modell gleichsetzen. DeepSeek in der Nebenzeit unterbietet weiter Claude Opus 5. Luna und Qwen international unterbieten inzwischen DeepSeek.

02

Die Zahlen: was sich tatsächlich geändert hat

Die Preise stammen aus DeepSeeks offizieller Ankündigung, gegencheckt gegen Wall Street CN, IT Home und V2EX. GLM-Werte sind Zhipus eigene Angaben. Ein unabhängiger Dritt-Rerun ist bislang nicht veröffentlicht.

DeepSeeks Preiserhöhung, Stufe für Stufe

Wirksam 17. August 2026, 00:00 Peking-Zeit. Spitzenzeiten: 9–12 und 14–18 Peking-Zeit. Einheit: pro 1M Tokens.

AbrechnungspositionAlter PreisNeu NebenzeitNeu SpitzeAnstieg Spitze
V4-Flash Cache-Hit (Input)¥0.02¥0.05¥0.10~400%
V4-Flash Cache-Miss (Input)¥1.0¥1.5¥3.0200%
V4-Flash Output¥2.0¥4.5¥9.0350%
V4-Pro Cache-Hit (Input)¥0.025¥0.15¥0.30~1100%
V4-Pro Cache-Miss (Input)¥3.0¥4.5¥9.0200%
V4-Pro Output¥6.0¥13.5¥27.0350%
info

Kontext: Die Schlagzeile ~1100% gilt für Cache-Hit-Input in der Spitzenzeit. Output-Preise, die die meisten realen Rechnungen dominieren, stiegen um 350%. Eine unabhängige Kostenmodellierung für eine realistische Schwerlast (rund 84M Tokens/Monat, überwiegend Nebenzeit, zur Hälfte Cache-Hits) ergibt einen Rechnungsanstieg näher an 1.8x.

Qwen3.8-2.4T-A95B (Qwen3.8-Max Open Weights)

SpezifikationDetail
Parameter2.4T gesamt, 95B aktiv pro Token (MoE, 512 Experts, 10 routed + 1 shared)
Kontextfenster262,144 Tokens nativ (offener Checkpoint), erweiterbar auf ~1.01M; gehostete Max-Version standardmäßig 1M
Release-TaktPreview 2. August → API live 3. August → Open Weights 12. August
API-Preis (international)$2/M Input, $6/M Output
LizenzNicht Apache 2.0 — eine eigene Qwen3.8-Max License
Warum es zähltErstmals hat Alibaba ein Max-Flagschiff als Open Weight veröffentlicht; Qwen3.5 / 3.6 / 3.7 Max blieben API-only

GLM-5.3 gegen GLM-5.2: dieselbe Basis, nur Post-Training

BenchmarkGLM-5.2GLM-5.3Änderung
Terminal-Bench 3.04.6%28.3%+23.7 pts
DeepSWE v1.146.2%66.9%+20.7 pts
Agents' Last Exam (CLI)23.8%28.5%+4.7 pts
CyberGym77.2%84.5%+7.3 pts
AutomationBench26.2%48.2%+22.0 pts
warning

Einschränkung: Das sind Zhipus eigene Angaben. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34.6%) und Claude Fable 5 (33.7%). Es ist ein Spitzenergebnis unter Open-Weight-Modellen, kein uneingeschränkter Frontier-Sieg.

03

Die drei Strategien im Detail

Drei Labs. Drei Züge. Eine Frage darunter: Wenn Nutzung schneller skaliert als GPUs und Pretraining-Erträge abflachen, wer behält Preissetzungsmacht.

DeepSeek: Tageszeitpreise sind ein Kapazitätsproblem

Die einfachste Fehldeutung lautet: „Chinas günstigstes Modell ist dem Margendruck gewichen.“ Die Tarifstruktur liest sich eher umgekehrt: ein Unternehmen macht Rechenengpässe in der Preisliste sichtbar. Flache, dauerhaft günstige Preise funktionierten als Kundengewinnung, solange GPU-Kapazität mithielt. Als die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden. „Flexiblere Lastplanung anregen“ ist Konzernsprache für „Spitzenzeit-Compute ist knapp, verschieben Sie die Last selbst“.

Ein Detail, das die internationale Berichterstattung weitgehend überging: In der Spitzenzeit liegt DeepSeeks offizieller API-Preis nun über mehreren Drittanbieter-Resellern (GMI Cloud, Novita und andere listen V4 Pro derzeit unter DeepSeeks neuem Spitzentarif). Die Annahme, die offizielle API sei stets der günstigste Weg, DeepSeek zu betreiben, ist zum ersten Mal gebrochen.

Alibaba: Open Weights kaufen Mindshare; eine eigene Lizenz schützt die Obergrenze

Alibaba hat zwei Dinge gleichzeitig getan. Es hat den vollständigen 2.4T-Parameter-Checkpoint zum kostenlosen Download veröffentlicht und eine eigene Lizenz angehängt — nicht das permissive Apache 2.0 der kleineren Qwen-Modelle. Jedes Model-as-a-Service- oder AI-Work-Assistant-Geschäft mit über $50M Umsatz in einem beliebigen 12-Monats-Zeitraum muss eine separate Kommerzlizenz verhandeln. Produkte mit 100M MAU oder $20M Monatsumsatz müssen den Modellnamen prominent anzeigen.

Weights verschenken, um Entwickler-Mindshare zu gewinnen, besonders international. Preissetzungsmacht über die wenigen Unternehmen behalten, die darauf ein konkurrierendes Inferenzgeschäft bauen können. Das ist eine substantiell andere Wette als Metas Muse Glimmer, das unter uneingeschränktem Apache 2.0 erscheint.

info

Gerücht beenden: Behauptungen, Alibabas Lizenz verbiete Downloads aus den USA, der EU, dem UK und Südkorea, sind falsch. Der veröffentlichte Lizenztext enthält keinerlei geografische oder territoriale Klausel. Die LICENSE-Datei prüfen, nicht den Ankündigungsthread.

GLM-5.3: kein neues Basismodell, nur eine größere Post-Training-Wette

Die interessanteste Tatsache ist die Methode: dieselbe 743B-Parameter-Basis wie GLM-5.2, kein erneutes Pretraining, und ein Sprung von rund 6x auf Terminal-Bench 3.0 (4.6% → 28.3%) durch Skalierung der Reinforcement-Learning-Umgebungen im Post-Training. Während Pretraining-Skalierungsgesetze abnehmende Erträge zeigen, wird Post-Training-RL zu einem eigenständigen Leistungshebel mit deutlich niedrigerer Kostenschwelle als das Retraining eines neuen Foundation-Modells. Labs der mittleren Liga ohne OpenAI-skalierte Compute-Budgets können den Abstand bei agentischen und Coding-Benchmarks weiter schließen.

Chinas KI-Labs wechseln vom reinen Preiswettbewerb zum Wettbewerb um Preissetzungsmacht selbst.

04

Direktvergleich: Ist DeepSeek noch das günstigste Frontier-Modell?

RMB-USD-Umrechnung bei etwa ¥7.15/$1, näherungsweise. Offizielle Ankündigungen gelten bei Abweichungen.

ModellInput (pro 1M Tokens)Output (pro 1M Tokens)Open Weights?
DeepSeek V4-Pro (Spitze)¥9.0 (~$1.26)¥27.0 (~$3.78)Nein
DeepSeek V4-Pro (Nebenzeit)¥4.5 (~$0.63)¥13.5 (~$1.89)Nein
Qwen3.8-Max (internationale API)$2.00$6.00Ja (eigene Lizenz)
OpenAI GPT-5.6 Luna$0.20$1.20Nein
Claude Opus 5 (impliziert, nach Alibabas Vergleichsverhältnis)~$5.00~$25.00Nein

Die kurze Antwort: nein. Der Nebenzeit-Tarif von DeepSeek V4-Pro liegt weiter klar unter Claude Opus 5, ist aber nicht mehr die uneingeschränkt günstigste Option. Der internationale Qwen3.8-Max-Tarif und OpenAIs Luna unterbieten DeepSeeks Nebenzeit-Preis. „Chinesisches Modell = günstigstes Modell“ galt für den Großteil von 2025 und das frühe 2026. Das ist keine sichere Annahme mehr.

Sechs Schritte nach der Erhöhung: Rechnung, Routing, Lizenz

  1. 01

    Die Rechnung in drei Spalten teilen. Cache-Hit-Input, Cache-Miss-Input und Output. Nicht aus einer einzelnen ~1100%-Schlagzeile budgetieren.

  2. 02

    Jobs auf Pekinger Spitzenzeiten mappen. 9–12 und 14–18 Peking-Zeit werden als Peak abgerechnet. Was möglich ist, in die übrigen 17 Stunden legen.

  3. 03

    Die Cache-Hit-Rate messen. Eine modellierte Schwerlast (~84M Tokens/Monat, überwiegend Nebenzeit, zur Hälfte Hits) landet nahe 1.8x, nicht 12x.

  4. 04

    Offiziellen Peak mit Resellern vergleichen. GMI Cloud und Novita listen V4 Pro derzeit unter DeepSeeks neuem Peak. Offiziell ist nicht mehr automatisch am günstigsten.

  5. 05

    Die LICENSE-Datei vor kommerzieller Nutzung lesen. Die Qwen-Schwellen sind $50M MaaS- / AI-Work-Assistant-Umsatz und 100M MAU oder $20M Monatsumsatz für Attribution. Kein Geo-Ban.

  6. 06

    GLM-5.3 als Post-Training-Hebel akzeptieren. Offizielles Terminal-Bench 3.0: 28.3% gegen 4.6%. Weiter hinter Sol 34.6% und Fable 5 mit 33.7%. Auf dieser Basis validieren.

text
# DeepSeek V4-Pro Output (pro 1M Tokens, offizielle Karte)
Alter Flattarif: ¥6.0
Neue Nebenzeit:  ¥13.5   (+125% vs. alt; Hälfte der Spitze)
Neue Spitze:     ¥27.0   (+350% vs. alt)

# Drei Fragen vor jeder Schlagzeile
1) Cache-Hit-Input, Cache-Miss-Input oder Output?
2) Spitze oder Nebenzeit?
3) Wie hoch ist meine reale Cache-Hit-Rate?
05

Was umstritten ist, warum es zählt, und drei zitierfähige Zahlen

Was strittig oder unbestätigt ist

  • Die Schlagzeile ~1100% ist technisch korrekt, ohne Kontext aber irreführend. Sie gilt nur für Cache-Hit-Input in der Spitzenzeit. Output-Preise stiegen um 350%. Verschiedene Medien haben unterschiedliche Stufen zitiert, als wären sie die gesamte Geschichte.
  • Behauptungen, Qwen3.8-Max laufe auf Alibabas eigenen Zhenwu-M890-Chips (und „Pangu AL128“-Supernodes), berichtet von mehreren chinesischen Finanzmedien, sind von Alibabas eigener technischer Dokumentation oder Dritt-Benchmarks nicht unabhängig bestätigt. Das ist vendor-nah, unbestätigt.
  • GLM-5.3s gemeldete Entdeckung einer „schweren Schwachstelle“ in Cursor stammt von VentureBeat und Zhipus eigener Disclosure. Konkrete technische Details sind nicht öffentlich. Lesen als vendor-sourced, nicht unabhängig auditiert.
  • Berichte, Chinas Handelsministerium bereite Vergeltungs-Exportkontrollen für KI- und Halbleitertechnologie vor, sind spekulativ und stützen sich auf unbestätigte Medienberichte, nicht auf eine offizielle Ankündigung.

Zwei Preiskämpfe laufen parallel

Im groben Verlauf des vergangenen Monats haben Chinas führende Labs Major-Releases in einem Takt ausgeliefert, den inländische Finanzmedien bereits „drei Modell-Updates pro Woche“ (一周三更) nennen — DeepSeek, Alibaba und Zhipu, dazu Moonshots Kimi K3 (Open Weight am 16. Juli, 2.8T Parameter) und MiniMax H3. Die chinesische Berichterstattung rahmt das weitgehend so: chinesische Open-Weight-Releases erzwingen eine globale Neubepreisung der KI-Branche.

US-Labs fahren auf der Verbraucherebene den gegenteiligen Zug: OpenAI senkte die Preise der günstigsten Stufe um 80% (30. Juli) und machte das Modell eine Woche später kostenlos und unbegrenzt (6.–7. August); Google lieferte ein coding-fokussiertes Modell zum halben Preis des drei Wochen alten Vorgängers (13. August). Chinesische Labs öffnen Flagship-Weights und führen gestufte, höhere Preise am compute-knappen oberen Ende ein. US-Labs rennen am Verbraucherende Richtung gratis und günstig.

Es gibt außerdem eine geopolitische Schicht, die vorsichtig zu benennen ist. Moonshots Open-Weighting von Kimi K3 im Juli hat bereits US-Sicherheitsprüfungen ausgelöst. Dass Alibaba ausgerechnet in diesem Fenster ein 2.4T-Flagschiff öffnet, lesen manche Analysten als Versuch, internationalen Mindshare und eine Erzählung technologischer Parität festzuziehen, bevor eine mögliche regulatorische Verschärfung greift. Das ist eine informierte Interpretation, kein bestätigter Fakt — und leicht zu übersehen, wenn man nur englischsprachige Produktposts liest.

Zitierfähige Zahlen (Stand Veröffentlichung)

  • DeepSeek V4-Pro Peak-Output: ¥27.0 pro 1M Tokens, plus 350% von ¥6.0. Cache-Hit-Input: ¥0.025 → ¥0.30, etwa ~1100%.
  • Qwen3.8-2.4T-A95B: 2.4T gesamt / 95B aktiv, MoE 512 Experts (10 routed + 1 shared), 262,144-Token nativer offener Checkpoint.
  • GLM-5.3 Terminal-Bench 3.0: offiziell 28.3% (5.2 lag bei 4.6%), weiter unter GPT-5.6 Sol 34.6% und Claude Fable 5 mit 33.7%.

Quellen: DeepSeeks offizielle Preisankündigung, gegencheckt gegen Wall Street CN, IT Home, AIGC.cn und V2EX; Alibabas offizielle Qwen-Repositories (Hugging Face / ModelScope) und South China Morning Post zu den Lizenzbedingungen; Zhipu (Z.ai) GLM-5.3-Technikseite, plus VentureBeat und StableLearn; offizieller Blog von Meta AI Research; chinesische Finanzmedien (Yicai, Sohu Finance) zum Release-Takt. Aktuelle offizielle Preise und Lizenzbedingungen vor einer Weiterveröffentlichung prüfen. Oben als unbestätigt markierte Details sind nicht unabhängig bestätigt.

Peak- und Nebenzeit-API-Preise machen dauerhafte Flagship-Inferenz teurer und schwerer zu prognostizieren — auch für Teams, die API-Abrechnung und Datenverarbeitung unter der DSGVO planbar halten müssen. Ein 2.4T-MoE selbst zu hosten ist ein Rechenzentrumsproblem, kein Laptop-Problem. Reseller können den Spitzentarif unterbieten, aber Produktions-Agents, Xcode-Builds und lange Sitzungen auf einer geteilten Inferenz-Queue lassen schwache Isolation. Für eine stabilere Produktionsumgebung, die zu iOS-CI/CD und KI-Agent-Automatisierung passt, ist die Mac-Mini-Cloud-Miete von NodeMini in der Regel die bessere Wahl — dediziertes Apple Silicon, Abrechnung pro Node, ohne denselben GPU-Peak wie in Peking.

FAQ

Häufige Fragen

Der Nebenzeit-Tarif liegt weiter unter Claude Opus 5, ist aber nicht mehr die günstigste Option insgesamt. GPT-5.6 Luna von OpenAI ($0.20/$1.20 pro Million Tokens) und der internationale Qwen3.8-Max-Tarif von Alibaba ($2/$6) unterbieten DeepSeeks neue Nebenzeit-Preise in mindestens einer Dimension. Wenn Coding-Agents von der gemeinsamen Peak-Queue weg sollen, die Mac-Mini-Mietpreise vergleichen.

Ja, in den meisten Fällen. Persönliche Projekte und interne Unternehmensnutzung bleiben unberührt. Die Einschränkung gilt nur, wenn Sie ein Model-as-a-Service- oder AI-Work-Assistant-Geschäft betreiben, das in einem beliebigen zusammenhängenden 12-Monats-Zeitraum über $50M Umsatz erzielt hat.

Nein. Diese Behauptung kursierte online, ist aber falsch. Die veröffentlichte Lizenz enthält keinerlei geografische Beschränkung. Die Auflagen sind umsatzbezogen, nicht an den Standort von Ihnen oder Ihren Nutzern gebunden.

Auf Ebene des Basismodells nichts. Beide nutzen dasselbe Foundation-Modell mit 743B Parametern. Die Leistungsgewinne (rund 6x auf Terminal-Bench 3.0) stammen vollständig aus skalierter Reinforcement Learning in der Post-Training-Phase.

Noch nicht. Muse Glimmer ist ein destilliertes 30B-Modell, nicht Metas echtes Flagschiff. Mark Zuckerberg hat Open Weights für Muse Spark 1.2 für bald angekündigt. Zum Redaktionsschluss ist diese Veröffentlichung nicht erfolgt. Hinweise zu Isolation und Zugang stehen im Hilfezentrum.