Alibaba Qwen3.8-Max:
2,4 Billionen Parameter, Arena Top 5, Open Weights nächste Woche

Am 3. August 2026 hat Alibaba das neue Flaggschiff Qwen Qwen3.8-Max vorgestellt (2,4 Billionen Gesamtparameter, 95 Milliarden aktiviert, 1 Mio. Token Kontext) und parallel den Agent Qwen Office gestartet. Dieser Leitfaden richtet sich an Entwickler, die Modellauswahl und Agent-Workflow-Kosten datenbasiert bewerten, und deckt ab: Release-Zeitplan Juli–August, Kern-Benchmarks und Preistabelle, MoE-Architektur im Detail, Horizontalvergleich mit Kimi K3 / DeepSeek V4 / Claude, Kontroverse um das Open-Source-Label, Branchenkontext, Sechs-Schritte-Evaluierungs-Checkliste und FAQ. Kerndaten: Arena Text Rang 5 (1496 Punkte, Preliminary) ist derzeit das einzige zitierbare Drittanbieter-Signal; alle übrigen Benchmarks stammen aus Alibabas Eigenmessung, das Open-Weights-Versprechen für „nächste Woche" war zum Redaktionsschluss noch nicht eingelöst.

01

Zeitplan: Von der Preview zur GA — hohes Tempo in zwei Wochen

Juli–August 2026 markieren ein dichtes Release-Fenster chinesischer Billionen-Parameter-Modelle. Die folgende Timeline fasst bestätigte Ereignisse und offizielle Aussagen zusammen — als Referenzrahmen zwischen Kimi K3, DeepSeek V4-Flash und Qwen3.8-Max.

DatumEreignis
16. JuliMoonshot AI veröffentlicht Kimi K3: 2,8 Billionen Parameter (16 von 896 Experten aktiv), Fokus auf unabhängige Evaluation und transparenten Technikbericht
19. JuliQwen3.8-Max als Preview verfügbar, angebunden an Token Plan / Qoder / QoderWork; Preis auf ca. 10 % des erwarteten GA-Tarifs; keine Angaben zu aktivierten Parametern oder Benchmark-Tabelle; ToS verbieten automatisierte Produktionsaufrufe
27. JuliKimi K3-Gewichte wie versprochen auf Hugging Face veröffentlicht, inklusive Open-Source von Attention-Kernel, MoE-Kommunikationsbibliothek und weiterer Infrastruktur
31. JuliDeepSeek veröffentlicht V4-Flash GA; Parametergröße unverändert, Agent- und Code-Benchmarks deutlich über V4-Pro Preview
3. AugustQwen3.8-Max offiziell GA, vollständige Benchmark-Tabelle, Agent „Qwen Office" live; Alibaba-Aktie HK +ca. 7 %, US +ca. 4,5 % am Release-Tag
Voraussichtlich um 10. AugustQwen3.8-Max und kompakte Variante Qwen3.8-27B sollen auf Hugging Face und ModelScope erscheinen — zum Redaktionsschluss fehlen konkretes Datum und Open-Source-Lizenz

Sechs Informationsfallen, die Entwickler kennen sollten

  1. 01

    „Open-Source"-Label als bereits veröffentlichte Gewichte lesen: Website zeigt GA-Tag Open Source, Hugging Face / ModelScope haben noch kein Repository und keine Lizenz

  2. 02

    Gesamtparameter ≠ Inferenzkosten: Bei 2,4T Gesamtparametern werden 95 Mrd. aktiviert — die Rechnung liegt näher an Hundert-Milliarden-Modellen

  3. 03

    Benchmark-Tabellen überwiegend Eigenmessung: PaperBench, RecreationBench u. a. stammen aus Alibabas Framework; Dritte haben die GA-Version noch nicht reproduziert

  4. 04

    Arena-Rang als Preliminary: 1496 Punkte, Text-Arena Rang 5, weiterhin als „vorläufig" markiert — kein finales Urteil

  5. 05

    Preview-Phase ohne Transparenz: Im Juli keine aktivierten Parameter, kein Model Card, keine Sicherheitsbewertung — mehrere Institute rieten von Produktionsmigration ab

  6. 06

    Wettbewerbs-Fußnoten mit Vorbehalt: Vergleichstabellen-Fußnote deutet Fallback bei Fable-5-Scores an; Alibabas eigene Methodik ist ebenfalls nicht vollständig offengelegt

warning

Verifikationshinweis: Datenstand 4. August 2026. Open-Weights-Termin, finale Arena-Rangliste und unabhängige Retests können sich jederzeit ändern — vor Produktionsmigration offizielle Alibaba-Ankündigungen und unabhängige Reviews prüfen.

02

Kernzahlen: Offizielle Spezifikationen und Benchmark-Tabelle

MerkmalQwen3.8-Max
Release-Datum3. August 2026 (GA)
Gesamt- / aktivierte Parameter2,4 Billionen / 95 Milliarden
ArchitekturSparse MoE auf Qwen3.5-Basis + Hybrid-Attention
Kontextfenster1 Mio. Token (Thinking-Modus ca. 983.000, Output-Limit 131.000)
Eingabe-ModalitätenText / Bild / Video
API-PreisEingabe 2 $/M Token, Ausgabe 6 $/M Token (impliziter Cache-Hit 0,25 $, expliziter Cache-Write 2,5 $, Read 0,17 $)
Inlandspreis (China)Eingabe 12 ¥/M Token, Ausgabe 36 ¥/M Token, Cache-Hit ab 1,5 ¥
Arena Text (Snapshot 1.8.)Rang 5, 1496 Punkte (Preliminary); einziges Nicht-Anthropic-Modell in den Top 8
Arena VisionRang 2, direkt hinter Claude Fable 5
PaperBench (Alibaba-Eigenmessung)93,0 (+28,2 ggü. Vorgänger)
OSWorld-Verified (Alibaba-Eigenmessung)86,1
SWE-bench Pro (Alibaba-Eigenmessung)67,7 (hinter Fable 5 mit 80,0)
HLE (Alibaba-Eigenmessung)43,6 (niedrigster Wert unter Flaggschiffen; Fable 5: 53,3)
Open-Weights-StatusVersprochen für „nächste Woche", zum Redaktionsschluss noch nicht live

Hinweis: Als „Alibaba-Eigenmessung" markierte Werte stammen aus offiziellen Release-Materialien; Artificial Analysis, Arena.ai u. a. haben die GA-Version noch nicht unabhängig reproduziert.

03

Architektur im Detail: Was steckt hinter 2,4 Billionen Parametern?

Warum MoE + Hybrid-Attention statt reiner Parameter-Skalierung?

Qwen3.8-Max setzt die Qwen3.5-Linie fort: Sparse MoE bringt 2,4 Billionen Gesamtparameter bei nur 95 Milliarden aktivierten — Inferenzkosten liegen näher an Hundert-Milliarden-Modellen als an einem voll aktivierten 2,4T-Modell. Das erklärt den API-Tarif von 2 $/6 $ (deutlich unter Claude Opus 5 mit 5 $/25 $ und Fable 5 mit 10 $/50 $): Architektureffizienz statt reiner Skalierung als Preishebel.

reasoning_effort in drei Stufen: kalkulierbare Kosten

Das Modell bietet low / medium / xhigh (Standard: xhigh). Entwickler steuern Geschwindigkeit vs. Tiefe je nach Aufgabe; unterstützt werden enable_thinking oder im Anthropic-kompatiblen Interface das Feld reasoning.effort.

Langfristige autonome Tasks: Claim und Verifikation

Alibaba nennt u. a. ein 16-tägiges autonomes Coding-Projekt ohne menschlichen Eingriff, Chip-Design-Optimierung mit über 500 Schritten sowie den eigenen RecreationBench (Black-Box-Umgebung, Rekonstruktion realer Apps nur aus Interaktion und visuellem Feedback). Teile davon sind unter GitHub qwen-code-dev-bot/oh-my-cli dokumentiert — aber ohne vollständiges Dritt-Audit.

Ökosystem-Positionierung: Modell bis Agent-Produkt

Qwen3.8-Max ist parallel in „Qwen Office" integriert; die API unterstützt OpenAI- und Anthropic-Protokolle und lässt sich an Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw u. a. anbinden — geringere Migrationskosten für bestehende Agent-Toolchains.

Sechs-Schritte-Evaluierungs-Checkliste (operativ)

  1. 01

    API vs. Gewichte trennen: QwenCloud-API ist jetzt nutzbar; für lokales Deployment auf Qwen3.8-27B Open Weights warten oder Max-Lizenzbedingungen abwarten

  2. 02

    Kosten-Baseline setzen: Monatliche Token-Rechnung mit 2 $/6 $ und Cache-Hit 0,25 $ kalkulieren; Gegenrechnung zu Kimi K3 (3 $/15 $)

  3. 03

    reasoning_effort konfigurieren: Latenzkritische Tasks zuerst mit medium/low; komplexe Agent-Workflows erst dann xhigh

  4. 04

    Echtes Business-A/B fahren: Nicht allein nach offiziellen Benchmarks migrieren; Blindvergleich mit eigenem Code und Kimi K3

  5. 05

    Dritt-Retests verfolgen: Artificial Analysis, finale Arena-Rangliste und Hugging-Face-Release-Meldungen im Blick behalten

  6. 06

    Compliance und Unternehmensdaten prüfen: In Enterprise-Szenarien Alibaba-Cloud-ToS, Log-Aufbewahrung, Modell-Output-Audit sowie DSGVO-Anforderungen (Datenverarbeitung, Auftragsverarbeitung, ggf. Drittlandtransfer) vor Integration bewerten

04

Horizontalvergleich: Qwen3.8-Max, Kimi K3, DeepSeek V4 und Claude

ModellAnbieterGesamt / aktiviertKontextPreis (Eingabe / Ausgabe pro M Token)Open WeightsUnabhängige Evaluation
Qwen3.8-MaxAlibaba2,4T / 95 Mrd.1 Mio.2 $ / 6 $Noch nicht (zugesagt)Keine
Kimi K3Moonshot AI2,8T / ca. 50 Mrd.ca. 1,048 Mio.3 $ / 15 $Offen (27.7.)AA Index ca. 57,11
DeepSeek V4-ProDeepSeek1,6T / 49 Mrd.1 Mio.Keine vollständige TabelleOffenSWE-bench Verified 80,6 %
DeepSeek V4-FlashDeepSeekUnverändert1 Mio.Keine vollständige TabelleOffen9 Agent-/Code-Benchmarks über V4-Pro
Claude Opus 5AnthropicNicht veröffentlicht1 Mio.5 $ / 25 $Closed SourceArena-Spitze
Claude Fable 5AnthropicNicht veröffentlicht1 Mio.10 $ / 50 $Closed SourceArena Text Rang 1

Leicht übersehenes Detail: Kimi K3 und DeepSeek haben aktivierte Parameter früh veröffentlicht; Alibaba nannte „95 Milliarden" erst mit GA — mangelnde Preview-Transparenz war im Juli ein Kritikpunkt unabhängiger Institute. Im einzigen vergleichbaren Blindtest (Architekturaufgabe an 269 Dateien eines realen Projekts) erreichte Kimi K3 83 Punkte, Qwen3.8-Max Preview 80 — gleiches Segment, wechselnde Sieger.

„Weltweite Spitzenliga" und „überlegen gegenüber GPT-5.6 Sol und Fable 5" sind derzeit vor allem Alibabas eigene Narrative — erst Open Weights plus unabhängige Benchmarks werden das belastbar machen.

05

Kontroversen und Branchenkontext: Open-Source-Label vor den Gewichten

  • Website zeigt Open Source, Gewichte fehlen: Label am GA-Tag gesetzt, Hugging Face / ModelScope ohne Repository, Lizenz oder festes Datum
  • Benchmarks aus Eigenframework: QwenSWEBench, CoWorkBench, RecreationBench u. a.; neutrale Plattformen haben GA noch nicht reproduziert
  • Fußnoten gegen Wettbewerber: „Fable-5-Ergebnisse möglicherweise mit Fallback" ohne technische Belege; Alibabas Methodik ebenfalls nicht vollständig transparent
  • Preview-ToS blockierte Produktion: Preview vom 19. Juli untersagte automatisierte Produktionsumgebungen; kein Model Card, keine Sicherheitsbewertung

Billionen-Parameter-Wettbewerb 2026: neue Phase

  • Parameter-Rennen vs. Architektureffizienz: DeepSeek V4-Flash zeigt Agent-Gewinne ohne reine Skalierung; Qwen3.8-Max folgt dem Narrativ „große Kapazität, geringe Aktivierung"
  • Alibabas seltene Open-Source-Rückkehr: Erstes Versprechen, Max-Gewichte zu veröffentlichen — neben Kimi K3 und DeepSeek entsteht ein chinesisches „kollektives Offenlegen" an der Spitze
  • Consumer-Landing: Komprimierte Qwen-Modelle treiben Apple Intelligence auf dem chinesischen Markt — systemweite KI auf Hunderten Millionen iPhones
  • Kapitalmarkt: Release-Tag HK +ca. 7 %, US +ca. 4,5 %
  • Regulatorischer Gegensatz USA/China: Parallel beriet das Weiße Haus mit OpenAI, Anthropic u. a. über Agent-Cybersicherheits-Testframeworks — beschleunigtes Open Sourcing einerseits, strengere Agent-Prüfung andererseits

Kernzahlen zum Zitieren

  • Spezifikation: 2,4T gesamt / 95 Mrd. aktiviert / 1M Kontext / multimodale Eingabe
  • Preis: API 2 $/6 $; China 12/36 ¥ pro M Token
  • Arena: Text Rang 5 (1496, Preliminary); Vision Rang 2
  • Blindtest: Kimi K3 83 vs. Qwen Preview 80 (Architekturdesign)
  • Open-Weights-Versprechen: Qwen3.8-Max + Qwen3.8-27B, voraussichtlich um 10. August

Wer Qwen3.8-Max in Claude Code, Qoder oder OpenClaw für lange Agent-Sessions einbindet, stößt auf Laptop oder instabilem Linux-VPS oft an RAM-Grenzen, Session-Abbrüche und fehlende Xcode-/Metal-Toolchains. Für Produktion mit stabiler SSH-Langsession, DerivedData-Cache und iOS-CI/CD-Automatisierung ist bei knappem lokalem Mac-Compute NodeMini Mac-Mini-Cloud-Miete die pragmatischere Option — dedizierter Node, Sekunden-Provisionierung, Agent und Build auf derselben echten Mac-Hardware. Details unter Mac-Mini-Mietpreise.

Quellen: Alibaba-Offizialblog und Pressemitteilungen, Arena.ai-Ranking (Snapshot 2026-08-01), unabhängige Analysen (Apidog, Yotta Labs, TechNode), Berichte zu Apple Intelligence China. Vor Deployment aktuelle Offizialmeldungen verifizieren.

FAQ

Häufig gestellte Fragen

Die API ist über QwenCloud verfügbar und unterstützt OpenAI- sowie Anthropic-Protokolle. Gewichte sind noch nicht veröffentlicht; die Website trägt zwar Open Source, Repository und Lizenz auf Hugging Face / ModelScope werden laut Ankündigung „nächste Woche" (ca. 10. August 2026) erwartet. Für die Agent-Umgebung siehe Mac-Mini-Mietpreise.

Keine autoritative Einheits-Benchmark. Der einzige unabhängige Blindtest zeigt sehr ähnliche Werte (Kimi K3: 83, Qwen Preview: 80) — gleiches Segment, wechselnde Stärken. Kimi K3 punktet mit bereits offenen Gewichten und Drittdaten; Qwen3.8-Max mit niedrigerem API-Preis und stärkerer Multimodalität.

Gesamt- und aktivierte Parameter unterscheiden. Es werden 95 Milliarden aktiviert; API-Kosten liegen auf Hundert-Milliarden-Niveau. Lokales Self-Hosting der Vollversion braucht Multi-Node-Rechenzentren — für die meisten Teams ist Qwen3.8-27B Open Weights die realistische Option.

Als Referenz ja, als endgültiges Urteil nein. Daten stammen aus Alibabas Eigenframework; neutrale Plattformen haben GA noch nicht reproduziert. Empfehlung: unabhängige Retests abwarten oder A/B im eigenen Business-Kontext.

Neben günstigeren Frontier-APIs basiert Apple Intelligence in China auf komprimierten Qwen-Modellen mit lokaler Ausführung — iPhone-Nutzer profitieren systemweit. Weitere Fragen: Hilfezentrum.