Am 3. August 2026 hat Alibaba das neue Flaggschiff Qwen Qwen3.8-Max vorgestellt (2,4 Billionen Gesamtparameter, 95 Milliarden aktiviert, 1 Mio. Token Kontext) und parallel den Agent Qwen Office gestartet. Dieser Leitfaden richtet sich an Entwickler, die Modellauswahl und Agent-Workflow-Kosten datenbasiert bewerten, und deckt ab: Release-Zeitplan Juli–August, Kern-Benchmarks und Preistabelle, MoE-Architektur im Detail, Horizontalvergleich mit Kimi K3 / DeepSeek V4 / Claude, Kontroverse um das Open-Source-Label, Branchenkontext, Sechs-Schritte-Evaluierungs-Checkliste und FAQ. Kerndaten: Arena Text Rang 5 (1496 Punkte, Preliminary) ist derzeit das einzige zitierbare Drittanbieter-Signal; alle übrigen Benchmarks stammen aus Alibabas Eigenmessung, das Open-Weights-Versprechen für „nächste Woche" war zum Redaktionsschluss noch nicht eingelöst.
Juli–August 2026 markieren ein dichtes Release-Fenster chinesischer Billionen-Parameter-Modelle. Die folgende Timeline fasst bestätigte Ereignisse und offizielle Aussagen zusammen — als Referenzrahmen zwischen Kimi K3, DeepSeek V4-Flash und Qwen3.8-Max.
| Datum | Ereignis |
|---|---|
| 16. Juli | Moonshot AI veröffentlicht Kimi K3: 2,8 Billionen Parameter (16 von 896 Experten aktiv), Fokus auf unabhängige Evaluation und transparenten Technikbericht |
| 19. Juli | Qwen3.8-Max als Preview verfügbar, angebunden an Token Plan / Qoder / QoderWork; Preis auf ca. 10 % des erwarteten GA-Tarifs; keine Angaben zu aktivierten Parametern oder Benchmark-Tabelle; ToS verbieten automatisierte Produktionsaufrufe |
| 27. Juli | Kimi K3-Gewichte wie versprochen auf Hugging Face veröffentlicht, inklusive Open-Source von Attention-Kernel, MoE-Kommunikationsbibliothek und weiterer Infrastruktur |
| 31. Juli | DeepSeek veröffentlicht V4-Flash GA; Parametergröße unverändert, Agent- und Code-Benchmarks deutlich über V4-Pro Preview |
| 3. August | Qwen3.8-Max offiziell GA, vollständige Benchmark-Tabelle, Agent „Qwen Office" live; Alibaba-Aktie HK +ca. 7 %, US +ca. 4,5 % am Release-Tag |
| Voraussichtlich um 10. August | Qwen3.8-Max und kompakte Variante Qwen3.8-27B sollen auf Hugging Face und ModelScope erscheinen — zum Redaktionsschluss fehlen konkretes Datum und Open-Source-Lizenz |
„Open-Source"-Label als bereits veröffentlichte Gewichte lesen: Website zeigt GA-Tag Open Source, Hugging Face / ModelScope haben noch kein Repository und keine Lizenz
Gesamtparameter ≠ Inferenzkosten: Bei 2,4T Gesamtparametern werden 95 Mrd. aktiviert — die Rechnung liegt näher an Hundert-Milliarden-Modellen
Benchmark-Tabellen überwiegend Eigenmessung: PaperBench, RecreationBench u. a. stammen aus Alibabas Framework; Dritte haben die GA-Version noch nicht reproduziert
Arena-Rang als Preliminary: 1496 Punkte, Text-Arena Rang 5, weiterhin als „vorläufig" markiert — kein finales Urteil
Preview-Phase ohne Transparenz: Im Juli keine aktivierten Parameter, kein Model Card, keine Sicherheitsbewertung — mehrere Institute rieten von Produktionsmigration ab
Wettbewerbs-Fußnoten mit Vorbehalt: Vergleichstabellen-Fußnote deutet Fallback bei Fable-5-Scores an; Alibabas eigene Methodik ist ebenfalls nicht vollständig offengelegt
Verifikationshinweis: Datenstand 4. August 2026. Open-Weights-Termin, finale Arena-Rangliste und unabhängige Retests können sich jederzeit ändern — vor Produktionsmigration offizielle Alibaba-Ankündigungen und unabhängige Reviews prüfen.
| Merkmal | Qwen3.8-Max |
|---|---|
| Release-Datum | 3. August 2026 (GA) |
| Gesamt- / aktivierte Parameter | 2,4 Billionen / 95 Milliarden |
| Architektur | Sparse MoE auf Qwen3.5-Basis + Hybrid-Attention |
| Kontextfenster | 1 Mio. Token (Thinking-Modus ca. 983.000, Output-Limit 131.000) |
| Eingabe-Modalitäten | Text / Bild / Video |
| API-Preis | Eingabe 2 $/M Token, Ausgabe 6 $/M Token (impliziter Cache-Hit 0,25 $, expliziter Cache-Write 2,5 $, Read 0,17 $) |
| Inlandspreis (China) | Eingabe 12 ¥/M Token, Ausgabe 36 ¥/M Token, Cache-Hit ab 1,5 ¥ |
| Arena Text (Snapshot 1.8.) | Rang 5, 1496 Punkte (Preliminary); einziges Nicht-Anthropic-Modell in den Top 8 |
| Arena Vision | Rang 2, direkt hinter Claude Fable 5 |
| PaperBench (Alibaba-Eigenmessung) | 93,0 (+28,2 ggü. Vorgänger) |
| OSWorld-Verified (Alibaba-Eigenmessung) | 86,1 |
| SWE-bench Pro (Alibaba-Eigenmessung) | 67,7 (hinter Fable 5 mit 80,0) |
| HLE (Alibaba-Eigenmessung) | 43,6 (niedrigster Wert unter Flaggschiffen; Fable 5: 53,3) |
| Open-Weights-Status | Versprochen für „nächste Woche", zum Redaktionsschluss noch nicht live |
Hinweis: Als „Alibaba-Eigenmessung" markierte Werte stammen aus offiziellen Release-Materialien; Artificial Analysis, Arena.ai u. a. haben die GA-Version noch nicht unabhängig reproduziert.
Qwen3.8-Max setzt die Qwen3.5-Linie fort: Sparse MoE bringt 2,4 Billionen Gesamtparameter bei nur 95 Milliarden aktivierten — Inferenzkosten liegen näher an Hundert-Milliarden-Modellen als an einem voll aktivierten 2,4T-Modell. Das erklärt den API-Tarif von 2 $/6 $ (deutlich unter Claude Opus 5 mit 5 $/25 $ und Fable 5 mit 10 $/50 $): Architektureffizienz statt reiner Skalierung als Preishebel.
Das Modell bietet low / medium / xhigh (Standard: xhigh). Entwickler steuern Geschwindigkeit vs. Tiefe je nach Aufgabe; unterstützt werden enable_thinking oder im Anthropic-kompatiblen Interface das Feld reasoning.effort.
Alibaba nennt u. a. ein 16-tägiges autonomes Coding-Projekt ohne menschlichen Eingriff, Chip-Design-Optimierung mit über 500 Schritten sowie den eigenen RecreationBench (Black-Box-Umgebung, Rekonstruktion realer Apps nur aus Interaktion und visuellem Feedback). Teile davon sind unter GitHub qwen-code-dev-bot/oh-my-cli dokumentiert — aber ohne vollständiges Dritt-Audit.
Qwen3.8-Max ist parallel in „Qwen Office" integriert; die API unterstützt OpenAI- und Anthropic-Protokolle und lässt sich an Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw u. a. anbinden — geringere Migrationskosten für bestehende Agent-Toolchains.
API vs. Gewichte trennen: QwenCloud-API ist jetzt nutzbar; für lokales Deployment auf Qwen3.8-27B Open Weights warten oder Max-Lizenzbedingungen abwarten
Kosten-Baseline setzen: Monatliche Token-Rechnung mit 2 $/6 $ und Cache-Hit 0,25 $ kalkulieren; Gegenrechnung zu Kimi K3 (3 $/15 $)
reasoning_effort konfigurieren: Latenzkritische Tasks zuerst mit medium/low; komplexe Agent-Workflows erst dann xhigh
Echtes Business-A/B fahren: Nicht allein nach offiziellen Benchmarks migrieren; Blindvergleich mit eigenem Code und Kimi K3
Dritt-Retests verfolgen: Artificial Analysis, finale Arena-Rangliste und Hugging-Face-Release-Meldungen im Blick behalten
Compliance und Unternehmensdaten prüfen: In Enterprise-Szenarien Alibaba-Cloud-ToS, Log-Aufbewahrung, Modell-Output-Audit sowie DSGVO-Anforderungen (Datenverarbeitung, Auftragsverarbeitung, ggf. Drittlandtransfer) vor Integration bewerten
| Modell | Anbieter | Gesamt / aktiviert | Kontext | Preis (Eingabe / Ausgabe pro M Token) | Open Weights | Unabhängige Evaluation |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | Alibaba | 2,4T / 95 Mrd. | 1 Mio. | 2 $ / 6 $ | Noch nicht (zugesagt) | Keine |
| Kimi K3 | Moonshot AI | 2,8T / ca. 50 Mrd. | ca. 1,048 Mio. | 3 $ / 15 $ | Offen (27.7.) | AA Index ca. 57,11 |
| DeepSeek V4-Pro | DeepSeek | 1,6T / 49 Mrd. | 1 Mio. | Keine vollständige Tabelle | Offen | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | DeepSeek | Unverändert | 1 Mio. | Keine vollständige Tabelle | Offen | 9 Agent-/Code-Benchmarks über V4-Pro |
| Claude Opus 5 | Anthropic | Nicht veröffentlicht | 1 Mio. | 5 $ / 25 $ | Closed Source | Arena-Spitze |
| Claude Fable 5 | Anthropic | Nicht veröffentlicht | 1 Mio. | 10 $ / 50 $ | Closed Source | Arena Text Rang 1 |
Leicht übersehenes Detail: Kimi K3 und DeepSeek haben aktivierte Parameter früh veröffentlicht; Alibaba nannte „95 Milliarden" erst mit GA — mangelnde Preview-Transparenz war im Juli ein Kritikpunkt unabhängiger Institute. Im einzigen vergleichbaren Blindtest (Architekturaufgabe an 269 Dateien eines realen Projekts) erreichte Kimi K3 83 Punkte, Qwen3.8-Max Preview 80 — gleiches Segment, wechselnde Sieger.
„Weltweite Spitzenliga" und „überlegen gegenüber GPT-5.6 Sol und Fable 5" sind derzeit vor allem Alibabas eigene Narrative — erst Open Weights plus unabhängige Benchmarks werden das belastbar machen.
Wer Qwen3.8-Max in Claude Code, Qoder oder OpenClaw für lange Agent-Sessions einbindet, stößt auf Laptop oder instabilem Linux-VPS oft an RAM-Grenzen, Session-Abbrüche und fehlende Xcode-/Metal-Toolchains. Für Produktion mit stabiler SSH-Langsession, DerivedData-Cache und iOS-CI/CD-Automatisierung ist bei knappem lokalem Mac-Compute NodeMini Mac-Mini-Cloud-Miete die pragmatischere Option — dedizierter Node, Sekunden-Provisionierung, Agent und Build auf derselben echten Mac-Hardware. Details unter Mac-Mini-Mietpreise.
Quellen: Alibaba-Offizialblog und Pressemitteilungen, Arena.ai-Ranking (Snapshot 2026-08-01), unabhängige Analysen (Apidog, Yotta Labs, TechNode), Berichte zu Apple Intelligence China. Vor Deployment aktuelle Offizialmeldungen verifizieren.
Die API ist über QwenCloud verfügbar und unterstützt OpenAI- sowie Anthropic-Protokolle. Gewichte sind noch nicht veröffentlicht; die Website trägt zwar Open Source, Repository und Lizenz auf Hugging Face / ModelScope werden laut Ankündigung „nächste Woche" (ca. 10. August 2026) erwartet. Für die Agent-Umgebung siehe Mac-Mini-Mietpreise.
Keine autoritative Einheits-Benchmark. Der einzige unabhängige Blindtest zeigt sehr ähnliche Werte (Kimi K3: 83, Qwen Preview: 80) — gleiches Segment, wechselnde Stärken. Kimi K3 punktet mit bereits offenen Gewichten und Drittdaten; Qwen3.8-Max mit niedrigerem API-Preis und stärkerer Multimodalität.
Gesamt- und aktivierte Parameter unterscheiden. Es werden 95 Milliarden aktiviert; API-Kosten liegen auf Hundert-Milliarden-Niveau. Lokales Self-Hosting der Vollversion braucht Multi-Node-Rechenzentren — für die meisten Teams ist Qwen3.8-27B Open Weights die realistische Option.
Als Referenz ja, als endgültiges Urteil nein. Daten stammen aus Alibabas Eigenframework; neutrale Plattformen haben GA noch nicht reproduziert. Empfehlung: unabhängige Retests abwarten oder A/B im eigenen Business-Kontext.
Neben günstigeren Frontier-APIs basiert Apple Intelligence in China auf komprimierten Qwen-Modellen mit lokaler Ausführung — iPhone-Nutzer profitieren systemweit. Weitere Fragen: Hilfezentrum.