Wer Multi-Modell-Routing noch nach Monats-alten Benchmarks plant, übersieht das lauteste Signal aus den OpenRouter Rankings (Stand 25. Juli 2026): Xiaomi Mimo V2.5 führt mit 1,4 Billionen Tokens/Tag, chinesische Anbieter vereinen ~46 % (vor einem Jahr unter 2 %), US-Labs sind von ~70 % auf 30–36 % gefallen. Dieser datengetriebene Leitfaden liefert Top-12-Modelltabelle, Anbieteranteile, Nutzung ≠ Qualität, App-Layer mit Hermes Agent ~45 %, Preisvergleich, August-Prognose und eine Sechs-Schritte-Routing-Checkliste — inklusive DSGVO-relevanter Gates für Enterprise-Teams.
OpenRouter sortiert nach realem, bezahltem Token-Volumen — Wallet-Voting, nicht Hersteller-Marketing. Die Juli-Liste schwankt täglich (Mimo V2.5 änderte die Top-10-Reihenfolge bereits zwischen 24. und 25. Juli). Typische Fehlannahmen:
MMLU als Produktions-KPI: Benchmarks messen Obergrenzen; OpenRouter misst Rechnungsgewohnheiten. Günstige Flash-Linien dominieren Traffic — auch bei mittelmäßiger Komplexitäts-Inferenz.
Nutzung ≠ Qualität ignorieren: Volumenführer fehlen in „Klassifikation/komplexe Inferenz“ fast vollständig; Claude Sonnet 4.6 und Claude Opus 4.7 teilen sich je 13,5 % Verbrauchsanteil.
Nur Modell-, nicht App-Layer: openrouter.ai/apps zeigt Hermes Agent mit ~45 % App-Tokens; Rollenspiel-Apps halten einen großen Open-Source-Anteil — in Enterprise-Berichten unsichtbar.
Kurzfristiges #1 als Dauerführer: DeepSeek bleibt stabil (~16–18 % Anbieteranteil), aber Monats-Champions wechseln (MiniMax M2.5, MiMo-V2-Pro, Mimo V2.5).
35× Preisspanne übersehen: DeepSeek V4 Flash ~$0,05–0,14/M Input vs. GPT-5.5 ~$5/M — rationale Teams routen nach Kosten, nicht nach Prestige.
Sicherheit und DSGVO ausblenden: OpenAI-Sandbox-Escape-Berichte, US-Kongress „AI Kill Switch“ — in Agent-Szenarien steigen Anforderungen an Anbieter-Reputation, AVV und Datenresidenz.
„Capability und Popularity divergieren — wichtiger als der Platz-1-Titel ist eine belastbare Tier-Routing-Architektur.“
Datenstand 25. Juli 2026 (vor Go-Live openrouter.ai/rankings prüfen). Top 3: Mimo V2.5 (1,4T/Tag), DeepSeek V4 Flash (943,9B/Tag), Tencent Hy3 (590B/Tag). Sieben der Top 12 stammen aus China.
| Rang | Modell | Anbieter | Tokens/Tag | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot | 157,6B | 1,6T (neu) |
| 10 | Ling 3.0 Flash | Ant/InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
| Anbieter | Region | Token-Anteil (ca.) |
|---|---|---|
| DeepSeek | CN | 16–18 % (stabil #1) |
| Xiaomi | CN | 8–18 % (Mimo V2.5-Sprung, volatil) |
| Anthropic | US | 10–15 % |
| Tencent | CN | 8–13 % |
| US | 8–13 % | |
| Z.ai | CN | 4–7 % |
| OpenAI | US | 6–8 % |
CN-Anbieter gesamt ~46 %, US gesamt 30–36 % (vor einem Jahr ~70 %). Monatsvergleich: Juni-Analyse (61 %) — unterschiedliche Messfenster erklären die Abweichung.
Zitierfähige Kennzahlen: ① Mimo V2.5 1,4T/Tag (25.7.). ② DeepSeek 16–18 % Anbieteranteil. ③ CN/US-Umkehr ~40 Prozentpunkte in 12 Monaten.
Nach Ausgabenanteil (nicht Token-Menge) bei OpenRouter: Allgemeiner Dialog 35,7 %, Agent-Workflows 30,4 %, Code 26,5 %, Datenverarbeitung 7,5 %. In „Klassifikation/komplexe Inferenz“ gilt:
| Dimension | Volumen-Szenarien (günstige Open Weights) | Schwer-Szenarien (Closed Frontier) |
|---|---|---|
| Typische Tasks | Chat, Kreativschreiben, Rollenspiel, einfache Code-Hilfe | Komplexe Inferenz, Enterprise-Agent-Planung, hochkonsistente Klassifikation |
| Verbrauchsführer | Mimo V2.5, V4 Flash, Hy3 u. a. | Claude Sonnet 4.6 / Opus 4.7 je 13,5 %; GPT-5.5 11,6 % |
| Preislogik | Bis 35× günstiger, hohe Fehlertoleranz | Opus 5 bei $5/$25, FrontierBench v0.1 43,3 % |
Am 24. Juli veröffentlichte Anthropic Claude Opus 5: FrontierBench v0.1 43,3 % (GPT-5.6 Sol 37,5 %), Preis unverändert $5/$25. Details: Opus 5 & Kimi-K3-Kontroverse.
Architektur-Empfehlung: Closed Frontier für die schwierigsten 5–10 %, CN-Open-Weight für 90 %+ Masse-Traffic — kein binäres „wer ist stärker“.
Modell-Rankings zeigen beliebte „Gehirne“; der App-Layer zeigt, wofür sie genutzt werden:
| Rang | App | Typ | Anteil (ca.) |
|---|---|---|---|
| 1 | Hermes Agent | Persönlicher Agent / CLI | ~45 % |
| 2 | Kilo Code | Coding-Agent | ~13 % |
| 3 | OpenClaw | General Agent | ~9 % |
| 4 | Claude Code | Coding-Agent | ~6 % |
| 5 | Descript | Content-Produktion | ~4,5 % |
| 7–9 | Lemonade / ISEKAI ZERO / Janitor AI | Begleitung / Rollenspiel (neu) | je ~2 % |
| 10 | Cline | Coding-Agent (IDE) | ~1,7 % |
Cline → Roo Code → Kilo Code teilen eine Code-Linie; Kilo überholt inzwischen Cline. OpenRouter × a16z „State of AI“: Kreativ-Rollenspiel trägt über die Hälfte des Open-Source-Traffics — Enterprise-Medien berichten darüber kaum.
Ausblick August 2026 plus Preispositionierung (Anknüpfung an OpenRouter-Integrationsleitfaden):
| Modell | Input/M | Output/M | Positionierung |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Preis-Leistung, Agentic Coding |
| MiniMax M3 | $0,10 | $1,21 | Langkontext / Multimodal Budget |
| GLM 5.2 | $0,45 | $3,31 | Open Weight nahe Opus-Planung |
| Kimi K3 | ~$3 | ~$15 | 1,4TB Open Weights, Closed-Niveau |
| Claude Opus 5 | $5 (Fast $10) | $25 (Fast $50) | Closed Frontier, Juli-Benchmark-Spitze |
Indie-Entwickler: OpenRouter als Sandbox ist sinnvoll; Coding zuerst mit DeepSeek V4 Flash und GLM 5.2 testen, Opus 5 / GPT-5.6 nur für blockierte Schritte. Latenz aus DE ~180–250 ms — Produktion ggf. mit EU-konformem Relay.
Enterprise-Leads: Nicht nach Volumen-Rangliste einkaufen; Task-Tiers definieren und Anbieter-Sicherheitsrecord plus DSGVO in die Scorecard.
Wöchentlich openrouter.ai/rankings prüfen: Top 12 und Anbieteranteile protokollieren, Stichtag notieren.
Gateway-Regeln nach Szenario: Chat/Kreativ → V4 Flash / Mimo V2.5; komplexe Inferenz → Claude Opus 5; riskante Klassifikation → Sonnet 4.6 / Opus 4.7.
Token- vs. USD-Rechnung trennen: Viel Flash-Tokens + hohe Claude-USD = Tiering funktioniert — Routing-Tabelle explizit machen.
App-Layer mitdenken: Coding-Agenten (Kilo Code, Claude Code) vs. Rollenspiel — Modellwahl an Produktkontext binden.
Regression-Set für August: Neues Top-1-Modell innerhalb 48 h gegen festes Eval-Set — Config updaten, nicht die App neu schreiben.
Agent-Ausführung fixieren: Lange CLI-Sessions und sensible Prefills auf dedizierten SSH-Mac; OpenRouter nur für elastische Spitzen. Specs: Mietpreise.
Schlafende Laptops und billige Linux-VPS tragen 12h+ Agent-Loops schlecht; xcodebuild und notarytool brauchen macOS. Wer stabile SSH-Sessions, Keychain-Isolation und planbare Bandbreite für iOS CI/CD und Agent-Automation braucht, kombiniert OpenRouter-Gateway mit dediziertem Cloud-Mac statt reinem API-All-in. VPS-Workarounds leiden unter Latenz und fehlender Metal-Kette — für DSGVO-relevante Prefills und lange Agent-Läufe ist NodeMini Mac Mini Cloud-Miete die stabilere Basis: feste Knoten, EU-Standorte, Keys wechseln ohne CI-Umbau. Onboarding: Hilfezentrum.
Stand 25. Juli 2026: Xiaomi Mimo V2.5 (~1,4T/Tag), dann DeepSeek V4 Flash (943,9B/Tag) und Tencent Hy3 (590B/Tag). Tägliche Schwankungen — live prüfen: openrouter.ai/rankings.
Nein — unterschiedliche Fenster (7-Tage-Anbieter vs. Gesamt inkl. Free-Tier), App-Traffic und Messquellen. Entscheidend: <2 % → ~46 % in 12 Monaten. Vergleich: Juni-Analyse.
OpenRouter für Multi-Modell-Routing und Abrechnung; lange CLI-Agenten und lokale Prefills auf SSH-exklusivem Mac mit festen Monatskosten. Gateway: sensitivity: high → EU-Mac, nicht CN-API. Details: Hilfezentrum, Specs: Mietpreise.
① CN-Open-Source > 50 %? ② Günstigeres Anthropic-Tier? ③ Kimi-K3-Quantisierung. ④ US-AI-Sicherheitsgesetzgebung und Enterprise-Beschaffung.