Si vous choisissez encore vos modèles selon des benchmarks vieux de plusieurs mois, le trafic payant réel d'OpenRouter (au 25 juillet 2026) change la donne : Xiaomi Mimo V2.5 mène avec 1,4 billion de tokens/jour, les fournisseurs chinois totalisent ~46 % (moins de 2 % il y a un an), et les labs américains sont passés de ~70 % à 30–36 %. Ce guide professionnel détaille le Top 12, les parts par fournisseur, usage ≠ qualité, la couche applicative (Hermes Agent ~45 %), un comparatif tarifaire, les perspectives d'août et une checklist en six étapes pour le routage multi-modèles.
Le classement OpenRouter reflète le volume de tokens réellement payé — le vote des portefeuilles, pas le marketing éditeur. La liste évolue vite (Mimo V2.5 a modifié le Top 10 entre le 24 et le 25 juillet). Erreurs fréquentes :
Confondre MMLU et production : Les benchmarks mesurent le plafond ; OpenRouter mesure les habitudes de facturation. Les modèles bon marché dominent le trafic même si l'inférence complexe est moyenne.
Ignorer usage ≠ qualité : Les leaders volume sont absents en « classification/inférence complexe » ; Claude Sonnet 4.6 et Claude Opus 4.7 partagent chacun 13,5 % des dépenses.
Ne regarder que la couche modèle : openrouter.ai/apps place Hermes Agent à ~45 % des tokens applicatifs ; le roleplay représente une part majeure de l'open source, invisible dans la presse enterprise.
Prendre le #1 instantané pour un leader durable : DeepSeek reste stable (~16–18 %), mais les champions mensuels tournent (MiniMax M2.5, MiMo-V2-Pro, Mimo V2.5).
Sous-estimer l'écart de prix (×35) : DeepSeek V4 Flash ~0,05–0,14 $/M vs GPT-5.5 ~5 $/M — les équipes rationnelles routent par coût.
Négliger sécurité et conformité : Évasion sandbox OpenAI, projet de loi « AI kill switch » au Congrès américain — la réputation fournisseur pèse davantage en production Agent.
« Capability et popularity divergent — mieux vaut une architecture de routage par paliers qu'une obsession du numéro un. »
Données au 25 juillet 2026 (vérifier openrouter.ai/rankings avant mise en production). Top 3 : Mimo V2.5 (1,4T/j), DeepSeek V4 Flash (943,9B/j), Tencent Hy3 (590B/j). Sept modèles sur douze sont chinois.
| Rang | Modèle | Fournisseur | Tokens/jour | Cumul 30 j |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (gratuit) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot | 157,6B | 1,6T (nouveau) |
| 10 | Ling 3.0 Flash | Ant/InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
| Fournisseur | Région | Part tokens (env.) |
|---|---|---|
| DeepSeek | CN | 16–18 % (stable #1) |
| Xiaomi | CN | 8–18 % (bond Mimo V2.5, volatile) |
| Anthropic | US | 10–15 % |
| Tencent | CN | 8–13 % |
| US | 8–13 % | |
| Z.ai | CN | 4–7 % |
| OpenAI | US | 6–8 % |
Total chinois ~46 %, total US 30–36 % (contre ~70 % il y a un an). Comparaison mensuelle : analyse de juin (61 %) — fenêtres de mesure différentes.
Chiffres citables : ① Mimo V2.5 1,4T/j (25.7.). ② DeepSeek 16–18 % de part. ③ Inversion CN/US ~40 points en 12 mois.
Par part de dépenses (pas volume tokens) sur OpenRouter : dialogue général 35,7 %, workflows Agent 30,4 %, code 26,5 %, traitement de données 7,5 %. En « classification/inférence complexe » :
| Dimension | Scénarios volume (open source abordable) | Scénarios difficiles (frontier fermé) |
|---|---|---|
| Tâches typiques | Chat, création, roleplay, aide code simple | Inférence complexe, planification Agent enterprise, classification stricte |
| Leaders dépenses | Mimo V2.5, V4 Flash, Hy3, etc. | Claude Sonnet 4.6 / Opus 4.7 à 13,5 % chacun ; GPT-5.5 11,6 % |
| Logique tarifaire | Jusqu'à ×35 moins cher, forte tolérance aux erreurs | Opus 5 à 5 $/25 $, FrontierBench v0.1 43,3 % |
Le 24 juillet, Anthropic a lancé Claude Opus 5 : FrontierBench v0.1 43,3 % (GPT-5.6 Sol 37,5 %), tarif inchangé 5 $/25 $. Voir Opus 5 et controverse Kimi K3.
Recommandation architecture : frontier fermé pour les 5–10 % les plus difficiles, open source chinois pour 90 %+ du trafic de masse — pas un duel binaire « qui est le plus fort ».
Le classement modèles montre les « cerveaux » populaires ; la couche apps montre leur usage réel :
| Rang | Application | Type | Part (env.) |
|---|---|---|---|
| 1 | Hermes Agent | Agent personnel / CLI | ~45 % |
| 2 | Kilo Code | Agent code | ~13 % |
| 3 | OpenClaw | Agent généraliste | ~9 % |
| 4 | Claude Code | Agent code | ~6 % |
| 5 | Descript | Production contenu | ~4,5 % |
| 7–9 | Lemonade / ISEKAI ZERO / Janitor AI | Compagnie / roleplay (nouveaux) | ~2 % chacun |
| 10 | Cline | Agent code (IDE) | ~1,7 % |
Cline → Roo Code → Kilo Code partagent une lignée ; Kilo dépasse désormais Cline. OpenRouter × a16z « State of AI » : le roleplay créatif représente plus de la moitié du trafic open source — absent des médias enterprise.
Scénarios août 2026 et positionnement tarifaire (suite logique du guide d'intégration OpenRouter) :
| Modèle | Input/M | Output/M | Positionnement |
|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 $ | ~0,24–0,28 $ | Rapport qualité-prix, coding agentique |
| MiniMax M3 | 0,10 $ | 1,21 $ | Long contexte / multimodal budget |
| GLM 5.2 | 0,45 $ | 3,31 $ | Open weight proche d'Opus en planification |
| Kimi K3 | ~3 $ | ~15 $ | 1,4 To open weights, niveau closed |
| Claude Opus 5 | 5 $ (fast 10 $) | 25 $ (fast 50 $) | Frontier fermé, sommet benchmarks juillet |
Développeurs indépendants : OpenRouter comme bac à sable ; tester DeepSeek V4 Flash et GLM 5.2 pour le code, réserver Opus 5 / GPT-5.6 aux étapes bloquées. Latence depuis l'UE ~180–250 ms — relais conforme en production si besoin.
Responsables techniques : ne pas acheter selon le classement volume ; définir des paliers par scénario et intégrer la réputation sécurité à la grille de sélection.
Consulter openrouter.ai/rankings chaque semaine : Top 12 et parts fournisseurs, date de référence notée.
Règles gateway par scénario : chat/créatif → V4 Flash / Mimo V2.5 ; inférence complexe → Claude Opus 5 ; classification sensible → Sonnet 4.6 / Opus 4.7.
Séparer facture tokens et facture USD : beaucoup de Flash + forte part Claude en dollars = tiering actif — formaliser la table de routage.
Suivre la couche apps : agents code (Kilo Code, Claude Code) vs roleplay — choisir le modèle selon le produit.
Jeu de régression pour août : nouveau Top 1 évalué sous 48 h sur le même bench — mettre à jour la config, pas l'application.
Fixer la couche d'exécution Agent : sessions CLI longues et prefill sensibles sur Mac SSH dédié ; OpenRouter pour les pics. Specs : tarifs location.
Un laptop endormi ou un VPS Linux bas de gamme peine sur des boucles Agent de 12 h+ ; xcodebuild et notarytool exigent macOS. Pour des sessions SSH stables, isolation Keychain et bande passante prévisible en CI/CD iOS et automation Agent, associer la gateway OpenRouter à un Mac cloud dédié est plus maîtrisable qu'une stack 100 % API publique. Les contournements VPS souffrent de latence et d'une chaîne Metal incomplète — pour la production, NodeMini location Mac Mini cloud offre des nœuds fixes et des coûts planifiés : changement de clé API sans refonte CI. Tarifs : tarifs location, onboarding : centre d'aide.
Au 25 juillet 2026 : Xiaomi Mimo V2.5 (~1,4T/j), puis DeepSeek V4 Flash (943,9B/j) et Tencent Hy3 (590B/j). Variations quotidiennes — données live : openrouter.ai/rankings.
Non — fenêtres différentes (7 j fournisseurs vs total incl. gratuit), trafic apps et sources. L'essentiel : <2 % → ~46 % en 12 mois. Voir analyse de juin.
OpenRouter pour le routage multi-modèles et la facturation ; agents CLI longue durée et prefill local sur Mac SSH exclusif à coût mensuel fixe. Configuration : centre d'aide, specs : tarifs location.
① Open source chinois > 50 % ? ② Offre Anthropic plus abordable ? ③ Quantification Kimi K3. ④ Législation sécurité IA US et achats enterprise.