若你仍用几个月前的印象判断「哪个大模型最值得用」,OpenRouter 截至 2026 年 7 月 25 日的真实付费流量会彻底刷新认知:小米 Mimo V2.5 以单日 1.4 万亿 Token 登顶,中国厂商合计份额约 46%(一年前尚不足 2%),而美国三巨头已从约 70% 滑落到 30%–36%。本文面向做多模型路由的开发者与技术负责人,拆解Top 12 模型榜、厂商份额、用量≠质量、应用层 Agent 秘密、价格对照与 8 月趋势,并给出六步分层路由落地清单。
OpenRouter 排行榜按真实 Token 用量排序——本质是开发者真金白银在用什么,而不是哪个模型跑分最高。7 月榜单波动极快(Mimo V2.5 从 7/24 到 7/25 Top 10 顺序就有变化),若仍用旧框架选型,会持续踩坑:
把 MMLU 当生产指标:Benchmark 测上限,OpenRouter 测账单习惯。便宜又快的模型挂在高流量应用后,轻松刷到榜一——哪怕复杂推理表现平平。
忽视「用量≠质量」:总量榜霸屏的廉价开源模型,在「分类/复杂推理」消费维度几乎查无此模型;Claude Sonnet 4.6 与 Claude Opus 4.7 以各 13.5% 消费份额并列第一。
只看模型层、不看应用层:openrouter.ai/apps 显示 Hermes Agent 独占约 45% 应用 Token;角色扮演类应用合计占据开源流量可观比例,企业报道几乎看不到。
把瞬时 #1 当长期领先:DeepSeek 厂商份额最稳(约 16%–18%),但「月度冠军模型」从 MiniMax M2.5、MiMo-V2-Pro 到 Mimo V2.5 频繁易主——中国阵营内部竞争同样激烈。
忽略 35 倍价差:DeepSeek V4 Flash 输入约 $0.05–0.14/M,GPT-5.5 约 $5/M——当开源模型已「够用」,理性开发者自然用脚投票。
安全声誉未入评分卡:本周 OpenAI 未发布模型沙盒逃逸、美国国会「AI 终止开关法案」推进——企业 Agent 场景里「厂商安全记录」权重将明显上升。
「capability(能力)和 popularity(用量)正在分道扬镳——比起纠结谁是第一,更值得建立分层路由策略。」
数据截止 2026 年 7 月 25 日(发布前请核对 openrouter.ai/rankings 实时榜单)。前三名:小米 Mimo V2.5(1.4T/天)、DeepSeek V4 Flash(943.9B/天)、腾讯 Hy3(590B/天)。Top 12 中中国厂商模型占七席。
| 排名 | 模型 | 厂商 | 单日 Token | 近 30 天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
| 厂商 | 归属 | Token 份额(约) |
|---|---|---|
| DeepSeek | 中国 | 16%–18%(多数统计排第 1) |
| 小米 | 中国 | 8%–18%(Mimo V2.5 暴涨,波动最大) |
| Anthropic | 美国 | 10%–15% |
| 腾讯 | 中国 | 8%–13% |
| 美国 | 8%–13% | |
| 智谱 Z.ai | 中国 | 4%–7% |
| OpenAI | 美国 | 6%–8% |
中国厂商合计约 46%,美国厂商合计约 30%–36%(一年前约 70%)。可与 6 月 OpenRouter 排行榜分析 对照看月度变化。
可引用硬核数据:① Mimo V2.5 日量 1.4T,为 7/25 单品第一。② DeepSeek 厂商份额 16%–18%,为最稳定的第一。③ 中美份额一年内逆转约 40 个百分点量级。
OpenRouter 按任务类型统计的消费金额占比(而非 Token 量)呈现完全不同图景:通用对话 35.7%,Agent 工作流 30.4%,代码 26.5%,数据处理 7.5%。但专看「分类/复杂推理」:
| 维度 | 跑量场景(廉价开源主导) | 难任务场景(闭源旗舰主导) |
|---|---|---|
| 典型任务 | 闲聊、创意写作、角色扮演、简单编程辅助 | 复杂推理、企业 Agent 规划、强一致性分类 |
| 消费份额领先者 | Mimo V2.5、V4 Flash、Hy3 等 | Claude Sonnet 4.6 / Opus 4.7 各 13.5%;GPT-5.5 11.6% |
| 定价逻辑 | 价差可达 35 倍,吃海量可容错流量 | Opus 5 维持 $5/$25,FrontierBench v0.1 达 43.3% |
7 月 24 日 Anthropic 发布 Claude Opus 5:新基准 FrontierBench v0.1 拿下 43.3%(GPT-5.6 Sol 37.5%),价格维持 Opus 系列 $5/$25(Fable 5 输入价的一半)——「我贵,但我值这个价」。详见 Claude Opus 5 发布与 Kimi K3 争议。
选型提示:闭源旗舰处理最难 5%–10% 任务,中国开源模型处理剩余 90%+ 跑量——这是 7 月数据给出的最直接启示,而非非黑即白的「谁更强」。
模型榜反映「哪个大脑更受欢迎」;应用层排行榜反映「这些大脑真正被用来做什么」:
| 排名 | 应用 | 类型 | 份额(约) |
|---|---|---|---|
| 1 | Hermes Agent | 个人智能体 / CLI Agent | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 编程 Agent | ~6% |
| 5 | Descript | 内容生产 | ~4.5% |
| 7–9 | Lemonade / ISEKAI ZERO / Janitor AI | 陪伴 / 角色扮演(新进榜) | 各约 2% |
| 10 | Cline | 编程 Agent(IDE 插件) | ~1.7% |
Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 已反超祖辈 Cline。OpenRouter × a16z《State of AI》显示:创意角色扮演场景贡献了开源模型总用量的一半以上——若只读企业 AI 报道,你会完全看不到这半壁江山。
结合 7 月走势与行业动态,对 8 月做出以下判断,并附主流模型价格定位对照(可与 OpenRouter 接入教程 衔接实操):
| 模型 | 输入价/M | 输出价/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性价比之王,Agentic Coding 首选 |
| MiniMax M3 | $0.10 | $1.21 | 长上下文 / 多模态预算之选 |
| GLM 5.2 | $0.45 | $3.31 | 开源里接近 Opus 规划质量 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 开源权重,闭源级能力 |
| Claude Opus 5 | $5(快速档 $10) | $25(快速档 $50) | 闭源旗舰,7 月最强基准分 |
独立开发者:用 OpenRouter 做技术预研沙盒没问题;编程任务优先测 DeepSeek V4 Flash 与 GLM 5.2,把 Opus 5 / GPT-5.6 留给卡住的复杂步骤。注意国内访问延迟约 180–250ms,正式生产可评估国内合规中转。
企业技术负责人:不要只看用量榜做决策;按任务类型分层路由,并把「模型供应商安全记录」纳入选型评分卡。
固定每周核对 openrouter.ai/rankings:记录 Top 12 与厂商份额变动,标注数据截止日(榜单每日波动)。
按场景写入网关规则:闲聊/创意 → V4 Flash / Mimo V2.5;复杂推理 → Claude Opus 5;分类高风险 → Sonnet 4.6 / Opus 4.7。
拆分 Token 账单 vs 美元账单:若 Token 大头在 Flash 而美元大头在 Claude,说明已分层——显式固化路由表。
跟踪应用层而非只看模型层:编程 Agent(Kilo Code、Claude Code)与角色扮演流量结构差异极大,按产品场景选模型。
为 8 月新模型预留回归集:新 Top1 出现后 48 小时内跑同一套评测,更新路由而非重写应用。
固定 Agent 执行层:长会话 CLI Agent、敏感 prefill 迁到 SSH 独占节点;OpenRouter 只承担弹性峰值。规格见 租赁价格说明。
纯笔电睡眠或廉价 Linux VPS 难以承接 12 小时以上 Agent 循环,也无法运行 xcodebuild、notarytool 等 macOS 工具链。把「看周榜」与「固定执行环境」绑在一起,比每周追逐单一「最强模型」更可持续。
对需要稳定 SSH 长会话、Keychain 隔离与可预期带宽的 iOS CI/CD 与 AI Agent 自动化团队,在网关里写清 OpenRouter 多模型路由、把重负载放在可独占的云端 Mac 上,通常比把所有 Token 都押在公有 API 上更可控。NodeMini Mac Mini 云端租赁可作为 Agent 执行层:更换 API Key 或模型端点时,SSH 节点与 CI 标签可保持不变。接入流程见 帮助中心。
截至 2026 年 7 月 25 日,单日 Token 第一为小米 Mimo V2.5(约 1.4T/天),其次 DeepSeek V4 Flash(943.9B/天)与腾讯 Hy3(590B/天)。榜单每日变动,请以 openrouter.ai/rankings 实时数据为准。
不矛盾:不同统计口径(公司 7 天份额 vs 整体 Token 含免费/长尾模型)、统计窗口与是否含首方 App 流量会导致数字差异。本文厂商表为综合多方 7 天口径约数;关键是一年内从不足 2% 到约 46% 的陡峭迁移趋势。月度系列可对照 6 月分析。
① 中国开源合计份额能否突破 50%。② Anthropic 是否推出更平价型号抢用量。③ Kimi K3 社区量化版本落地。④ 美国 AI 安全立法与白宫预发布审查框架对企业选型的影响。