若你仍用幾個月前的印象判斷「哪個大模型最值得用」,OpenRouter 截至 2026 年 7 月 25 日的真實付费流量會徹底刷新認知:小米 Mimo V2.5 以單日 1.4 萬億 Token 登頂,中國廠商合計份額約 46%(一年前尚不足 2%),而美國三巨頭已從約 70% 滑落到 30%–36%。本文面向做多模型路由的開發者與技術負責人,拆解Top 12 模型榜、廠商份額、用量≠品質、應用層 Agent 秘密、價格對照與 8 月趨勢,並給出六步分層路由落地清單。
OpenRouter 排行榜按真實 Token 用量排序——本質是開發者真金白銀在用什麼,而不是哪個模型跑分最高。7 月榜單波動極快(Mimo V2.5 從 7/24 到 7/25 Top 10 順序就有變化),若仍用舊框架選型,會持續踩坑:
把 MMLU 當生產指標:Benchmark 測上限,OpenRouter 測帳單習慣。便宜又快的模型掛在高流量應用後,輕鬆刷到榜一——哪怕複雜推理表現平平。
忽視「用量≠品質」:總量榜霸屏的廉價開源模型,在「分類/複雜推理」消費維度幾乎查無此模型;Claude Sonnet 4.6 與 Claude Opus 4.7 以各 13.5% 消费份額並列第一。
只看模型層、不看應用層:openrouter.ai/apps 顯示 Hermes Agent 獨占約 45% 應用 Token;角色扮演類應用合計佔據開源流量可觀比例,企業報導幾乎看不到。
把瞬時 #1 當長期領先:DeepSeek 廠商份額最穩(約 16%–18%),但「月度冠軍模型」從 MiniMax M2.5、MiMo-V2-Pro 到 Mimo V2.5 頻繁易主——中國陣營內部競爭同樣激烈。
忽略 35 倍價差:DeepSeek V4 Flash 輸入約 $0.05–0.14/M,GPT-5.5 約 $5/M——當開源模型已「夠用」,理性開發者自然用腳投票。
安全聲譽未入評分卡:本週 OpenAI 未發布模型沙盒逃逸、美國國會「AI 終止開關法案」推進——企業 Agent 場景裡「廠商安全紀錄」權重將明顯上升。
「capability(能力)和 popularity(用量)正在分道揚鑣——比起糾結誰是第一,更值得建立分層路由策略。」
資料截止 2026 年 7 月 25 日(發布前請核對 openrouter.ai/rankings 即時榜單)。前三名:小米 Mimo V2.5(1.4T/天)、DeepSeek V4 Flash(943.9B/天)、騰訊 Hy3(590B/天)。Top 12 中中國廠商模型占七席。
| 排名 | 模型 | 廠商 | 單日 Token | 近 30 天累計 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 騰訊 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免費) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智譜 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 階躍星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 螞蟻 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
| 廠商 | 歸屬 | Token 份額(約) |
|---|---|---|
| DeepSeek | 中國 | 16%–18%(多數統計排第 1) |
| 小米 | 中國 | 8%–18%(Mimo V2.5 暴漲,波動最大) |
| Anthropic | 美國 | 10%–15% |
| 騰訊 | 中國 | 8%–13% |
| 美國 | 8%–13% | |
| 智譜 Z.ai | 中國 | 4%–7% |
| OpenAI | 美國 | 6%–8% |
中國廠商合計約 46%,美國廠商合計約 30%–36%(一年前約 70%)。可與 6 月 OpenRouter 排行榜分析 對照看月度變化。
可引用硬核資料:① Mimo V2.5 日量 1.4T,為 7/25 單品第一。② DeepSeek 廠商份額 16%–18%,為最穩定的第一。③ 中美份額一年內逆轉約 40 個百分點量級。
OpenRouter 按任務類型統計的消費金額占比(而非 Token 量)呈現完全不同圖景:通用對話 35.7%,Agent 工作流 30.4%,程式碼 26.5%,資料處理 7.5%。但專看「分類/複雜推理」:
| 維度 | 跑量場景(廉價開源主導) | 難任務場景(閉源旗艦主導) |
|---|---|---|
| 典型任務 | 閒聊、創意寫作、角色扮演、簡單程式輔助 | 複雜推理、企業 Agent 規劃、強一致性分類 |
| 消費份額領先者 | Mimo V2.5、V4 Flash、Hy3 等 | Claude Sonnet 4.6 / Opus 4.7 各 13.5%;GPT-5.5 11.6% |
| 定價邏輯 | 價差可達 35 倍,吃海量可容錯流量 | Opus 5 維持 $5/$25,FrontierBench v0.1 達 43.3% |
7 月 24 日 Anthropic 發布 Claude Opus 5:新基準 FrontierBench v0.1 拿下 43.3%(GPT-5.6 Sol 37.5%),價格維持 Opus 系列 $5/$25(Fable 5 輸入價的一半)——「我貴,但我值這個價」。詳見 Claude Opus 5 發布與 Kimi K3 爭議。
選型提示:閉源旗艦處理最難 5%–10% 任務,中國開源模型處理剩餘 90%+ 跑量——這是 7 月資料給出的最直接啟示,而非非黑即白的「誰更強」。
模型榜反映「哪個大腦更受歡迎」;應用層排行榜反映「這些大腦真正被用來做什麼」:
| 排名 | 應用 | 類型 | 份額(約) |
|---|---|---|---|
| 1 | Hermes Agent | 個人智能體 / CLI Agent | ~45% |
| 2 | Kilo Code | 程式 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 程式 Agent | ~6% |
| 5 | Descript | 內容生產 | ~4.5% |
| 7–9 | Lemonade / ISEKAI ZERO / Janitor AI | 陪伴 / 角色扮演(新進榜) | 各約 2% |
| 10 | Cline | 程式 Agent(IDE 外掛) | ~1.7% |
Cline → Roo Code → Kilo Code 是同一代碼血統的三次分叉,「孫子輩」Kilo Code 已反超祖輩 Cline。OpenRouter × a16z《State of AI》顯示:創意角色扮演場景貢獻了開源模型總用量的一半以上——若只讀企業 AI 報導,你會完全看不到這半壁江山。
結合 7 月走勢與產業動態,對 8 月做出以下判斷,並附主流模型價格定位對照(可與 OpenRouter 接入教學 銜接實操):
| 模型 | 輸入價/M | 輸出價/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性價比之王,Agentic Coding 首選 |
| MiniMax M3 | $0.10 | $1.21 | 長上下文 / 多模態預算之選 |
| GLM 5.2 | $0.45 | $3.31 | 開源裡接近 Opus 規劃品質 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 開源權重,閉源級能力 |
| Claude Opus 5 | $5(快速檔 $10) | $25(快速檔 $50) | 閉源旗艦,7 月最強基準分 |
獨立開發者:用 OpenRouter 做技術預研沙盒沒問題;程式任務優先測 DeepSeek V4 Flash 與 GLM 5.2,把 Opus 5 / GPT-5.6 留給卡住的複雜步驟。注意國內存取延遲約 180–250ms,正式生產可評估國內合規中轉。
企業技術負責人:不要只看用量榜做決策;按任務類型分層路由,并把「模型供應商安全紀錄」納入選型評分卡。
固定每週核對 openrouter.ai/rankings:記錄 Top 12 與廠商份額變動,標註資料截止日(榜單每日波動)。
按場景寫入閘道規則:閒聊/創意 → V4 Flash / Mimo V2.5;複雜推理 → Claude Opus 5;分類高風險 → Sonnet 4.6 / Opus 4.7。
拆分 Token 帳單 vs 美元帳單:若 Token 大頭在 Flash 而美元大頭在 Claude,說明已分層——顯式固化路由表。
追蹤應用層而非只看模型層:程式 Agent(Kilo Code、Claude Code)與角色扮演流量結構差異極大,按產品場景選模型。
為 8 月新模型預留回歸集:新 Top1 出現後 48 小時內跑同一套評測,更新路由而非重寫應用。
固定 Agent 執行層:長會話 CLI Agent、敏感 prefill 遷到 SSH 獨占節點;OpenRouter 只承擔彈性峰值。規格見 租賃價格說明。
純筆電睡眠或廉價 Linux VPS 難以承接 12 小時以上 Agent 迴圈,也無法執行 xcodebuild、notarytool 等 macOS 工具鏈。把「看週榜」與「固定執行環境」綁在一起,比每週追逐單一「最強模型」更可持續。
對需要穩定 SSH 長會話、Keychain 隔離與可預期頻寬的 iOS CI/CD 與 AI Agent 自動化團隊,在閘道裡寫清 OpenRouter 多模型路由、把重負載放在可獨占的雲端 Mac 上,通常比把所有 Token 都押在公有 API 上更可控。NodeMini Mac Mini 雲端租賃可作為 Agent 執行層:更換 API Key 或模型端點時,SSH 節點與 CI 標籤可保持不變。接入流程見 說明中心。
截至 2026 年 7 月 25 日,單日 Token 第一為小米 Mimo V2.5(約 1.4T/天),其次 DeepSeek V4 Flash(943.9B/天)與騰訊 Hy3(590B/天)。榜單每日變動,請以 openrouter.ai/rankings 即時資料為準。
不矛盾:不同統計口徑(公司 7 天份額 vs 整體 Token 含免費/長尾模型)、統計窗口與是否含首方 App 流量會導致數字差異。本文廠商表為綜合多方 7 天口徑約數;關鍵是一年內從不足 2% 到約 46% 的陡峭遷移趨勢。月度系列可對照 6 月分析。
① 中國開源合計份額能否突破 50%。② Anthropic 是否推出更平價型號搶用量。③ Kimi K3 社群量化版本落地。④ 美國 AI 安全立法與白宮預發布審查框架對企業選型的影響。