OpenRouter 模型用量排行點睇?管理層不應只追第一名
IT 團隊最近最常遇到的問題,不是「公司可否用 AI」,而是「到底應該用邊個 AI model?」客服想要快,財務想控制成本,產品團隊想要穩定,管理層又想知道有沒有被單一供應商綁死。
OpenRouter 的模型用量排行,正好反映這個變化。它不是傳統實驗室 benchmark,而是一個 AI 模型閘道平台上,模型被實際路由和使用的訊號。OpenRouter 官方說明,其 AI Model Rankings 以 benchmarks 加上大量用戶透過 OpenRouter 使用模型的真實資料為基礎;Top Models 區域則展示 OpenRouter 內的 weekly usage。OpenRouter 亦提供 rankings-daily dataset API,列出每日前 50 個 public models 的 token 使用量,並把其他模型合併成 other。
但這裡有一個很重要的管理層提醒:用量排行不是品質排行,更不是採購答案。它是一個市場採用、成本偏好和生產流量的訊號。公司要做的,不是追每星期第一名,而是把這些訊號變成自己的模型選型、測試、路由和成本控制流程。
OpenRouter 排行榜到底量度甚麼?
OpenRouter 的 public ranking 頁面有幾個值得留意的維度,包括 Top Models、Top models by task、Market Share、Benchmarks、Fastest models、Languages、Programming、Context Length、Tool Calls、Images 和 Top Apps。
這代表 OpenRouter 不只是問「哪個模型最聰明」,而是把模型放在不同使用場景入面看。某個模型可能在總用量很高,但未必適合你公司的合約審閱;另一個模型在 coding、tool calls 或長 context 任務表現突出,卻未必是客服 FAQ 的最低成本選擇。
OpenRouter 的 daily rankings API 亦有一個重要細節:它回傳的是 prompt_tokens + completion_tokens 的每日總 token 使用量,而且官方提醒,不同供應商的 token 由各自 tokenizer 計算,所以不同模型之間的 token 不應被當作完全等值單位比較。
換句話說,這份數據適合回答:「開發者和應用現時把大量流量路由到哪裡?」但不適合單獨回答:「哪個模型一定最好?」
為何用量排行會與 benchmark 排行不同?
如果只看 benchmark,管理層很容易以為市場會自然集中到最高分模型。但 OpenRouter 這類平台提醒我們,生產環境的選擇通常更現實。
第一,成本會改變用量。大量客服分類、摘要、資料抽取和內部草稿,不一定需要最貴的 frontier model。若一個較便宜模型做到八成工作,又能把例外個案交給更強模型或人手處理,它的實際用量自然會上升。
第二,速度和供應穩定性會改變用量。OpenRouter 的 provider routing 文件顯示,平台可以按價格、throughput、latency 和供應商可用性路由請求,亦可在供應商故障、rate limit 或拒絕回應時使用 fallback model。對生產系統來說,能否穩定處理每天幾千個查詢,往往比一次測試拿高分更重要。
第三,使用場景會改變用量。編程工具、聊天產品、角色扮演應用、文件處理、客服摘要和企業內部搜尋,token 消耗模式完全不同。某個模型用量高,可能是因為它被大型 app 採用,也可能因為它適合長輸入、低成本或高頻任務。
第四,排行榜視窗會改變結果。2026 年 7 月多個第三方快照都引用 OpenRouter 用量數據,但不同快照日期和統計視窗下,Top models 的排序並不完全相同。這不是壞事,而是提醒管理層:OpenRouter ranking 是動態訊號,應該看趨勢和任務分佈,不應把某一天的排名當作長期採購標準。
香港企業應該怎樣用這份排行?
較實際的做法,是把 OpenRouter 模型用量排行當作「候選名單入口」,而不是最後答案。
例如一間香港零售公司想用 AI 處理 WhatsApp 查詢、產品資料問答和 CRM 摘要。IT 團隊可以先看 OpenRouter 上哪些模型在 general chat、tool calls、language 或 fast model 類別有足夠採用訊號,再選 3 至 5 個候選模型做內部測試。
測試不應只問幾條示範題,而要用真實匿名化個案:客戶用中英夾雜查詢、產品名稱有錯字、退款政策有例外、CRM 資料不完整、客戶語氣不滿。每個模型都用同一批測試資料,按準確度、回覆風格、升級判斷、成本和延遲評分。
最後才決定路由政策。例如:
流程 | 預設模型策略 | 升級條件
客服查詢分類 | 低成本、快回應模型 | 客戶投訴、退款、資料矛盾
CRM 摘要 | 成本穩定、長 context 較好的模型 | 大客戶、合約條款、敏感資料
銷售 proposal 草稿 | 較強的寫作/推理模型 | 價格承諾、法律條款、未確認需求
程式碼輔助 | coding 表現較佳模型 | 涉及付款、安全、資料庫 migration
管理層報表分析 | 推理較強、可引用資料來源的模型 | 數據不一致、異常結論、重大決策
這樣看,OpenRouter 排行榜的價值不是「話你知用邊個」,而是幫公司更快縮窄候選範圍。
