人类偏好调用量加权
OpenRouter 实时数据 评测基准
OpenRouter 平台基于真实 API 调用量统计的模型热度排名,反映开发者实际使用偏好。
查看官方或原始资料评测方法与适用范围
OpenRouter 是统一的 LLM API 聚合平台,接入 300+ 模型。其排名基于平台内各模型的实际 API 调用次数、Token 消耗量与用户数,按日/周/月维度统计。
评测维度:
- 调用次数(Requests):模型被调用的总次数
- Token 消耗(Tokens):输入+输出 Token 总量
- 活跃用户(Users):调用该模型的独立用户数
- 价格加权:结合模型定价反映消费金额分布
特点:
- 反映开发者真实使用偏好,而非实验室评测
- 包含开源与闭源、大厂与创业公司的公平竞争
- 实时更新,能敏锐捕捉模型热度变化
- 受平台用户群体偏向影响(偏开发者)
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。