评测相关/术语条目
排行榜
按评测分数对模型排序的榜单,是选型和竞争的重要参考。
大白话:按评测分数对模型排序的榜单,是选型和竞争的重要参考
换成大白话
排行榜(Leaderboard)是按特定评测指标对多个模型排序的榜单,是大模型生态的核心信息载体。它让用户快速比较不同模型的能力,也是厂商竞争的焦点。 排行榜按评测方式分为:自动基准排行榜(如Open LLM Leaderboard,基于MMLU等自动评分)、人类偏好排行榜(如Chatbot Arena,基于Elo评分)、综合排行榜(如Artificial Analysis,聚合多维度)。不同排行榜各有侧重,应结合参考。 使用排行榜需注意:评测数据是否污染、指标是否契合自身需求、模型版本是否最新、是否区分闭源/开源/微调。盲目追求榜首模型不一定最优,应结合价格、延迟、上下文等综合考量。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“排行榜”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“排行榜”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。