📖
排行榜
评测相关
一句话概括
按评测分数对模型排序的榜单,是选型和竞争的重要参考。
详细解析
排行榜(Leaderboard)是按特定评测指标对多个模型排序的榜单,是大模型生态的核心信息载体。它让用户快速比较不同模型的能力,也是厂商竞争的焦点。
排行榜按评测方式分为:自动基准排行榜(如Open LLM Leaderboard,基于MMLU等自动评分)、人类偏好排行榜(如Chatbot Arena,基于Elo评分)、综合排行榜(如Artificial Analysis,聚合多维度)。不同排行榜各有侧重,应结合参考。
使用排行榜需注意:评测数据是否污染、指标是否契合自身需求、模型版本是否最新、是否区分闭源/开源/微调。盲目追求榜首模型不一定最优,应结合价格、延迟、上下文等综合考量。