LMArena(Chatbot Arena) 评测基准
LMArena(原 Chatbot Arena)基于匿名模型对战中的真实用户偏好投票,使用 Bradley-Terry 配对评分、置信区间和排名区间形成公开榜单。
查看官方或原始资料评测方法与适用范围
LMArena(原 Chatbot Arena)由 UC Berkeley 研究人员发起,是面向真实使用场景的社区驱动 AI 模型评测平台。
评测方式
用户向两个匿名模型发送相同提示并选择更好的回答;只有模型身份揭示前提交的有效投票会进入官方排名。平台当前使用 Bradley-Terry 配对比较模型计算 Arena 分数,并报告置信区间、原始名次和排名区间。它与 Elo 思想相近,但不应再简单写成 Elo 排名。
数据与透明度
榜单随新的有效对战持续更新。LMArena 已公开 Arena-Rank 排名代码、部分人类偏好数据集和历史榜单数据,便于研究者复核方法与变化。
适用范围
榜单反映对应时间、模型版本、样本和任务分布中的人类偏好。不同模型的置信区间可能重叠,单一原始名次不代表统计上存在显著差异,也不能替代具体业务任务中的质量、速度、成本和安全测试。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。