Arena Hard 评测基准
Chatbot Arena自动评测版,500道硬提示,LLM裁判评分。
查看官方或原始资料评测方法与适用范围
Arena Hard是LMSYS Org基于Chatbot Arena数据推出的自动评测基准,旨在通过LLM裁判(LLM-as-a-Judge)自动评估大模型能力,降低人工评测成本。
评测方式
从Chatbot Arena中筛选500道高质量"硬提示"(用户区分度高的提示),使用GPT-4等强模型作为裁判,对比两个模型的回答并判定胜负。通过胜率(Win Rate)评估模型能力,可与Chatbot Arena人工排名高度对齐。
数据规模与来源
500道硬提示,从Chatbot Arena数十万真实用户提示中筛选得出。提示覆盖代码、推理、写作、数学等多个高难度任务类型,确保评测的区分度和挑战性。
业界地位
Arena Hard是评估大模型能力的自动化标杆,被广泛用于模型迭代和快速评测。其与Chatbot Arena人工排名的高相关性(约0.9+)使其成为衡量模型综合能力的可靠自动基准,被OpenAI、Anthropic、Google等头部厂商采用,是当前人类偏好自动评测的主流方案。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。