综合能力问答
HLE (Humanity's Last Exam) 评测基准
人类最后的考试,超高难度专家级问答,由Scale AI和Center for AI Safety联合发布。
查看官方或原始资料评测方法与适用范围
HLE(Humanity's Last Exam)是由Scale AI和Center for AI Safety联合发起的超高难度专家级问答基准,旨在为顶级AI模型提供极具挑战性的知识边界测试。
评测方式
开放式问答(部分含图片),要求模型给出精确答案,通过精确匹配或专家评分判定。题目覆盖数学、物理、人文、艺术等几乎所有学科,难度远超MMLU、GPQA等基准。
数据规模与来源
约3,000道题,由全球500+领域专家(包括博士、教授、行业专家)精心编写和验证,确保题目新颖、难度极高且答案唯一。
业界地位
HLE被誉为"人类最后的考试",是当前难度最高的AI知识基准之一。顶级模型在HLE上的准确率通常在10%-30%之间,远低于在其他基准上的表现,使其成为衡量模型知识边界和推理深度的重要参考。该基准的发布标志着AI评测向专家级、超难方向演进。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。