综合能力选择题
HellaSwag 评测基准
常识推理基准,句子续写任务,挑战模型对日常场景的理解。
查看官方或原始资料评测方法与适用范围
HellaSwag是由Allen Institute for AI(AI2)提出的常识推理基准,用于评估模型对日常场景的理解和预测能力,是SWAG基准的高难度升级版。
评测方式
给定一个场景描述,要求模型从4个选项中选择最合理的续写。题目经过对抗性筛选,确保简单启发式方法无法正确作答,必须依赖真正的常识理解。
数据规模与来源
约10,000道题,来源于ActivityNet视频描述和WikiHow教程。通过Adversarial Filtering(AF)技术筛选,剔除可被简单模型答对的题目。
业界地位
HellaSwag是评估大模型常识推理能力的标杆基准,被广泛用于模型对比和能力评估。虽然顶级模型在HellaSwag上的准确率已接近95%,但它仍是衡量模型基础语言理解能力的重要指标,常与其他基准组合使用以全面评估模型能力。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。