综合能力选择题
ARC 评测基准
AI2推理挑战,小学科学推理题,区分易难两个子集。
查看官方或原始资料评测方法与适用范围
ARC(AI2 Reasoning Challenge)是由Allen Institute for AI(AI2)提出的科学推理基准,旨在评估模型在小学科学领域的推理能力。
评测方式
4选1选择题,要求模型不仅具备知识,还需通过逻辑推理得出答案。基准分为Easy和Challenge两个子集,Challenge子集仅包含通过简单检索或单词关联无法回答的题目。
数据规模与来源
共7,787道题,其中Easy子集5,197题,Challenge子集2,590题。题目来源于美国小学科学考试题库,覆盖物理、生物、化学、地球科学等领域。
业界地位
ARC是早期评估大模型推理能力的经典基准之一,曾被广泛用于衡量模型超越"模式匹配"的真实推理能力。虽然顶级模型在ARC上已接近或超越人类水平,但ARC Challenge子集仍是评估模型推理能力的重要参考,尤其在模型对比和基准演进研究中具有重要价值。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。