GPQA 评测基准
研究生水平问答基准,Google原版与Diamond子集,极高难度专家级问题。
查看官方或原始资料评测方法与适用范围
GPQA(Graduate-Level Google-Proof Q&A)是由纽约大学、康奈尔等机构联合提出的研究生水平问答基准,旨在评估模型在生物学、物理学、化学领域的高阶专业能力。
评测方式
4选1选择题,要求模型在极高难度领域问题上作答。题目经过领域专家精心设计,确保即使通过Google搜索也难以直接找到答案(即"Google-proof")。包含Main和Extended两个版本,以及经过更严格筛选的Diamond子集。
数据规模与来源
Main版本448题,Extended版本546题,Diamond子集198题。题目由领域专家(博士及以上)编写和验证,确保难度和准确性。
业界地位
GPQA是当前评估顶级大模型专家级知识的关键基准,被OpenAI、Anthropic、Google等用于衡量模型在科研级问题上的能力。GPQA Diamond子集尤其被视为区分顶级模型的"试金石",目前顶级模型在该子集上的准确率仍远低于人类专家水平。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。