综合能力选择题
MMLU-Pro 评测基准
MMLU增强版,10选1更难更全面,覆盖14个学科领域。
查看官方或原始资料评测方法与适用范围
MMLU-Pro是MMLU的增强版本,由TIGER-Lab提出,旨在解决原版MMLU对顶级模型区分度不足的问题,提供更具挑战性的多任务理解评测。
评测方式
将选项从4个扩展到10个,显著降低随机猜测的概率(从25%降至10%),并允许使用思维链(Chain-of-Thought)推理。题目经过严格筛选,剔除了MMLU中存在歧义或过于简单的题目。
数据规模与来源
共12,032道题,覆盖14个学科领域(包括数学、物理、法律、心理学、工程等),题目来源整合了MMLU原题、STEM网站、TheoremQA和SciBench等多个高质量数据源。
业界地位
MMLU-Pro已成为衡量顶级大模型推理与知识深度的关键基准,被OpenAI、Anthropic、Google等头部厂商广泛采用。相比MMLU,它能更有效区分顶级模型之间的能力差异,是当前综合能力评测的"新标配"。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。