综合能力选择题
MMLU 评测基准
大规模多任务语言理解基准,覆盖57个学科的多选题测试。
查看官方或原始资料评测方法与适用范围
MMLU(Massive Multitask Language Understanding)是由UC Berkeley、Stanford等机构联合提出的大规模语言理解基准,用于衡量大模型在零样本和少样本场景下的知识掌握程度。
评测方式
模型以4选1的方式作答,通过准确率衡量模型的知识广度。通常采用0-shot、5-shot等少样本设置,要求模型仅凭题干和选项作答,避免依赖外部检索。
数据规模与来源
共包含约15,958道题,覆盖STEM、人文、社科等57个学科,题目来源于各类教材、考试和专业题库。每个学科至少包含100道题,确保覆盖面。
业界地位
MMLU是当前最广泛使用的语言理解基准之一,几乎所有主流大模型(GPT-4、Claude、Gemini、Llama等)发布时都会报告MMLU成绩,是横向对比模型综合能力的"标配"指标。然而随着顶级模型得分接近90%,MMLU的区分度正在下降,催生了MMLU-Pro等更难的版本。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。