多模态选择题
MMMU 评测基准
多学科多模态理解基准,覆盖30+学科,评估视觉+语言综合能力。
查看官方或原始资料评测方法与适用范围
MMMU(Massive Multi-discipline Multimodal Understanding)是由卡内基梅隆大学(CMU)等机构联合提出的多模态理解基准,用于评估多模态大模型在跨学科视觉理解任务上的能力。
评测方式
给定图文混合题目(含图片、图表、示意图等),要求模型结合视觉信息和文本问题作答。包含选择题和开放式问答两种形式,通过准确率评估。题目要求模型具备图像理解、领域知识和推理能力的综合运用。
数据规模与来源
共11.5K道题,覆盖30个学科(艺术、商业、科学、健康、人文、技术等),每题配有1张或多张图片。题目来源于大学教材、考试和专业题库,确保学术严谨性。
业界地位
MMMU是评估多模态大模型综合能力的标杆基准,被OpenAI、Google、Anthropic等头部厂商广泛采用。它是衡量模型在跨学科、多模态场景下理解能力的关键指标,特别适合评估GPT-4V、Gemini、Claude等多模态模型的高级视觉理解能力。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。