多模态选择题
MMBench 评测基准
多模态综合能力基准,覆盖20+能力维度,中英双语评测。
查看官方或原始资料评测方法与适用范围
MMBench是由上海人工智能实验室等机构联合提出的多模态综合能力基准,用于全面评估多模态大模型在各种视觉理解能力维度上的表现。
评测方式
给定图片和问题,要求模型从选项中选择正确答案。采用Circular Eval策略(循环评测),通过打乱选项顺序多次测试,确保模型真正理解而非依赖位置偏差。覆盖粗粒度和细粒度视觉理解、推理、知识应用等多个能力维度。
数据规模与来源
共约6,600道题,覆盖20+能力维度(如物体识别、属性识别、空间关系、逻辑推理、领域知识等),中英双语版本。题目经过人工筛选和验证,确保质量和多样性。
业界地位
MMBench是评估多模态大模型综合能力的重要基准,特别在中文多模态评测领域具有权威性。被Qwen-VL、InternVL、MiniCPM-V等国产多模态模型广泛采用,是衡量模型在多维度视觉理解能力上的关键参考。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。