多模态问答
MathVista 评测基准
数学视觉推理基准,结合数学问题与视觉元素,评估多模态数学推理。
查看官方或原始资料评测方法与适用范围
MathVista是由微软研究院等机构联合提出的数学视觉推理基准,用于评估多模态大模型在结合视觉元素进行数学推理方面的能力。
评测方式
给定包含数学内容的图片(如几何图形、函数图像、统计图表、表格等)和数学问题,要求模型结合视觉信息进行推理并给出答案。包含选择题、数值填空和开放式问答三种形式,通过准确率或精确匹配评估。
数据规模与来源
共6,141道题,来源于28个现有数学和视觉数据集,并新创建了3个数据集。覆盖几何、代数、统计、算术等数学领域,以及函数图像、几何图形、散点图、表格等多种视觉元素。
业界地位
MathVista是评估多模态大模型数学推理能力的标杆基准,填补了纯数学基准(如MATH、GSM8K)和纯视觉基准之间的空白。被GPT-4V、Gemini、Qwen-VL等多模态模型广泛采用,是衡量模型在视觉-数学交叉领域能力的关键指标。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。