数学能力答案匹配
MATH 评测基准
高中竞赛数学基准,12,500道题,挑战高难度数学推理。
查看官方或原始资料评测方法与适用范围
MATH基准是由UC Berkeley、Stanford等机构联合提出的高中竞赛数学基准,用于评估大模型在复杂数学推理和竞赛级问题上的能力。
评测方式
给定一道高中竞赛数学题,要求模型生成详细解题过程并给出最终答案。通过精确匹配最终答案(包括数值和表达式)评估正确性。题目难度分为1-5级,覆盖代数、几何、数论、微积分、概率等多个数学领域。
数据规模与来源
共12,500道题,分为7,500道训练题和5,000道测试题。题目来源于AMC、AIME、HMMT等高中数学竞赛,每题配有详细的逐步解答过程和最终答案。
业界地位
MATH基准是评估大模型高阶数学推理能力的标杆,难度远超GSM8K。它是衡量模型在复杂数学推理、符号计算和竞赛级问题解决能力上的关键指标,被OpenAI、Anthropic、Google等头部厂商广泛采用。顶级推理模型(如o1、Claude Opus)在MATH上的表现已成为衡量推理能力的重要参考。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。