AIME 评测基准
美国数学邀请赛基准,极高难度竞赛题,评估顶级数学推理能力。
查看官方或原始资料评测方法与适用范围
AIME(American Invitational Mathematics Examination)基准基于美国数学邀请赛,用于评估大模型在极高难度竞赛数学问题上的能力,是当前最具挑战性的数学基准之一。
评测方式
给定AIME竞赛题,要求模型生成解题过程并给出0-999之间的整数答案。通过精确匹配评估正确性,常用准确率或平均答对题数(满分15题)指标。题目要求深度数学推理和创造性思维,远超普通数学基准。
数据规模与来源
AIME每年举办两次(AIME I和AIME II),每次15道题,难度递增。基准通常整合多年AIME真题(如2022-2025年),共数十至上百道题。题目覆盖代数、几何、数论、组合等竞赛数学核心领域。
业界地位
AIME是评估顶级推理模型数学能力的"硬核"基准,被OpenAI、Anthropic、DeepSeek等团队用于衡量模型在极限数学推理上的能力。顶级模型在AIME上的表现(如o1的83.3%、Claude Opus的80%)已成为衡量推理能力的重要里程碑,是当前区分顶级推理模型的关键指标之一。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。