📖
基准测试
评测相关
一句话概括
标准化的评测任务集,用于量化模型在特定能力维度的表现。
详细解析
基准测试(Benchmark)是一组标准化的评测任务,用于客观、可重复地衡量模型在特定能力上的表现。每个benchmark包含数据集、评测指标和评分方法,如MMLU测综合知识、GSM8K测数学、HumanEval测代码、MATH测竞赛数学。
基准测试是大模型研发和选型的核心工具。厂商发布新模型时常报告一长串benchmark分数以展示能力。然而基准测试存在"刷榜"问题——模型可能在训练数据中见过测试集(数据污染),导致分数虚高。
为应对污染,社区推出动态基准(LiveBench)、私有基准、对抗性基准等。理想的基准应具备:任务代表性强、难以记忆、覆盖能力全面、评测自动化。基准测试的演进推动着模型能力边界的扩展。