评测相关/术语条目
基准测试
标准化的评测任务集,用于量化模型在特定能力维度的表现。
大白话:标准化的评测任务集,用于量化模型在特定能力维度的表现
换成大白话
基准测试(Benchmark)是一组标准化的评测任务,用于客观、可重复地衡量模型在特定能力上的表现。每个benchmark包含数据集、评测指标和评分方法,如MMLU测综合知识、GSM8K测数学、HumanEval测代码、MATH测竞赛数学。 基准测试是大模型研发和选型的核心工具。厂商发布新模型时常报告一长串benchmark分数以展示能力。然而基准测试存在"刷榜"问题——模型可能在训练数据中见过测试集(数据污染),导致分数虚高。 为应对污染,社区推出动态基准(LiveBench)、私有基准、对抗性基准等。理想的基准应具备:任务代表性强、难以记忆、覆盖能力全面、评测自动化。基准测试的演进推动着模型能力边界的扩展。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“基准测试”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“基准测试”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。