评测相关/术语条目
竞技场盲测
让用户在不知模型身份的情况下对比两个模型回答并投票的评测方式。
大白话:让用户在不知模型身份的情况下对比两个模型回答并投票的评测方式
换成大白话
竞技场盲测(Arena)是一种人类偏好评测方式,以LMSYS Chatbot Arena为代表。用户提交一个提示,两个匿名模型(如Model A和Model B)同时回答,用户在不知道模型身份的情况下投票选出更好的回答,系统据此更新Elo评分。 盲测的核心价值是消除品牌偏见——用户不会因"这是GPT-4"或"这是开源模型"而倾向性投票,纯粹基于回答质量评判。这使Arena成为公认最贴近真实使用体验的评测,其排行榜被广泛引用。 Arena的局限在于:用户样本偏技术人群、投票主观、长任务难盲测、可能被刷票。它也衍生出Hard Prompts、Coding、Vision等细分Arena,覆盖不同场景。Arena与自动基准互补,共同构成模型评测体系。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“竞技场盲测”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“竞技场盲测”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。