人类偏好TrueSkill 贝叶斯评分
LLM-Stats TrueSkill 评测基准
LLM-Stats 平台基于真实对话投票,采用 TrueSkill 算法计算的模型实力排名。
查看官方或原始资料评测方法与适用范围
LLM-Stats 是独立的 LLM 评测平台,收集用户在盲测对话中的投票数据,采用微软 TrueSkill 贝叶斯评分系统计算每个模型的实力值与置信区间。
评测维度:
- TrueSkill 评分(μ):模型实力均值
- 置信度(σ):评分不确定性,越低越可靠
- 对战次数:模型参与的总对决数
- 胜率分布:对阵各模型的胜率矩阵
特点:
- TrueSkill 算法源自 Xbox Live 等级系统,能处理不完全信息
- 考虑对战对手强度,比简单胜率更公平
- 提供分维度排名(写作、推理、编程等)
- 样本量较 Arena 小,置信区间较宽
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。