加载中...
跳到主要内容
星盘
|
大模型百科
XINGPANAI.COM
首页
内容总览
榜单
查榜单
榜单首页
查看全部榜单、更新时间与入口
模型榜单
从能力、热度和价格观察模型
厂商榜单
比较 AI 厂商的综合实力与发展表现
应用榜单
比较不同场景下的 AI 产品与应用
平台榜单
比较中转平台的价格、速度和稳定性
评测榜单
查看第三方基准与后续自测成绩
星盘百科
子栏目
查资料
百科总览
浏览栏目全部内容与入口
模型库
看能力、规格、开放状态与版本
厂商库
看公司定位、产品和模型关系
应用库
按场景找能直接用的 AI 应用
术语库
AI 名词与行业用语的通俗解释
即将上线
模型对比
选 2-5 个模型,横向对比规格与能力
高级搜索
按能力、模态、上下文等条件筛选模型
模型家族
看同一家族的各版本与发布时间线
资料出处
每条资料都能查到出处与核验时间
价格渠道
子栏目
价格总览
了解价格数据与比较方法
AI 套餐目录
浏览全部套餐与接入渠道
订阅工具
编程与对话订阅
生成服务
图片与视频方案
视频服务
视频生成订阅方案
API 与渠道
官方与聚合接入
AI 动态
子栏目
动态总览
预览行业变化与内容栏目
行业动态
模型发布、价格与榜单变化
AI 编年史
按时间回顾重要发布
教程与指南
从入门到模型选型
社区
查看全部
更多服务
工具帮助
AI 编年史
按时间回顾重要发布
教程与指南
从入门到模型选型
待审核
参与社区纠错验证
星盘商城
兑换星币和社区道具
任务中心
完成任务领取奖励
联系我们
反馈问题或合作咨询
登录 / 注册
交流群
加载中...
评测基准
先看它测什么,再看分数怎么来,最后判断它能不能代表你的实际任务。
搜索评测名称、测试能力或测评方法,例如 MMLU、HumanEval、GSM8K
评测领域
全部领域
人类偏好
综合能力
安全与对齐
多模态
中文能力
代码能力
数学能力
评测方法
全部方法
调用量加权
TrueSkill 贝叶斯评分
多基准加权融合
分类
选择题
问答
答案匹配
Bradley-Terry 配对评分
LLM裁判
综合评测
代码执行
测试通过率
竞赛排名
零样本推理
官方来源
全部来源
有官方来源
重置筛选
30
评测基准
7
评测领域
14
评测方法
评测目录
共 30 条结果
评
Artificial Analysis 智力分数
综合能力
Artificial Analysis 平台聚合 MMLU、HumanEval、MATH 等主流基准,加权计算的综合智力分数。
Artificial Analysis 平台聚合 MMLU、HumanEval、MATH 等主流基准,加权计算的综合智力分数。
多基准加权融合
官方来源
评
MMBench
多模态
多模态综合能力基准,覆盖20+能力维度,中英双语评测。
多模态综合能力基准,覆盖20+能力维度,中英双语评测。
选择题
官方来源
评
HumanEval
代码能力
Python函数编写基准,164个编程题,评估代码生成正确性。
Python函数编写基准,164个编程题,评估代码生成正确性。
代码执行
官方来源
评
OpenRouter 实时数据
人类偏好
OpenRouter 平台基于真实 API 调用量统计的模型热度排名,反映开发者实际使用偏好。
OpenRouter 平台基于真实 API 调用量统计的模型热度排名,反映开发者实际使用偏好。
调用量加权
官方来源
评
LLM-Stats TrueSkill
人类偏好
LLM-Stats 平台基于真实对话投票,采用 TrueSkill 算法计算的模型实力排名。
LLM-Stats 平台基于真实对话投票,采用 TrueSkill 算法计算的模型实力排名。
TrueSkill 贝叶斯评分
官方来源
评
ToxiGen
安全与对齐
毒性检测基准,评估模型识别和分类隐性有毒言论的能力。
毒性检测基准,评估模型识别和分类隐性有毒言论的能力。
分类
官方来源
评
MMMU
多模态
多学科多模态理解基准,覆盖30+学科,评估视觉+语言综合能力。
多学科多模态理解基准,覆盖30+学科,评估视觉+语言综合能力。
选择题
官方来源
评
MathVista
多模态
数学视觉推理基准,结合数学问题与视觉元素,评估多模态数学推理。
数学视觉推理基准,结合数学问题与视觉元素,评估多模态数学推理。
问答
官方来源
评
DocVQA
多模态
文档视觉问答基准,评估模型对文档图像的理解和问答能力。
文档视觉问答基准,评估模型对文档图像的理解和问答能力。
答案匹配
官方来源
评
Chatbot Arena
人类偏好
LMArena(原 Chatbot Arena)基于匿名模型对战中的真实用户偏好投票,使用 Bradley-Terry 配对评分、置信区间和排名区间形成公开榜单。
LMArena(原 Chatbot Arena)基于匿名模型对战中的真实用户偏好投票,使用 Bradley-Terry 配对评分、置信区间和排名区间形成公开榜单。
Bradley-Terry 配对评分
官方来源
评
Arena Hard
人类偏好
Chatbot Arena自动评测版,500道硬提示,LLM裁判评分。
Chatbot Arena自动评测版,500道硬提示,LLM裁判评分。
LLM裁判
官方来源
评
AlpacaEval
人类偏好
指令跟随评测基准,自动评估模型回答质量,与人类偏好高度对齐。
指令跟随评测基准,自动评估模型回答质量,与人类偏好高度对齐。
LLM裁判
官方来源
评
SuperCLUE
中文能力
中文通用大模型评测基准,多维度评估中文大模型综合能力。
中文通用大模型评测基准,多维度评估中文大模型综合能力。
综合评测
官方来源
评
C-Eval
中文能力
中文多学科考试基准,52个学科,评估中文大模型学科知识。
中文多学科考试基准,52个学科,评估中文大模型学科知识。
选择题
官方来源
评
CMMLU
中文能力
中文多任务理解基准,67个学科,评估中文语境下的知识理解。
中文多任务理解基准,67个学科,评估中文语境下的知识理解。
选择题
官方来源
评
TruthfulQA
安全与对齐
真实性评测基准,防幻觉,评估模型避免生成虚假信息的能力。
真实性评测基准,防幻觉,评估模型避免生成虚假信息的能力。
问答
官方来源
评
HLE (Humanity's Last Exam)
综合能力
人类最后的考试,超高难度专家级问答,由Scale AI和Center for AI Safety联合发布。
人类最后的考试,超高难度专家级问答,由Scale AI和Center for AI Safety联合发布。
问答
官方来源
评
ARC
综合能力
AI2推理挑战,小学科学推理题,区分易难两个子集。
AI2推理挑战,小学科学推理题,区分易难两个子集。
选择题
官方来源
评
HellaSwag
综合能力
常识推理基准,句子续写任务,挑战模型对日常场景的理解。
常识推理基准,句子续写任务,挑战模型对日常场景的理解。
选择题
官方来源
评
SWE-bench
代码能力
真实GitHub issue修复基准,评估模型解决实际软件工程问题的能力。
真实GitHub issue修复基准,评估模型解决实际软件工程问题的能力。
测试通过率
官方来源
再显示 10 条