中文能力综合评测
SuperCLUE 评测基准
中文通用大模型评测基准,多维度评估中文大模型综合能力。
查看官方或原始资料评测方法与适用范围
SuperCLUE是由中文通用大模型综合性测评基准(CLUE)团队推出的中文大模型评测基准,是当前中文大模型领域最具影响力的评测体系之一。
评测方式
采用开放式问答与客观题相结合的综合评测方式,包含基础能力、专业能力、中文特性能力三大维度。通过自动化评测与人工评测相结合,涵盖计算、逻辑、代码、文学、安全等多个子维度,并定期发布中文大模型排行榜。
数据规模与来源
包含数万道中文题目,覆盖计算、逻辑推理、代码生成、文学创作、知识问答、安全对齐等多个维度。题目结合中文语境和文化特色,部分题目来源于真实中文应用场景。
业界地位
SuperCLUE是中文大模型评测的标杆基准,被百度、阿里、字节、智谱、百川等国内头部厂商广泛认可和引用。其定期发布的中文大模型排行榜是衡量国产大模型能力的重要参考,特别适合评估模型在中文语境和文化场景下的表现,是中文大模型领域的"权威榜单"。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。