CMMLU 评测基准
中文多任务理解基准,67个学科,评估中文语境下的知识理解。
查看官方或原始资料评测方法与适用范围
CMMLU(Chinese Massive Multitask Language Understanding)是由上海交通大学、清华大学等机构联合提出的中文多任务理解基准,是MMLU的中文版本,用于评估大模型在中文语境下的多任务理解能力。
评测方式
采用4选1选择题形式,覆盖67个学科。提供zero-shot和5-shot两种评测设置,通过准确率评估模型能力。题目设计充分考虑中文语境和文化特色,部分题目从英文MMLU翻译而来,部分为原创中文题目。
数据规模与来源
共11,528道题,覆盖67个学科(包括中国特有学科如中国地理、中国传统医学等),来源于各类中文教材、考试和专业题库。每题配有标准答案和学科分类。
业界地位
CMMLU是评估中文大模型知识理解能力的重要基准,与C-Eval并列为中文大模型评测的"双雄"。它特别适合评估模型在中文语境和文化场景下的知识掌握程度,被Qwen、ChatGLM、Baichuan、Yi等国产大模型广泛采用,是衡量模型中文能力的关键指标之一。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。