综合能力零样本推理
BBH (BIG-Bench Hard) 评测基准
BIG-Bench中23个最难的推理任务集合,挑战模型高阶推理能力。
查看官方或原始资料评测方法与适用范围
BBH(BIG-Bench Hard)是Google从更大的BIG-Bench基准中精选出的23个高难度任务集合,专门用于评估大模型在复杂推理方面的能力。
评测方式
采用少样本(few-shot)设置,通常使用3-shot CoT(思维链)提示,要求模型通过多步推理完成任务。任务类型涵盖逻辑推理、数学推理、符号操作、语言理解等多个维度。
数据规模与来源
23个任务,每个任务包含数百到数千个样本,总样本量约6,500+。任务来源于BIG-Bench的200多个任务中筛选出当时模型表现最差的部分。
业界地位
BBH是衡量大模型推理能力的经典基准,曾被用于证明CoT提示对大模型推理的显著提升。当GPT-3.5在BBH上首次超越人类平均表现时,标志着大模型推理能力的重大突破。BBH至今仍是评估模型推理能力的重要参考。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。