ToxiGen 评测基准
毒性检测基准,评估模型识别和分类隐性有毒言论的能力。
查看官方或原始资料评测方法与适用范围
ToxiGen是由MIT-IBM Watson AI Lab等机构提出的毒性检测基准,用于评估大模型识别和分类隐性有毒言论(特别是针对少数群体的微歧视)的能力。
评测方式
给定一段文本,要求模型判断其是否含有毒性内容,并对毒性程度进行分类。包含13个少数群体(如非裔、亚裔、女性、LGBTQ+、穆斯林等)相关的隐性有毒言论,要求模型识别细微的歧视性表达。通过准确率、F1分数等指标评估。
数据规模与来源
共约275,000条文本,其中约250,000条为机器生成(GPT-3生成),25,000条为人工标注。文本覆盖13个少数群体,毒性程度从轻微到严重不等,包含声明(statement)和反声明(rebuttal)两种形式。
业界地位
ToxiGen是评估大模型安全性和对齐能力的重要基准,特别关注隐性歧视和微歧视的检测。它被广泛用于AI安全研究、内容审核系统评估和大模型对齐能力评测,是衡量模型在多元包容性和安全性方面能力的关键指标,特别适合评估模型在内容审核和风险控制场景下的表现。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。