TruthfulQA 评测基准
真实性评测基准,防幻觉,评估模型避免生成虚假信息的能力。
查看官方或原始资料评测方法与适用范围
TruthfulQA是由Indiana University等机构提出的真实性评测基准,用于评估大模型在回答问题时避免生成虚假或误导性信息的能力,是衡量模型"幻觉"问题的重要基准。
评测方式
给定817个问题(涵盖健康、法律、金融、政治、阴谋论等容易产生误解的领域),要求模型回答。通过人工标注的"真实"和"信息量"两个维度评估,常用指标包括真实率(truthful rate)和真实信息量(truthfulinformative)综合分。支持人工评测和GPT-judge自动评测两种方式。
数据规模与来源
共817个问题,每个问题配有正确答案和常见错误答案。题目来源于Reddit、Quora等平台上的常见误解,确保问题具有代表性和挑战性。问题分类覆盖14个领域,包括常见误解、主观问题、危险行为等。
业界地位
TruthfulQA是评估大模型真实性和防幻觉能力的经典基准,被OpenAI、Anthropic、Google等头部厂商广泛采用。它是衡量模型是否会产生虚假信息、是否敢于承认不知道的关键指标,特别适合评估模型在敏感话题和高风险场景下的可靠性,是当前AI安全和可信度评测的重要参考。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。