DocVQA 评测基准
文档视觉问答基准,评估模型对文档图像的理解和问答能力。
查看官方或原始资料评测方法与适用范围
DocVQA(Document Visual Question Answering)是由NAVER Corp等机构提出的文档视觉问答基准,用于评估多模态大模型对文档图像的理解和问答能力。
评测方式
给定一张文档图像(如发票、表单、合同、论文等)和相关问题,要求模型从图像中提取信息并回答。通过ANLS(Average Normalized Levenshtein Similarity)指标评估答案相似度,衡量模型对文档内容的精确理解能力。
数据规模与来源
共50,000个问答对,来源于真实文档图像。问题覆盖文档中的各种信息,包括标题、日期、金额、签名、表格内容等。文档类型多样,包括发票、合同、表单、报告、学术论文等。
业界地位
DocVQA是评估多模态大模型文档理解能力的经典基准,被广泛应用于OCR、文档智能、多模态大模型等领域。它是衡量模型在真实文档场景下信息提取和理解能力的关键指标,特别适合评估GPT-4V、Gemini、Donut等模型在文档AI场景的能力。
如何解读结果
先确认模型版本、评测日期和提示设置是否一致;不同版本或不同工具链下的结果不能直接横向合并。
单项分数只反映该基准覆盖的能力。实际选型还应结合真实任务、稳定性、速度、价格和安全要求。
星盘保留原始来源入口,并将基准说明与实时排行榜分开呈现,避免把单次榜单快照解释为模型的绝对能力。
这项评测不能替代什么
这项基准只测量它明确覆盖的那一类任务。分数不能代表一个模型在真实业务中的综合表现、响应速度、稳定性、价格或安全性。
不能因为一个模型在某个单项基准上领先,就认为它在所有任务上都更好;不同任务背后的数据难度、提示设计和评分口径并不相同。
不要用某一时刻的榜单快照替代持续观察。模型版本、评测工具链和题目集都可能变化,跨版本或跨基准的比较需要单独核对。