- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月4日 08:04
- 状态
- 单一信源
发生了什么
arXiv AI 发布论文 DocTrace,提出用于长文档视觉问答的可追踪证据图推理框架。该框架将 LongDocVQA 视为显式证据图推理问题,通过层级式证据定位、结构化文档解析和证据图推理实现证据溯源。采用两阶段训练:联合监督微调初始化能力,再以 GRPO 优化。在三个基准上比基线模型 Qwen3-VL-8B-Instruct 分别提升 14.4、11.3、11.7 个绝对点。
为什么重要
现有长文档视觉问答方法缺乏显式机制来表示和验证证据组合过程,导致准确性和可追踪性受限。DocTrace 将问题重构为证据图推理,显式构建带节点级溯源的证据图,不仅提升性能,还提供可追溯的推理路径,有助于提升复杂文档理解的可信度。
底层逻辑
DocTrace 采用层级框架,先进行证据定位,再解析文档结构,最后进行证据图推理,使模型逐步组合证据。训练上先通过联合监督微调初始化证据定位和图推理能力,再用任务特定的组相对策略优化(GRPO)配合专门奖励进一步优化,从而在推理中产生显式的、节点级溯源的证据图。
产品与商业机会
对构建文档问答产品的团队,此方法可提升多页文档回答的准确性和可解释性,减少对隐含推理的信赖。通过在训练中引入显式证据图,可增强对用户质疑的响应能力,但需投入算力进行两阶段训练,且推理时生成证据图可能增加延迟和成本。
- 面向企业知识库场景,开发基于证据图的文档问答功能,提升回答的可追溯性。
- 将 DocTrace 训练策略用于现有 MLLM 微调,以提升长文档理解准确率。
- 利用证据图输出,构建可视化推理链路,增强用户对 AI 回答的信任。
- 基于 DocTrace 的基准性能,可与现有 RAG 管道对比,优化混合检索策略。
仍待确认
- DocTrace 在中文长文档上的表现尚未有公开证据。
- 两阶段训练的计算成本未提及,难以评估资源需求。
- 证据图推理在超长文档中的延迟和可扩展性未说明。
- 该方法是否适用于多模态混合文档(如扫描件)未有明确证据。