- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年8月12日 00:00
- 状态
- 单一信源
发生了什么
InSight-doc 是一个面向长文档理解的智能体视觉感知框架,将视觉分辨率视为自适应推理资源,从低分辨率开始选择性放大到高分辨率区域,无需外部检索器。研究构建了含 17.9K SFT 示例和 19.2K 强化学习示例的语料,通过 SFT+RL 训练后,InSight-doc-8B 在文档 VQA 基准上提升 4.3-16.4 个准确率点,长文档幻觉减少超 40%,推理延迟降低 41%-68%,同时保持准确率优势。代码、数据集和模型已开源。
为什么重要
此前长文档视觉理解通常固定使用高分辨率,推理成本高且易受上下文损坏影响。InSight-doc 将分辨率作为动态推理资源,按需放大,无需外部检索器,既提升准确率又显著降低延迟和幻觉,为长文档多页推理提出了一种更高效、可靠的新范式。
底层逻辑
InSight-doc 基于智能体思想,模型在低分辨率下快速浏览全文档,判断哪些区域需要更细粒度证据,再决策性地放大局部区域,形成主动感知轨迹。训练数据包含区域级放大轨迹的 SFT 示例和强化学习困难样本,使模型学会自适应分配视觉计算资源,从而在不牺牲准确性的前提下降低推理开销并减少幻觉。
产品与商业机会
对长文档理解类产品(如文档问答、合同审查、研究报告分析),InSight-doc 可降低推理成本 41%-68%,同时减少超过 40% 的幻觉,提升可信度。由于模型和数据集开源,团队可直接基于 InSight-doc-8B 微调集成,加快产品落地。
- 集成 InSight-doc 到长文档问答产品,利用其低延迟特性提供实时交互式问答体验。
- 基于开源的 17.9K SFT 数据,针对金融、法律等垂直领域微调模型,提升领域文档理解准确性。
- 将自适应分辨率机制应用于移动端文档扫描应用,降低算力消耗并改善弱网环境下的响应速度。
- 结合其低幻觉特性,开发面向医疗、法律等高风险场景的辅助审阅工具,增强用户信任。
仍待确认
- InSight-doc 仅验证了 8B 参数量,更大模型(如 70B)下的效果和效率尚未公布。
- 论文中未提及训练所需的完整计算资源,影响了成本可复制性评估。
- 该框架对多语言长文档的泛化能力尚未见证据。