- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月15日 19:55
- 状态
- 单一信源
发生了什么
SD-MAR是一个用于训练和评估视觉语言模型多图像分析推理的框架。它通过控制扰动构造成对视觉场景,生成语义变化归因和定量比较等推理任务,并使用GRPO-lite与BDA强化学习方法训练。在Qwen2.5-VL-7B和InternVL3-8B上,域内准确率提升高达36.95%,其中Qwen2.5-VL-7B在SD-MAR基准上超越GPT-4.1,且域外泛化性能保持或提升(MME、MMMU-Pro、MathVista波动在1%以内,MMBench提升最高4%)。
为什么重要
此前视觉语言模型虽具备感知能力,但在多图像比较、变化检测和多步视觉推理等需要分析推理的任务上表现有限。SD-MAR通过合成数据和专门设计的强化学习方法,显著提升了这类能力,甚至超越GPT-4.1,且不损害原有任务表现,为实际应用中的视觉对比分析提供了可行方案。
底层逻辑
SD-MAR通过一系列可控扰动(如位置、颜色、数量变化)生成成对视觉场景,并构造需要跨图像比较与推理的自然语言问答任务。训练阶段采用GRPO-lite(去除KL正则化以加强策略优化)和BDA(向后折扣分配,给予后期推理步骤更高信用)强化学习方法,使模型学会在多图像上下文中进行系统性的差异推理和结论生成。
产品与商业机会
可直接提升需要多图像对比分析的产品场景,如电商商品对比、视频帧变化检测、医疗影像前后对比、文档版比对等;模型在保持通用能力的同时具备更强分析推理能力,降低了集成专属推理模型的门槛;训练方法无需依赖人工标注,仅需合成数据,可降低数据获取成本。
- 开发基于多图像比较的自动质检系统,例如生产线前后状态差异检测
- 在电商平台实现智能商品对比分析,自动识别图片间的规格、颜色等变化
- 集成到医学影像系统中,辅助医生进行治疗前后的病灶变化识别
- 构建文档版本对比工具,快速定位修订内容并生成结构化报告
仍待确认
- SD-MAR合成数据的具体扰动类型和规模是否足以覆盖实际场景的多样性?
- GRPO-lite+BDA方法在更大参数量模型(如Qwen2.5-VL-72B)上的表现如何?
- 该框架是否易迁移到视频或时序序列的多帧推理任务?
- 训练和推理的计算成本是否适合端侧或实时应用部署?