- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月14日 14:27
- 状态
- 单一信源
发生了什么
一项对Qwen2.5-VL和InternVL3系列视觉语言模型(VLM)的研究发现,链式思维(CoT)提示并不需要在整个推理过程中持续访问图像token。通过引入视觉访问扫描(Visual Access Sweep)因果干预方法,研究者定义了视觉访问边界(VAB),并指出CoT主要是在早期获取视觉隐藏状态信息后,在语言侧进行扩展计算,而非延长图像token的直接访问。CoT的收益受限于模型对视觉属性的感知读取可靠性。
为什么重要
此前普遍认为CoT通过持续访问图像来提升推理能力,而该研究表明CoT主要依赖早期视觉信息的语言端处理,这挑战了现有认知,可能改变VLM推理架构的设计方向。
底层逻辑
CoT提升性能的机制并非通过延长图像token的注意力访问,而是利用前向传播中已获得的图像衍生隐藏状态信息在语言计算中深化推理。感知读取可靠性决定了CoT是否有效:当模型能可靠读取视觉属性时CoT有帮助,否则无改进。
产品与商业机会
该发现提示产品研发中可减少CoT对图像token的重复访问,从而降低计算成本;同时需针对模型感知读取薄弱的属性(如复杂计数)设计辅助机制,否则CoT无法提升该场景效果。
- 开发仅需单次图像编码的CoT推理管线以节省计算资源
- 为感知读取不可靠的硬属性(如遮挡计数)构建属性文本预注入机制
仍待确认
- 视觉访问边界是否随模型规模或训练数据变化?
- CoT对语言端提取的隐藏状态信息是否存在信息损失?
- 该结论是否适用于多模态语言模型以外的其他VLM架构?