- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月3日 19:44
- 状态
- 单一信源
发生了什么
研究发现,视觉语言模型(VLM)在少样本上下文学习(ICL)中,随着演示样本积累,部分模型会出现“上下文崩溃”,即准确率急剧下降,甚至低于随机水平。该现象在合成分类、自然图像分类和VQA基准上均有出现,涉及多个开源模型(0.5B–11B)和前沿模型Claude Sonnet 4.5。通过参数匹配消融实验,确认崩溃源于视觉-语言集成通路,而非后期读出层。提出的CircA方法通过单一合成任务训练,可将抗崩溃能力迁移至未见任务族。
为什么重要
此前普遍认为增加演示样本能提升ICL性能,但该研究揭示部分VLM会出现性能骤降,挑战了现有认知,可能影响依赖ICL的应用设计。
底层逻辑
上下文崩溃发生在视觉-语言集成界面,而非读出层。适配器在连接层和早期/中期层可恢复学习能力,而同等容量的后期读出层适配器无效。CircA通过一次性“疫苗”训练,在合成任务上获得抗崩溃能力,并迁移到其他任务族,说明该能力可独立于权重整合而存在。
产品与商业机会
对于使用VLM进行少样本图像分类或问答的产品,需警惕演示样本数量过多导致的性能下降,建议限制样本数或采用CircA式预训练增强稳定性。
- 开发检测工具,自动评估VLM在不同演示数量下的性能拐点,避免上下文崩溃。
- 在VLM推理服务中,动态调整演示样本数量,基于崩溃风险进行优化。
- 集成CircA思想,在模型连接层进行针对性微调,提升ICL鲁棒性。
仍待确认
- CircA的疫苗训练在不同模型规模和架构上的通用性如何?
- 上下文崩溃是否在更多未测试的VLM或任务类型上出现?
- 崩溃的严重程度是否与模型参数量或训练数据分布有关?