- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月6日 07:52
- 状态
- 单一信源
发生了什么
一篇arXiv论文系统研究了VLM控制机器人的物理提示注入攻击,将攻击分为四类,构建20个攻击提示基准,在三个物理场景及三种命令表述下,对GPT-4o、Gemini 2.5 Flash、Qwen3-VL-32B进行5670次试验,攻击成功率分别为27.0%、29.4%、5.0%。测试了三种简单防御,预处理的文本掩蔽达100%有效。
为什么重要
此前提示注入多针对纯文本或在线聊天机器人,而本研究表明物理世界的视觉文本也能劫持VLM控制的机器人,攻击面从数字扩展至物理环境,且对GPT-4o等前沿模型有效,说明VLM规划器的鲁棒性存在系统性弱点,对机器人安全有重要警示。
底层逻辑
VLM将视觉感知与指令执行紧密耦合,攻击者在机器人视野内放置对抗性文本,如指示牌,可被VLM当作指令,间接注入到推理栈中。防御机制多样:Gemini显式拒绝,GPT-4o感知疏忽,基于提示的防御效果依赖模型,文本掩蔽预处理可完全消除。成功攻击几乎都是有意识的。
产品与商业机会
依赖VLM规划的机器人产品面临物理环境中的安全风险,攻击者通过可见标识即可干扰分拣等任务,需在模型推理前加入文本检测与掩蔽环节,增加开发与部署成本,但可显著提升鲁棒性,降低生产事故隐患。
- 在机器人视觉pipeline中集成文本掩蔽预处理模块,拦截可疑文字,成本低且证据显示100%有效。
- 为VLM机器人增加两阶段验证机制,先规划后审核,可将攻击成功率降至近零。
- 开发针对视觉提示注入的自动化测试工具,可基于论文的基准框架构建安全评测集。
仍待确认
- 该研究仅覆盖分拣任务和三个场景,其他操控任务(如导航)是否同样脆弱未证实。
- 物理提示注入攻击在真实动态环境中(光照变化、遮挡)成功率是否与实验一致未确认。
- 文中的防御措施在实际部署中对性能的损耗尚未量化。