- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月28日 09:12
- 状态
- 单一信源
发生了什么
论文揭示了一种新型架构后门攻击:恶意模型供应者可在视觉-语言模型供应链中,通过表示引导技术嵌入后门。该攻击无需污染训练数据、控制下游微调或修改部署时的提示,仅通过修改架构定义或计算图即可实现。当触发条件缺失时,后门退化为零,模型保持正常行为;触发时,内部表示被引导至攻击者预设目标。实验表明,该后门能破坏视觉问答、文本到图像生成、检索和语义响应等下游任务的完整性、安全执行和排名公平性。
为什么重要
此前模型供应链安全主要关注数据投毒或微调阶段的后门,该研究证明攻击者无需接触训练数据或控制微调,仅通过修改架构定义就能嵌入不影响正常功能但可被触发利用的后门,大幅改变了供应链安全威胁模型,迫使产业界重新审视对第三方模型组件的信任边界。
底层逻辑
攻击者利用VLM供应链中复用的预训练检查点、架构定义、文本编码器和计算图等制品,在模型架构中插入触发门控的加法修改。触发条件缺失时修改量为零,模型正常运算;触发条件出现时,一个预设的引导向量将中间表示移向攻击者目标。该机制不依赖数据中毒或提示操控,仅依赖于架构本身的可执行代码。
产品与商业机会
使用第三方VLM组件(如文本编码器、导出计算图)的产品可能继承该后门,导致视觉问答系统在特定条件下给出错误答案,图像生成模型输出违规内容,或检索排序出现偏向。企业需对供应链中的架构定义和计算图进行安全审计,并评估现有安全措施(如运行时监控)是否有效。
- 为使用第三方VLM组件的产品开发架构级安全审计工具,自动检测表示层异常修改。
- 设计供应链中模型制品的签名与验证机制,确保架构定义未被篡改。
- 在模型部署环节引入运行时表示行为监控,识别触发条件下的异常中间表示偏移。
仍待确认
- 该攻击在主流商业VLM产品(如OpenAI、Google的API)中是否可复现?
- 现有的后门检测方法(如基于输入扰动的测试)能否发现这种架构后门?
- 攻击者需要访问哪些供应链环节才能成功植入后门?实际工程成本有多高?
- 是否存在有效的防御机制(如架构蒸馏或表示随机化)可以抵御此类攻击?