- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 06:13
- 状态
- 单一信源
01
发生了什么
一篇论文研究了基于记忆的智能体系统中的提示注入风险,评估了Anthropic Claude Code和OpenAI Codex在四个模型上的表现。结果表明,让智能体用不可信外部内容覆盖自身记忆文件是困难的,但已植入记忆中的有效载荷可成功攻击当前和未来会话,且成功率和持久性因系统、模型和目标而异。该研究认为持久记忆改变了提示注入的威胁模型。
02
为什么重要
此前提示注入主要针对单次交互,本研究揭示持久记忆使攻击延伸至跨会话,过去被认为有效的仅防御外部输入的策略已不足,需要重新考虑记忆写入和读取的安全边界。
03
底层逻辑
智能体通过记忆文件存储行为偏好和知识以实现跨会话自适应,但攻击者若在用户允许写入的记忆中植入恶意指令,后续会话中智能体执行指令时会受污染,且难以通过外部内容覆盖已有记忆,形成持久威胁。
04
产品与商业机会
对于开发记忆增强型智能体产品的团队,需重新设计安全架构:既要保留自适应记忆功能,又要防止已污染记忆影响未来行为。这可能增加安全检测、用户授权机制和记忆清理功能的研发与运维成本。
机会分析尚未生成当前仅展示原文证据与规则信号,不用规则补写影响结论。
05
仍待确认
- 哪些类型的记忆内容(如偏好、知识库片段)更容易被植入和利用?
- 不同模型(如Claude Opus vs GPT-5.5)对记忆注入的抵抗力差异有多大?
- 是否存在有效的自动机制检测并清除已被污染的记忆而不影响正常自适应?
- 在真实产品中,用户无意间允许写入恶意指令的概率与影响范围如何?