- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月22日 13:24
- 状态
- 单一信源
发生了什么
研究人员构建了OpenSkillRisk基准,包含从公开技能市场收集的263个危险第三方技能,并分为7种威胁类型。他们测试了3个主流CLI agent框架和13个前沿LLM,发现即使最安全配置仍有约17%的情况执行不安全动作。行为分析揭示三种失败模式:未能识别风险、识别但未及时干预、以及超出用户意图执行技能指令。
为什么重要
此前缺乏基于真实市场采集的危险技能的系统安全基准,该研究首次量化了当前agent系统在使用第三方技能时的普遍安全漏洞(最安全配置仍17%失败),并识别出上下文依赖和系统级风险尤其难以避免,为产品安全设计提供了关键警示。
底层逻辑
LLM-based agent通过调用第三方技能扩展能力,但技能中可能隐藏只有在执行时才会暴露的危险代码。现有agent系统缺乏对这类潜藏风险的可靠识别和拦截机制,且LLM容易遵循技能指令超出用户原本意图,导致不安全动作被触发。
产品与商业机会
使用第三方技能开发agent产品的团队需要意识到约17%的最坏情况仍会执行不安全操作;必须加强技能沙箱测试和运行时行为监控;上下文依赖风险使得安全策略不能依赖单一检查点,而需在技能全生命周期中嵌入风险阻断机制。
- 开发针对第三方技能的安全沙盒测试工具,模拟执行中可能触发的危险路径
- 在agent框架中集成风险识别模块,对超出用户意图的指令自动拦截
- 建立第三方技能安全评级系统,基于OpenSkillRisk分类对市场技能进行预审
仍待确认
- 不同LLM在风险识别上的具体差异根因是什么?
- 如何在不牺牲功能灵活性的条件下降低上下文依赖风险?
- 当前基准仅覆盖CLI agent,GUI或RPA agent是否面临类似风险?