- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月15日 14:01
- 状态
- 单一信源
发生了什么
SPyCE 是一个面向多模态智能体的训练框架,核心是将轨迹蒸馏为分层技能库(执行技能与工作流技能),并在强化学习过程中与策略共同进化。策略根据检索到的技能生成 rollout,技能库则从高价值 rollout 中更新,形成闭环。在八个基准测试上,SPyCE 一致优于基于强化学习和记忆的基线方法。
为什么重要
相比此前方法——要么将轨迹简化为标量奖励迫使策略每次从头学习工具模式,要么依赖测试时检索而无法更新策略——SPyCE 首次让技能库与策略在训练中相互促进,使可复用的工具使用模式被主动吸收,极大提升多模态推理任务的效率和泛化能力。
底层逻辑
SPyCE 将多模态推理轨迹分层蒸馏:执行技能捕捉局部视觉操作(如点击、拖动),工作流技能编码高层先验(如工具调用顺序)。训练时,策略模型以检索到的技能为条件进行 rollout;技能库则从策略产生的高质量 rollout 中持续更新。这种双向进化使得技能库随策略增强而优化,进而为后续 rollout 提供更强先验。
产品与商业机会
直接影响是:多模态 Agent 产品的训练流程将从“每新任务从头学”变为“技能库积累复用”,显著降低研发成本;同时,在需要多步工具调用的视觉交互场景(如数据分析、界面操作)中,可减少错误率和提升成功率,改善用户体验。
- 构建可复用的多模态技能库平台,供不同 Agent 产品共享和扩展执行技能与工作流技能
- 开发基于 SPyCE 的低代码工具,允许非技术用户通过示范轨迹自动构建定制化技能库
- 将 SPyCE 集成到现有智能助手(如桌面自动化系统)中,实现工具使用模式的高效迁移
- 推出面向企业客户的“技能库即服务”,按场景(如财报分析、CRM 操作)预训练并持续更新技能库
仍待确认
- 技能库的容量和更新频率如何影响收敛速度与最终性能?
- 在不同模态(如音频、触觉)下,SPyCE 的分层技能设计是否仍有效?
- 技能库的跨任务迁移是否存在负迁移风险,如何检测与缓解?
- SPyCE 依赖的检索机制在实际延迟敏感场景中能否满足实时性要求?