- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年7月28日 00:00
- 状态
- 单一信源
发生了什么
该论文通过构建统一可控的多轮环境,系统研究了基础模型agent的多轮长程规划能力。预训练阶段发现:显式世界模型(通过CoT状态转换建模)增强长程泛化;少量长程数据即可实现组合泛化,但次优轨迹因误差累积严重损害性能。后期训练中,通过互信息区分通用规划模式与任务知识;单教师蒸馏(OPD)在低质量和长程设置下比GRPO更有效,而多教师蒸馏(MOPD)可整合多种能力,但教师知识差异可能损害学生世界模型。
为什么重要
此前对模型规划能力的获取机制不清晰,依赖不可控的互联网数据。该研究通过可控实验揭示了预训练数据格式、质量和后期训练方法对长程规划的具体影响,为训练更可靠的多轮agent提供了可解释的指导。
底层逻辑
通过互信息分离通用规划模式与任务特定知识;发现OPD通过提供更一致的更新方向,在低质量、长程场景下比GRPO更有效;多教师蒸馏(MOPD)可整合不同教师知识,但知识冲突可能破坏学生已有的世界模型。
产品与商业机会
- 采用OPD方法训练长程任务agent,特别是在数据质量较低或任务步骤较多的场景下
- 利用MOPD多教师蒸馏技术,从多个专业知识领域蒸馏规划能力,构建复合型agent
仍待确认
- 多教师蒸馏中的知识冲突如何有效缓解?
- 该方法在真实复杂环境(如网页导航、机器人控制)中的泛化效果如何?
- OPD的更新方向一致性机制是否适用于更大规模模型?