- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月15日 06:55
- 状态
- 单一信源
发生了什么
研究者提出LAPO方法,一种自生成过程监督技术,用于多轮搜索推理。LAPO通过向后留一回合归因,用[DELETE]占位符替换某一回合及其检索观测,测量当前策略对正确答案平均对数似然的变化,从而计算该回合的贡献(Answer-Likelihood Gain)。该方法无需额外奖励模型、教师或验证器。在七个知识密集型问答数据集上,LAPO的平均精确匹配得分为0.326,超过最强基线IGPO 0.053。
为什么重要
此前多轮搜索推理的强化学习仅依赖最终结果奖励,无法区分有用、冗余和有害的中间交互。LAPO利用策略自身的历史信号为每一回合生成过程奖励,实现了无需额外标注或模型的过程监督,且性能显著优于现有步骤奖励基线。
底层逻辑
LAPO的核心机制是向后留一回合归因:对每一搜索回合,将其替换为固定[DELETE]占位符并保持其余交互不变,然后计算当前策略对正确答案平均对数似然的变化量(Answer-Likelihood Gain)。该变化量衡量了该回合的边际贡献。进一步通过符号一致性门控,仅保留原始归因分数与归一化过程优势方向一致的分数,提升信号质量。
产品与商业机会
该方法不依赖额外的奖励模型、验证器或LLM作为评判器,可降低多轮搜索代理的研发成本和标注需求。在知识密集型问答产品中,LAPO能直接用于强化学习训练阶段,提升多步推理任务的最终准确率,且保持计算开销可控。
- 将LAPO集成到多轮搜索问答产品,用于强化学习训练,提升中间回合的奖励信号质量。
- 基于LAPO构建无需外部验证器的自监督推理代理,降低部署成本和依赖。
- 利用LAPO的归因分析工具识别多步推理中的关键步骤,优化搜索策略设计。
仍待确认
- LAPO在真实多轮搜索场景(如桌面搜索、对话系统)中的表现是否与基准数据集一致?
- 该方法对长链推理(超过10轮)的计算开销和效果如何?
- LAPO与其他过程监督方法(如蒙特卡洛树搜索)的兼容性或优劣比较尚未验证。