- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月30日 07:21
- 状态
- 单一信源
发生了什么
针对数学推理的强化学习(RLVR)在零奖励悬崖提示上因组归一化优势为零而无法产生梯度,LSPO提出一种采样时机制:检测悬崖提示,用短监督步骤拟合LoRA适配器,重采样成功完成并用重要性采样修正拼回批次,仅对基座模型做GRPO。在DeepMath-103K上对比DAPO,16个测试项中15胜1平,平均提升3.8分。
为什么重要
此前GRPO在悬崖提示上梯度为零,模型能力前沿无法被优化。LSPO首次在采样时通过临时LoRA适配器恢复该梯度,在多个基准上超越DAPO,且最终模型为纯基座,不增加推理负担。
底层逻辑
LSPO在每一步检测悬崖提示,用少量监督样本快速拟合LoRA适配器,用基座加适配器重采样,将成功完成以重要性采样修正权重放回批次,对基座做GRPO。适配器仅接收监督梯度并在检查点丢弃,保证了纯基座模型参与评估,实现了梯度恢复与推理开销分离。
产品与商业机会
对数学推理产品,LSPO可在不增加推理成本的前提下提升模型在难题上的表现,尤其改善AIME等基准的pass@k。研发流程上需额外实现悬崖提示检测和临时适配器训练,但最终模型部署无额外资源需求,适合嵌入现有RL训练管线。
- 在现有GRPO/RLVR训练管线中集成LSPO,用于自动识别悬崖提示并动态提升训练效率,减少无效采样。
- 针对数学推理产品(如AI解题助手)在特定基准(如AIME24)上使用LSPO进行微调,以提升难题通过率。
- 开发基于LSPO的训练服务,向需要突破模型能力前沿的客户提供RL训练优化建议。
仍待确认
- LSPO在更大模型或其他任务(如代码、科学推理)上的效果是否一致?
- 重要性采样修正是否引入偏差或其方差如何控制,证据未说明实际数值稳定性。
- 训练时间与计算成本的增加幅度在更长步数下是否可持续,证据仅覆盖1000步。