- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月14日 11:17
- 状态
- 单一信源
发生了什么
论文通过18次对照实验,在4B至8B规模的语言与视觉语言模型Web智能体上测试GRPO(组相对策略优化)。结果发现,对于已掌握任务的强监督基线,GRPO无法可靠提升成功率,中等学习率导致性能退化,高学习率导致崩溃。仅在存在提升空间(采样策略优于贪婪策略)时GRPO有效。该无效结果在文本和Set-of-Marks观察、多种训练种子及模型规模下均成立。
为什么重要
此前普遍认为对监督检查点运行GRPO可增强智能体能力,但本研究通过严格对照实验表明,在小规模模型上GRPO不能提升已掌握任务的成功率,反而可能造成伤害,挑战了默认使用强化学习的做法。
底层逻辑
GRPO通过调整策略分布优化奖励,但若基线模型已接近局部最优,更新会破坏已有策略。中等学习率导致注意力和MLP模块退化,高学习率导致策略完全崩溃,二者机制不同,形成双重分离。
产品与商业机会
对于开发小型Web智能体的团队,直接对监督模型应用GRPO可能适得其反,既消耗计算资源又降低性能。应优先评估模型是否饱和,仅在采样提升空间存在时考虑GRPO,并谨慎选择学习率和KL权重。
- 开发训练前诊断工具,检测模型当前策略与采样策略的差距,判断GRPO是否值得应用。
- 探索针对小模型的自适应学习率或正则化方法,避免GRPO更新导致已学技能退化。
- 在训练流程中增加条件门控,仅当采样成功率明显高于贪婪成功率时才启用GRPO。
仍待确认
- GRPO在更大规模(>10B)模型上的表现是否类似?
- 除学习率和KL权重外,其他超参数(如奖励设计、训练步数)能否改变该无效结果?
- 该失败机制是否适用于其他强化学习算法(如PPO)?
- 视觉语言模态下仅在文本轨道出现明显退化,是否可通过多模态表示方式改进?