- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月15日 16:16
- 状态
- 单一信源
01
发生了什么
TRACE是一种密集信用分配方法,用于智能体强化学习,无需额外批评器或过程标签训练。它在长时域复杂搜索中显著提升基础模型的工具使用能力。在BrowseComp-Plus基准上,Qwen3-4B从7.2提升至35.6,Qwen3-30B-A3B从8.4提升至42.6。学习曲线显示更早改进和更快收敛。
02
为什么重要
传统结果奖励在长轨迹中稀疏且方差高,甚至可能误导模型。TRACE通过一步对数比率时序差分提供密集奖励,无需额外训练或实时网络数据,使纯强化学习即可改进工具使用,避免了冷启动监督微调。
03
底层逻辑
TRACE将轨迹表示为工具调用边界的状态转换,从冻结参考模型获取黄金答案的对数概率,转换为对数比率状态值,再通过时序差分变化导出每个动作的奖励。该机制无需额外训练,且可跨冗余工具调用进行压缩。
04
产品与商业机会
TRACE可直接用于提升多轮交互智能体的后训练效率,减少对人工标注或实时网络数据的依赖。产品团队可采用纯强化学习改进长时域任务(如复杂搜索)的性能,缩短模型迭代周期。
- 在需要多步工具调用的智能体产品中集成TRACE训练策略,以低成本提升任务成功率。
- 针对内部搜索或信息检索场景,使用TRACE优化基础模型,无需额外监督数据。
- 将TRACE作为后训练组件嵌入现有RL框架,降低长轨迹信用分配的计算开销。
05
仍待确认
- TRACE在非搜索任务(如对话、代码生成)上的表现如何?
- TRACE的计算开销与标准结果奖励相比具体是多少?
- 该方法是否可稳定扩展到更大参数规模的模型?
- TRACE对轨迹长度、工具种类分布的敏感度如何?