- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年8月6日 00:00
- 状态
- 多源确认
发生了什么
RST是一个递归验证合成框架,用于生成长期终端代理任务。从已验证的种子任务开始,通过扩展参考解法、重新对齐验证器与指令,在沙盒中验证,并将接受的任务作为后续轮次种子。十五轮后生成了37,484个任务,每任务成本约0.05美元。任务难度逐轮增加,参考解法中位数从67行增至374行,执行命令数从40增至244,DeepSeek-V4-Pro的pass@4从90%降至2.5%。微调及agentic PPO在多个基准上显著提升Qwen3.5模型性能。
为什么重要
此前生成高质量长期终端任务训练数据成本高昂,每任务数百至上千美元,且人工编制难以扩展。RST将成本降至0.05美元/任务,并大幅提升任务难度,为终端代理训练提供了低成本、大规模且难度递增的数据生成途径,可能改变该领域的训练数据获取方式。
底层逻辑
RST通过从已验证的种子任务开始,递归地扩展参考解法,并同步修改指令与验证器以保持一致性,再在全新沙盒中验证新任务的有效性。通过重复使用通过验证的任务作为下一轮的种子,形成递归循环,从而使任务难度逐渐放大,生成大量高质量训练数据。
产品与商业机会
对于拥有终端代理或自动化产品的团队,RST可显著降低训练数据的成本与时间,支持构建更强大的终端代理,提升其在复杂任务上的表现。该框架可直接集成到数据生产管线,替代高成本人工标注,加速模型迭代,并可能降低相关产品的研发成本。
- 集成RST框架,为终端代理自动化生成训练数据,替代昂贵的人工编写,降低数据成本。
- 基于RST生成的高难度任务,构建针对性的评测集,用于内部模型能力测试与产品迭代。
- 使用RST产生的数据对现有模型进行微调,参考论文中Qwen3.5的收益,改善产品在终端任务上的表现。
- 探索将RST应用于其他长期任务场景,如自动化运维或IT支持,扩展产品能力范围。
仍待确认
- RST在不同类型终端环境(如Windows、网络设备)上的适用性如何?
- RST生成的任务在真实场景中的有效性与泛化能力是否有进一步验证?
- 与其他数据合成方法相比,RST在多样性方面是否存在不足?
- 论文中提及的模型与基准为特定版本,RST对更新模型的实际效果有待验证。