- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月24日 00:00
- 状态
- 多源确认
发生了什么
OpenForgeRL是一个开源框架,通过轻量级代理和Kubernetes编排器,支持在Claude Code、Codex等推理框架和任意环境中端到端训练基于harness的智能体。实验表明,OpenForgeClaw在ClawEval上达31.7 pass^3,OpenForgeGUI在WebVoyager上达72.3,优于同规模开源基线,在GUI领域甚至匹敌更大模型。
为什么重要
此前基于复杂推理harness的智能体难以用开源SFT/RL栈端到端训练,因为后者无法原生表达有状态多进程推理。OpenForgeRL解耦训练与推理,使研究者能在实际部署环境中直接训练和改进智能体,大幅降低了Harness-based Agent的训练门槛。
底层逻辑
OpenForgeRL通过一个代理服务harness的模型调用并记录为训练数据,供标准RL代码库(如veRL)使用;Kubernetes编排器在独立容器中执行每次rollout,从而解耦训练和推理,实现可扩展的端到端训练。
产品与商业机会
开发者可针对特定harness和任务场景训练智能体,无需修改harness本身;仅需数百到数千任务即可达到有竞争力性能,降低了训练成本;在GUI代理等领域可匹配甚至超越数倍大的模型,减少对大型专有模型的依赖。
- 基于OpenForgeGUI开发浏览器自动化测试Agent,提升UI回归测试覆盖率。
- 利用OpenForgeClaw构建工具调用型Agent,用于企业内部的脚本执行与自动化运维。
- 将OpenForgeRL集成到现有RL平台(如veRL),作为Harness-based Agent的标准训练组件。
- 为多模态GUI Agent(如计算机操作)提供端到端训练方案,取代传统手工演示数据收集。
仍待确认
- 框架对非Kubernetes环境(如本地开发机)的适配与性能如何?
- 训练时harness的模型调用延迟对数据收集效率的具体影响有多大?
- 是否支持多模态输入(如屏幕截图、音频)的harness?
- 在不同harness间迁移已训练Agent的能力和代价如何?