- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月28日 08:10
- 状态
- 单一信源
发生了什么
论文提出一种控制系统,将LLM代理的harness(提示模板、工具集、记忆层等)视为小型固定动作空间,使用ε-greedy上下文赌博机和REINFORCE强化学习在线优化策略,避免昂贵的代码搜索或不可审计的自我修改代码。在工具使用工作流、代码生成(HumanEval)和多跳检索QA(HotpotQA)任务上验证,支持Ollama和AWS Bedrock两种模型提供商,并开源了代码、数据集和部署配方。
为什么重要
此前Meta-Harness和HyperAgents优化harness的方式要么依赖昂贵代码搜索循环,要么产生不可审计的自我修改代码;本文提供一种更受约束、可审计且样本高效的方法,可在不访问模型内部的情况下通过黑盒API优化代理行为。
底层逻辑
将harness的每个可能的配置(如提示模板、工具选择)编码为小型固定动作空间,使用上下文赌博机在线选择动作,基于多目标奖励(任务成功率、验证分数、成本、延迟等)用REINFORCE更新策略,每次迭代只需少量样本即可改进。DSPy负责上下文组装并提供静态基线对比。
产品与商业机会
开发者可借助该配方以较低计算成本优化LLM代理的配置,无需手动设计复杂提示或工具集;由于方法仅需黑盒API,可无缝集成到现有产品中,减少调优时间和人工干预。但证据未提及工程化难度。
- 为内部Agent平台开发基于强化学习的自动配置调优模块,支持定制化多目标奖励
- 提供跨模型、跨领域的Agent适配服务,利用开源代码和配方快速落地新领域
- 在DSPy生态中集成此在线优化策略,替代静态FewShot编译,提升动态适应性
仍待确认
- 该方法与基于代码搜索的harness优化在最终任务准确率上有多大差距?
- 在线学习过程中需要多少样本才能收敛?是否适用于实时生产环境?
- 两个参照系统(Meta-Harness与HyperAgents)的具体实现细节和对比结果如何?
- 该控制系统的部署门槛(如对开发者强化学习知识的要求)是否可控?