- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月29日 10:12
- 状态
- 单一信源
发生了什么
DREvo是一种新的大语言模型agent框架(harness)自我进化方法。它针对现有方法中历史经验无法稳定指导搜索、性能波动大的问题,引入了功能级证据锚定、状态相关证据重校准和角色条件搜索意图蒸馏三项机制,以动态判断历史证据的有效性并转化为具体搜索方向。在有限进化预算下,DREvo在五个基准测试上平均比基线高出16.2%(领域推理任务)和14.2%(智能体任务),且进化轨迹更平滑。
为什么重要
此前自我进化方法中的历史经验积累不能稳定转化为搜索指导,进化过程中性能波动大,导致在有限预算下难以发现高性能harness。DREvo通过动态重校准和意图蒸馏,使进化更稳定高效,显著提升了平均准确率,降低了人工调优harness的依赖。
底层逻辑
现有方法有两个局限:一是未动态评估历史经验在当前harness下是否仍然有效,二是缺乏将有效经验转化为可执行搜索方向的机制。DREvo通过功能级证据锚定确定相关证据,状态相关重校准判断有效性,再通过角色条件蒸馏将有效证据转化为明确的搜索意图,从而引导harness更平稳地向更优解进化。
产品与商业机会
对于需要构建高性能LLM agent的团队,DREvo可减少手动设计harness所需的专家精力,使自动化进化更可靠。但方法需要多次迭代评估,会消耗计算资源;不过其带来的性能提升可间接降低后续调试和返工成本。
- 将DREvo集成到LLM agent开发平台(如Dify、LangFlow)中,提供一键自动优化harness能力。
- 基于DREvo开发企业级agent配置调优插件,自动优化工具调用顺序和参数。
- 将DREvo与强化学习反馈循环结合,实现用户反馈驱动的harness持续改进。
仍待确认
- DREvo在不同规模或不同架构的LLM(如MoE模型)上表现是否稳定?
- 进化过程的计算开销(如迭代次数、推理成本)与基线相比具体增加多少?
- DREvo能否直接适配主流agent框架(如LangChain、AutoGen)的harness定义?