- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月6日 06:48
- 状态
- 单一信源
01
发生了什么
arXiv 论文提出 Relay, Don't Route 框架,通过自适应种群交接将计算预算从单次调用转向演化种群。实验表明,在四个基准和三种预算下,该方法在 11/12 设置中取得最高平均分,优于竞争基线。
02
为什么重要
此前方法通常在单个查询或变异步骤层面分配模型,忽略了演化搜索的状态性。该研究将预算分配提升到种群层面,利用早期轨迹信息,使得在固定推理预算下,便宜模型也能取得接近强模型的早期进展,从而降低长期运行成本。
03
底层逻辑
演化搜索具有状态性,每个候选会改变后续变异的种群。研究发现早期轨迹性能具有信息性且噪声较大,廉价模型能低成本恢复强模型的早期进展。通过 bandit 调度器分配短块,利用 Relay Gain 作为奖励,决定何时将紧凑的候选银行交接给共享的强模型群体进行精炼,从而优化整体预算。
04
产品与商业机会
对于依赖 LLM 进行程序搜索或算法发现的产品,该方法可直接降低推理成本,不必全程使用强模型。研发团队可借鉴种群交接策略,在有限预算内提升演化搜索效果,缩短迭代周期,并可能用于代码生成或自动机器学习流程优化。
- 在自动代码修复工具中,采用廉价模型探索多个修复路径,再转交强模型精炼,以降低单次修复成本。
- 为 LLM 驱动的自动化机器学习平台设计预算调度器,根据早期性能动态切换模型,提升资源利用率。
- 在智能体演化训练框架中,引入种群交接机制,减少强模型调用次数,保持搜索质量。
05
仍待确认
- 该方法在处理真实世界复杂任务时,是否仍能保持优势?
- bandit 调度器的初始参数如何设置,是否依赖领域知识?
- 预算分配从调用级转向种群级后,是否会增加工程实现复杂度?