- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月5日 17:58
- 状态
- 单一信源
发生了什么
Argus 是一个面向长时程推理的通用智能体运行时,通过持续自我进化的运行时状态和控制策略,在固定模型权重下完成长期任务。在 SWE-Bench Pro 上达到约 78% 的准确率,相比 Direct Copilot 的 59%,使用 1.41 倍的总 token 数。经验证门控的自我进化后,成熟任务比启动阶段减少 21% 的解决输入 token 和 15% 的活跃工作时间,并记录了 34 次验证器恢复和 22 次严格审查循环挽救。
为什么重要
此前智能体通常依赖模型微调或上下文窗口处理长期任务,而 Argus 展示了通过持久化运行时状态和控制策略实现自我进化,无需更新模型权重。其通过验证门控的自我进化机制,显著提升任务准确率并降低后续任务的消耗,为智能体在真实复杂任务中的应用提供了新范式。
底层逻辑
Argus 通过将稳定用户意图与操作目标、约束和验证标准分离,由经理、规划者、工程师和审核者角色在持久项目状态下执行有界任务。所有记忆、技能、程序和验证器都需经过角色所属的审查和任务原生验证后才被采用。自我进化通过运行时状态和控制策略实现,固定模型权重,在运营者控制的升级点之间自主执行,从而在长期任务中适应和优化。
产品与商业机会
Argus 表明智能体系统可通过运行时自我进化显著提升长周期任务(如软件开发、数学研究)的效率和成功率,同时降低后续任务的资源消耗。对于依赖智能体的产品,可借此优化资源分配,减少重复劳动,提升复杂任务自主完成能力。但需注意初始 token 消耗较高(1.41 倍),可能影响成本。
- 在长周期开发任务中集成 Argus 类似的验证门控自我进化机制,减少重复操作,提升效率。
- 优化智能体运行时状态管理,降低高 token 消耗,控制成本。
- 将 Argus 的经理/规划者/工程师/审核者角色模式应用于复杂业务流程自动化,提升任务成功率。
仍待确认
- Argus 对短期任务或简单场景的适用性及效率表现如何?
- Argus 的自我进化机制在跨领域任务中的泛化能力是否依然有效?
- Argus 的 token 消耗和运行时间成本是否在可接受商业范围内?