- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月22日 12:11
- 状态
- 单一信源
发生了什么
PRO-LONG是一个为大型语言模型智能体设计的程序化记忆框架,用于解决长时域推理任务。它通过维持完整结构化交互日志并利用编码智能体高效搜索历史,在ARC-AGI-3测试集上比基础编码智能体平均提升18.0个百分点,匹配或超越最先进专用框架,同时节省4.2至5.8倍的token。在Fable 5任务上达到97.4% best@2,总成本为1750美元。
为什么重要
此前长时域推理面临信息保存与检索之间的权衡:保留越多信息,有效检索越困难。PRO-LONG首次在不牺牲检索效率的前提下,通过程序化记忆实现了对完整历史的结构化存储和高效搜索,大幅提升了性能并显著降低了token消耗,使得前沿模型在持续学习基准上达到甚至超越精心设计的专用方案。
底层逻辑
PRO-LONG的核心机制是使用程序化记忆,即保留完整的结构化交互日志,并利用当前编码智能体的进步来自动生成搜索历史的高效代码。这样既保留了所有观察信息,又通过编程方式实现快速、准确的检索,避免传统方法中因信息过载导致的检索困难。
产品与商业机会
对于依赖LLM智能体的产品(如自动化游戏、机器人控制、持续监控等),PRO-LONG可直接提升长时域任务的成功率,同时将推理成本降低4倍以上。这有助于缩短响应延迟、节省API费用,并使智能体能够处理更复杂的探索性任务而无需频繁重置上下文。
- 将PRO-LONG集成到现有AI智能体框架(如LangChain或AutoGPT)中,直接提升长时域任务表现
- 基于该框架开发低成本的长时域推理API服务,面向游戏AI或机器人任务
- 针对ARC-AGI类基准测试,提供PRO-LONG驱动的智能体方案作为产品卖点
- 与模型提供商合作,将程序化记忆机制内嵌至下一代推理模型
仍待确认
- PRO-LONG在非编码类长时域任务(如对话记忆、视频理解)上的表现如何?
- 其程序化记忆的构建是否需要人工干预或额外训练?
- 与纯端到端记忆模型相比,在延迟和易用性方面是否有显著差异?
- 该框架在更大规模或更复杂的任务中是否仍能保持4-6倍的token优势?