- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 17:59
- 状态
- 单一信源
01
发生了什么
RoboTTT是一种将机器人视觉运动上下文从单步扩展到8000步的新模型与训练方法,推理延迟不增加。它通过测试时训练压缩历史信息到权重空间。在真实操作任务中,性能比单步基线提升87%,并首次完成五十分钟十阶段组装任务;8K上下文预训练比1K提升62%。
02
为什么重要
此前机器人基础模型最多处理短历史上下文,无法利用长时间视觉运动信息。RoboTTT将上下文长度扩大三个数量级,实现从人类视频演示一次模仿学习等新能力,并证明上下文长度可作为机器人模型的新缩放维度。
03
底层逻辑
RoboTTT将测试时训练集成到视觉-语言-动作策略中,将序列模型的状态更新为快速权重,通过梯度下降在训练和推理时压缩历史信息到权重空间,从而检索长期上下文。训练时结合序列动作强制和截断反向传播,使上下文长度缩放成为可能。
04
产品与商业机会
该工作表明增加训练上下文长度可显著提升机器人性能而不增加推理延迟。机器人技能学习可从大量标注转向一次人类演示即可模仿;长周期复杂任务(如多阶段装配)完成能力增强,有助于制造业、服务业等场景落地。
- 开发基于RoboTTT的机器人编程系统,允许用户通过一次人类演示视频快速教会机器人新任务。
- 利用8K上下文长度实现机器人在复杂长周期任务中的自主操作,如多步骤装配或分拣。
- 将RoboTTT集成到现有机器人基础模型中,以较低成本提升策略鲁棒性和长期任务成功率。
- 探索在机器人仿真和真实环境中使用更长的上下文预训练(如超过8K)以获取更优性能。
05
仍待确认
- RoboTTT在不同机器人硬件平台上的泛化能力如何?
- 8K上下文长度训练的计算成本和显存需求是否适合边缘部署?
- 从人类视频演示中模仿学习的成功率和所需视频长度是多少?
- 测试时训练的额外计算开销是否影响实时控制需求?