- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月3日 23:46
- 状态
- 单一信源
发生了什么
arXiv 论文提出 ValueFormer,一种基于因果 Transformer 的价值函数,结合阶段感知标签,用于半自主视觉-语言-行动(VLA)策略。在真实机器人双手三明治组装任务(1427 个片段)中,来自评论家的逐帧训练权重将任务完成率从 70% 提升至 85%(n=20 时在噪声范围内),批量 bf16 编码器将实时服务成本降低 3-5 倍,使评论家能在单个 GPU 上与策略一起以 2 Hz 运行。
为什么重要
行为克隆训练的 VLA 策略在失败时无法提供进展信号,而强化学习因真实机器人经验昂贵且变形食物难以模拟而不实用。ValueFormer 提供了一种廉价的替代方案:通过密集连续的逐帧标签和阶段感知返回,在不依赖强化学习的情况下,为策略提供进度信号和在线错误检测能力,从而提升任务完成率并降低推理成本。
底层逻辑
ValueFormer 在冻结的 DINOv3 骨干上运行紧凑的因果 Transformer,单次前向传递输出两个信号:平滑的蒙特卡洛值 V_mc 用于优势估计,尖锐的二元值用于在线错误检测。失败片段使用阶段感知的“成功然后衰减”返回标记,保留失败阶段前的成功曲线;检测使用错误区间而非单一失败时间进行监督,使策略能恢复的错误也携带信号。
产品与商业机会
该技术可显著降低 VLA 策略在真实机器人任务中的训练成本,无需大量真实经验即可提升任务完成率,同时通过降低推理成本(3-5 倍)使评论家能在单 GPU 上实时运行。对机器人自动化产品,可提升任务成功率,减少人工干预,并可能降低硬件要求。但对其他任务和策略的通用性尚未验证。
- 将 ValueFormer 集成到现有 VLA 机器人控制系统中,用于在线错误检测和干预,提升任务成功率。
- 基于阶段感知标签机制,开发训练数据标注工具,自动生成密集奖励信号,减少人工标注成本。
- 利用降低的推理成本,将评论家部署到边缘设备,实现更实时的机器人控制。
- 针对食品加工等难以模拟的场景,开发半自主机器人解决方案,结合人工监督和自动化执行。
仍待确认
- ValueFormer 在除三明治组装外的其他任务和场景上的泛化能力如何?
- 阶段感知标签的具体实现细节和超参数敏感性尚不明确。
- 批评家模型在 2 Hz 下运行,是否足以应对更快速的任务?
- 提升的完成率在更大样本量(n>20)下是否仍然显著?