- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月20日 17:59
- 状态
- 单一信源
发生了什么
Patch Policy 是一种轻量级架构扩展,使基于 Transformer 的机器人策略能够直接使用预训练 Vision Transformer 的密集补丁令牌(patch tokens),同时避免大型视觉-语言模型的计算开销。在四个模拟和三个真实环境套件中,该方法相比使用全局池化表示的策略实现了 40% 的相对改进,并超越微调 OpenVLA-OFT 达 18%,而参数仅为其约 0.7%。
为什么重要
此前机器人策略要么对每个观测压缩为单一全局令牌损失细节,要么从头训练视觉骨干牺牲预训练收益,要么依赖大型视觉-语言模型导致高延迟。Patch Policy 以极低参数开销直接利用密集预训练特征,同时保持高频控制所需的速度和效率。
底层逻辑
Patch Policy 核心是块因果注意力掩码,使策略能在维持时序因果性的前提下,跨多个观测的补丁令牌以及状态信息进行注意力计算,无需完整视觉-语言模型背板。这样既保留了密集空间信息,又避免了全局池化的信息损失和大型模型的推理负担。
产品与商业机会
机器人产品可集成 Patch Policy 以在低算力设备上实现高精度视觉反馈控制,降低对昂贵 GPU 的依赖;研发团队可复用不断进步的视觉预训练模型,而不必重新设计视觉骨干;推理速度提升有利于实时性要求高的操作任务。
- 在仿人形机器人或灵巧手控制器中集成 Patch Policy 以实现高帧率、细粒度抓取。
- 将 Patch Policy 打包为标准插件,嵌入现有机器人控制栈,降低视觉策略迁移门槛。
- 开发面向低成本边缘设备的轻量版 Patch Policy,用于家用服务机器人的实时语义导航。
仍待确认
- Patch Policy 是否适用于各类视觉预训练模型(如 CLIP、DINOv2)以及不同分辨率的输入?
- 在真实机器人上,块因果注意力掩码的额外延迟是否仍能维持 30 Hz 以上的控制频率?
- 该方法对噪声或遮挡等非理想视觉条件的鲁棒性如何?
- 是否需要在不同机器人形态(如轮式、四足)上重新调节注意力掩码参数?