- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月1日 10:11
- 状态
- 单一信源
01
发生了什么
CloudEdgeVLA是一种云边协同视觉-语言-动作模型,将时间错位视为表示学习问题。云模型编码延迟观测为缓慢变化的任务特征,边缘头结合最新云特征与本地视觉。训练时配对当前与随机延迟帧于相同动作目标。在LIBERO基准上,40步延迟下成功率63.8%-78.0%,远超基线。
02
为什么重要
此前分层或异步策略的慢路径表示可能过期或需显式调度,而CloudEdgeVLA将时间错位作为表示学习问题,无需阻塞同步,使云端大模型可增长而边缘保持轻量,为机器人部署提供可扩展路径。
03
底层逻辑
训练目标促使云表示保留任务级信息,边缘路径提供状态敏感修正,从而在延迟下仍能正确执行控制。这通过去除控制循环中的阻塞同步,使得云端模型可继续增大而边缘计算保持轻量响应。
04
产品与商业机会
对机器人产品,该方案允许使用更大云端模型提升语义推理,同时保证本地闭环控制的实时性。开发时无需显式调度或延迟提示,简化系统设计。但需评估网络不可用时的性能降级。
- 将CloudEdgeVLA集成到现有机器人控制栈,以在弱网环境下保持高成功率。
- 开发边缘端轻量模型部署工具,支持云端VLA模型按需更新。
- 在云服务中推出按需VLA推理API,与边缘设备协同。
- 针对移动机器人场景测试不同延迟窗口下的性能表现,优化网络策略。
05
仍待确认
- 真实网络环境(非固定延迟窗口)下的性能如何?
- 训练时使用随机延迟,是否存在对延迟分布敏感导致性能波动?
- 该方案是否支持多种机器人形态,还是仅特定任务(如LIBERO)有效?