- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月5日 04:17
- 状态
- 单一信源
01
发生了什么
Deltoris 是一个面向具身智能中扩散式 VLA 模型推理的算法-硬件协同设计框架。它提出时间感知的比特级稀疏算法,仅计算连续输入的差异,配合推测性推理和专用加速器,在保持精度的同时,相较于移动 GPU 实现最高 34.2 倍加速,较此前加速器快 6.1 倍。
02
为什么重要
扩散式 VLA 模型计算量大且需高频控制,边缘设备难以满足实时性。Deltoris 通过协同设计大幅提升推理速度,为具身智能产品在边缘端落地提供了可行路径,可能推动更小、功耗更低硬件上的实时控制应用。
03
底层逻辑
其核心机制是利用相邻控制输入的高度时间相似性,通过比特级稀疏跳过未变化的比特计算,减少冗余操作。为应对额外访存开销,采用推测式推理将数据加载分摊到多个控制步。专用硬件中的一维脉动比特串行 PE 阵列避免了工作负载不均,从而在保持精度的同时显著缩短推理延迟。
04
产品与商业机会
Deltoris 可显著降低边缘设备上的推理延迟与能耗,使高控制频率(50-200 Hz)的 VLA 模型在移动级硬件上运行成为可能,从而影响机器人、自动驾驶等具身智能产品的实时响应能力、硬件选型和功耗预算。
- 评估 Deltoris 在移动 GPU 或低功耗 SoC 上对现有 VLA 模型进行移植,以降低边缘设备硬件成本。
- 开发基于 Deltoris 的高频控制演示原型,验证其在灵巧操作或移动机器人场景中的实时性能。
- 与芯片厂商合作,将 Deltoris 的比特串行 PE 设计集成到专用 AI 加速器中,形成差异化 IP。
05
仍待确认
- Deltoris 是否支持任意的扩散式 VLA 架构,还是仅适配特定模型?
- 34.2 倍加速的基准模型和测试硬件具体是什么?
- 推测式推理在长时运行中可能引入的误差累积程度如何?
- 加速器设计是否已有流片或仿真之外的验证?