- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年8月4日 13:53
- 状态
- 单一信源
发生了什么
论文提出 PhyAI,一个统一的 Physical AI 推理引擎,通过模型适配器共享图执行、内核、内存管理和并行服务,在同一代码库中运行 VLA 模型和 WAM 模型。PhyAI 在 pi0、pi0.5、GR00T N1.7 和 MiniCPM-Robot 上实现了 1.40x 至 4.65x 的加速,并在 Cosmos3 上实现 2.08x 加速。
为什么重要
此前 Physical AI 在不同阶段(评估、云强化学习、边缘 GPU 推理、机载部署)使用分离的推理程序,维护成本高。PhyAI 用单一运行时统一了这些场景,并通过适配器接口在模型发布当天即集成 MiniCPM-Robot,表明该方案能显著降低多模型支持成本,并提升端到端部署效率。
底层逻辑
PhyAI 将架构相关的条件逻辑、求解器、缓存和输出逻辑放入模型适配器,而将图执行、内核、内存管理和并行服务等通用部分共享,使得同一代码库能适配多种模型并迁移至不同硬件。分析还揭示了不同模型的执行瓶颈:如 pi0.5 在 batch size 1 时 action expert 占用 57.2% 延迟,而 Cosmos3 则受生成主导,说明需要差异化执行策略。
产品与商业机会
对部署 Physical AI 模型的产品团队,PhyAI 可能减少多模型支持所需工程工作量,并降低云侧推理成本(如 Cosmos3 在 8 张 H20 上延迟减半)。但证据显示专用运行时在部分配置下仍更快,故当前不应期望在所有场景中都是最优。
- 评估现有 VLA/WAM 模型部署流程,若存在多推理程序维护成本,考虑采用统一运行时架构。
- 利用适配器接口快速集成新发布的物理 AI 模型,缩短产品上线时间。
- 针对计算瓶颈(如 pi0.5 的 action expert)优化缓存或并行策略,提升单批次性能。
仍待确认
- PhyAI 与专用运行时在边缘低功耗设备上的延迟差异是否可接受?
- 适配器接口对模型覆盖率有无限制?
- 性能和速度提升是否在多种硬件配置下保持稳定?
- 该方案是否支持多 GPU 扩展的线性伸缩?