- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月20日 10:48
- 状态
- 单一信源
发生了什么
华为发布PGN(Pangu Navigator),一种基于OpenPangu-7B的离线视觉语言导航动作预测系统。该系统通过两阶段训练:先利用Q-Former和两层MLP将冻结的EVA-ViT-G/14视觉编码器与冻结的语言骨干对齐,再冻结视觉通路并仅更新结构标记嵌入和LoRA适配器,使用五个观测窗口和依赖训练轮次的时间采样策略。在500条专家轨迹的开环评估中,达到62.29%的归一化动作匹配率和100%的非空输出率。
为什么重要
该方案展示了将多模态大模型(OpenPangu-7B)应用于视觉语言导航的可行路径,通过两阶段训练实现了视觉-语言对齐与动作空间接地,为离线导航动作预测提供了可复现的基线,并验证了在Ascend 910B NPU上的训练效率。
底层逻辑
PGN先冻结视觉编码器和语言骨干,通过训练Q-Former和两层MLP投影器实现视觉-语言对齐;然后冻结对齐后的视觉通路,仅更新三个结构标记嵌入和LoRA适配器,使用五个连续观测窗口和基于训练轮次的时序采样策略,以“推理后行动”格式输出动作预测,结合混合精度计算和DeepSpeed ZeRO-2优化训练。
产品与商业机会
该技术为华为盘古多模态模型增添了具身智能能力,可用于开发室内导航机器人、智能导览系统等产品;但当前仅离线评估,闭环性能及实际部署效果仍需验证,可能影响用户对导航可靠性的预期。
- 基于PGN开发面向仓库或商场的自主导航机器人原型,提供离线路径规划能力。
- 将离线动作预测模型封装成云端API,供第三方智能体应用调用,降低开发门槛。
- 与华为Ascend 910B硬件结合推出视觉语言导航开发套件,吸引具身智能开发者。
仍待确认
- 闭环导航下的动作匹配率和目标完成率是多少?
- 在真实环境中,误差累积对导航性能有多大影响?
- PGN能否泛化到未见过的环境和指令?
- 训练数据集的具体规模、来源和多样性如何?