- 类型
- 文章
- 来源
- YouTube · NVIDIA Developer
- 发布
- 2026年8月5日 04:32
- 状态
- 单一信源

01
发生了什么
NVIDIA 研究人员在直播中探讨了用于机器人学习的 World Action Models 与 Vision-Language-Action 模型,并展示 Cosmos 3 将动作作为原生模态,使机器人能预测未来观测的同时生成动作。Cosmos 3 提供开放工作流,支持微调、评估和部署。
02
为什么重要
机器人基础模型此前多依赖单一方法,而 WAM 和 VLA 各有优劣。Cosmos 3 将动作作为原生模态,并开源模型、数据集和配方,可能改变机器人策略的训练与部署方式,值得关注。
03
底层逻辑
WAM 侧重于世界动态预测,VLA 则将视觉、语言和动作关联,二者互补。Cosmos 3 将动作视为与视频并列的原生模态,使模型能同时预测未来观测和生成动作,通过开放工作流降低定制门槛。
04
产品与商业机会
对机器人产品团队,Cosmos 3 提供开源模型与工具,可能降低开发成本和时间。但证据未提及具体性能或商业条款,影响程度仍待验证。
- 评估 Cosmos 3 在自家机器人策略上的微调效果
- 借助其开放工作流搭建内部评估和部署管线
- 关注 WAM 与 VLA 混合架构在操控任务中的案例
05
仍待确认
- Cosmos 3 的具体开源许可和商用条款是什么?
- 与现有 VLA 模型相比,性能基准如何?
- 直播中提到的示例是否可复现,有无数据集细节?