- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月13日 14:57
- 状态
- 单一信源
01
发生了什么
小米发布38亿参数多模态自回归模型Xiaomi-Robotics-U0,统一处理文本到图像、图像编辑、具身场景生成、具身转移和具身视频生成。在多项任务上达到最先进水平,人类评估中超越GPT-Image-2.0,在真实世界操作任务中将pi_0.5的分布外成功率从36.9%提升至63.2%。
02
为什么重要
过去具身生成方法常牺牲预训练的视觉知识,而该模型首次在多种机器人实体上实现高质量多视角场景生成,并引入结构化可控具身转移。它将世界基础模型的泛化能力保留并适应于具身场景,显著提升真实环境操作成功率。
03
底层逻辑
模型将具身生成视为基础图像/视频生成的扩展,联合优化多个任务,保持预训练模型的泛化性。通过多视角一致性和交互动力学约束,实现细粒度编辑和场景转移。这种统一框架避免了专用机器人数据对预训练知识的稀释。
04
产品与商业机会
机器人产品可直接利用该模型生成高质量仿真训练数据和多视角场景,减少对大规模真实数据的需求。它降低了仿真到真实迁移的成本,并可能提升机器人操作策略的泛化性和部署成功率。
- 使用Xiaomi-Robotics-U0生成多视角机器人场景数据,增强策略训练集的多样性
- 基于该模型开发文本或图像驱动的机器人操作演示系统,加速客户验证
- 结合机器人控制器,利用场景生成结果优化抓取和运动规划
- 将模型集成到仿真管线,实现从设计到部署的快速迭代
05
仍待确认
- 模型推理所需的计算资源和硬件规格未在证据中说明
- 不同机器人实体上的性能差异(如灵巧手vs夹爪)无详细比较
- 模型是否开源或提供商用许可?证据未提及
- 真实世界任务成功率提升是否适用于所有操作类别?仅针对pi_0.5的测试