- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月21日 15:23
- 状态
- 单一信源
01
发生了什么
Agentic Real2Sim框架利用视觉-语言代理,将真实世界的物体-机器人交互记录自动转化为可运行的物理模拟副本(episodic twin),在刚体操作、变形物体交互和人形运动三种场景上进行了评估,并展示了使用开源视觉语言模型后端能以较低成本达到接近前沿模型的转换成功率。
02
为什么重要
此前真实世界到模拟的转换依赖手动调优视觉基础模型、网格清理、坐标对齐及工具间的脆弱集成,成本高且难以扩展。Agentic Real2Sim通过代理自动化整个流程,并借助开源VLM大幅降低计算成本,使机器人仿真数据的生成更加高效可及。
03
底层逻辑
框架通过视觉-语言代理的决策能力,自动恢复场景几何、物体状态和物理参数,并整合演员、物体、相机、姿态和轨迹为可运行的物理仿真环境。开源VLM后端替代昂贵的前沿模型,在相似成功率下大幅削减推理成本。
04
产品与商业机会
机器人研发中,可直接将真实操作视频或记录自动转化为用于策略学习和评估的仿真场景,减少手动搭建环境的工作量,降低仿真数据准备成本,加速机器人技能训练的迭代周期。
- 提供基于Agentic Real2Sim的仿真数据生成服务,机器人公司上传真实交互记录即可获取可训练的仿真环境。
- 集成开源VLM打造低成本自动化仿真管线工具,面向中小型机器人团队。
- 用于人形机器人动作捕捉数据的自动模拟化重建,支持策略迁移学习。
05
仍待确认
- 该框架在不同复杂度和光照条件下的真实场景中,物理参数推断精度如何?
- 开源VLM与前沿模型的成功率差距在哪些场景下可能显著扩大?
- 生成的模拟环境与真实环境之间的交互保真度是否足以支持策略直接迁移?