李飞飞World Labs发布R2S2R引擎:如何打通机器人仿真到现实的闭环?

11 阅读

在具身智能(Embodied AI)的发展路径上,如何跨越从数字世界到物理世界的“现实鸿沟”,一直是阻碍技术规模化落地的核心痛点。李飞飞创立的World Labs近期发布的全新机器人策略训练与评估引擎——Real-to-sim-to-real (R2S2R),正是为了填补这一关键空白。这一进展不仅标志着World Labs的空间智能版图从单纯的“生成可交互虚拟世界”向“训练与部署真实机器人”延伸,更首次真正打通了从仿真训练到真实运行的完整闭环。

突破瓶颈:为何机器人需要更智能的仿真器

当前机器人发展的主要瓶颈,已不再仅仅是模型架构的优劣,而是缺乏能够规模化获取的高质量经验数据与高效的评估体系。与互联网文本数据不同,机器人的每一条有效经验都需要在物理世界中真实发生。每一轮实验都伴随着高昂的硬件占用成本、繁琐的人工重置过程以及系统维护压力。即便拥有海量的人类视频数据,也难以系统性地覆盖复杂的环境变化、物体属性差异以及各种边缘的失败条件。

传统的仿真技术虽能节省部分数据采集成本,但存在显著短板:为每项真实任务单独搭建环境不仅成本高、速度慢,且仿真与现实之间往往存在视觉、几何和物理动态上的巨大差距。更关键的是,机器人在仿真中学会的策略,迁移到真实世界时往往失效;仿真中的高成功率,未必能反映真实硬件上的表现。

针对这一痛点,World Labs提出的R2S2R引擎核心价值在于“主动制造”与“闭环迭代”。它不仅能重现现实,更能主动生成现实中昂贵、危险或难以重复的极端场景,让机器人在虚拟环境中反复经历成功与失败,从而以极低的边际成本实现经验的规模化积累。

Real-to-Sim:从现实参数到高保真虚拟重建

R2S2R的第一步是Real-to-Sim,即构建与真实任务严格对齐的虚拟环境。这一过程并非简单的3D建模,而是需要精准还原机器人、传感器、物体及其交互过程中的物理反馈。

在实际操作中,团队采集真实环境中的机器人动作、传感器数据和物体信息,利用生成式世界建模系统将其重建为可交互的虚拟空间。难点在于,真实环境往往缺乏精确的物理参数。物体的重量、摩擦力、机器人关节的摩擦系数、电缆与包装的柔性形变等,很难通过标称规格准确获取。R2S2R通过组合使用不同的表示和建模方法,尽可能复现这些复杂的物理特性。

为了验证重建的准确性,团队采用了对齐验证机制:让机器人在现实与仿真中执行完全相同的动作序列,直接比较视觉观测、物体反应及最终结果。例如在双机械臂装箱任务中,仿真环境与现实环境产生的观察结果、物体运动情况及最终效果高度一致。这种对齐不仅停留在外观层面,更深入到物理动态层面,确保仿真中还原的不仅是“看起来真实”,而是“物理行为真实”。

Sim-to-Real:规模化训练与高通量评估

完成环境重建后,R2S2R进入Sim-to-Real阶段,将虚拟世界转化为可扩展的训练与评估引擎。这一阶段的核心逻辑是“发现问题—补充数据—改进策略”的闭环。

机器人首先在仿真中学习新策略,评估系统主动寻找其容易失败的状态,并围绕这些弱点生成新的交互经验。相较于现实数据采集,仿真可以系统性地调整物体位置、机器人状态、视角、外观及物理属性,让策略反复经历现实中难以复现的情况。更重要的是,仿真能提供硬件上难以采集的监督信号,如物体状态、接触力、受力细节等,为策略优化提供丰富反馈。

这种机制使得仿真环境从“一次性实验”转变为“可复用的训练基础设施”。同一套重建好的任务环境,可以适配不同策略、传感器和机器人平台,无需为每个新模型重复搭建场景。报告数据显示,基于R2S2R训练的策略,即使完全未使用真实世界数据,也能在ALOHA、RB-Y1、xArm等多种机器人平台上完成装箱、绕线、试管转移等任务,并实现连续1小时自主运行且无失败、无人工接管。这证明了高精度仿真策略向真实硬件迁移的可行性。

在评估层面,R2S2R解决了传统测试成本高、覆盖有限的问题。通过在数千种受控条件下主动寻找失败,系统可以提前筛掉表现不佳的模型版本,仅将最有希望的策略留给真实硬件测试。在ALOHA双臂方块交接任务的测试中,团队对GR00T N1.6和π₀.₅两种策略架构进行了对比。结果显示,仿真中表现更好的模型版本,在真机上也通常表现更好。仿真不仅保持了不同策略之间的相对排名一致性,还呈现出现实中相似的成功与失败分布。这意味着,仿真不仅能判断“是否成功”,还能解释“为何成功或失败”,成为机器人开发中的高通量评估层。

收购SceniX:互补技术的战略整合

R2S2R引擎的发布并非孤立事件,而是World Labs战略整合的重要一环。在引擎发布前一周,World Labs宣布收购专注于机器人仿真、训练与评估的初创公司SceniX。这一并购补齐了World Labs在机器人学习算法、硬件系统及仿真工程化方面的能力短板。

SceniX由哥伦比亚大学助理教授、前斯坦福博士后李昀烛联合创立。虽然双方此前已有合作基础(SceniX曾是World Labs生成模型Marble的客户),但此次收购实现了深度的技术互补。World Labs擅长生成模型、计算机视觉和3D重建,能够从稀疏输入中快速生成具有空间一致性的世界;而SceniX深耕机器人仿真、学习算法和硬件系统,精通如何让机器人通过这些世界进行有效学习与部署。

这种互补性使得World Labs能够构建一套与机器人形态和解耦的基础设施。无论是单臂、双臂还是移动机器人,无论是VLA(视觉-语言-动作模型)还是World Action Model,都可以进入同一个数字世界进行训练和测试。正如李昀烛在访谈中所言,World Labs并非要亲自制造机器人硬件,而是致力于提供底层的仿真与评估基础设施,降低具身智能开发的门槛。

展望:世界模型的三分法与未来部署

李飞飞曾提出世界模型的三分法:渲染器(负责生成观察)、仿真器(负责模拟世界状态)和规划器(负责输出行动)。R2S2R的推出,标志着World Labs补上了“仿真器”这一最关键也最艰难的拼图。它让生成的世界从“视觉逼真”进化为“物理可交互”和“训练可验证”。

未来,随着仿真与基础模型的进一步整合,R2S2R预计将在仓库、实验室和电子装配等半结构化场景中率先实现真实部署验证。通过持续收集真实世界的新结果,反向修正世界模型、训练数据和机器人策略,这一闭环将不断迭代,推动具身智能从实验室走向规模化应用。在这一进程中,如何进一步提升仿真与现实的物理对齐精度,以及如何优化大规模仿真环境下的计算效率,将是接下来的关键挑战。但可以确定的是,R2S2R已为具身智能的规模化突破提供了一条清晰且可工程化的路径。