科技

李飞飞牵头研发的世界模型落地突破 机器人训练实现仿真与真机能力同步

来源:快线潮资讯
李飞飞牵头研发的世界模型落地突破 机器人训练实现仿真与真机能力同步

henry 发自 凹非寺

量子位 | 公众号 QbitAI

李飞飞掌舵的 World Labs,补齐了关键的一块拼图。

借助新近收购的机器人公司 SceniX,World Labs 正式推出了一套全新的机器人策略训练与评估引擎——Real-to-sim-to-real(简称 R2S2R)。

这一举措将 World Labs 的空间智能版图,从生成可交互的虚拟世界,进一步拓展至真实机器人的训练、评估及部署环节,并首次实现了从仿真训练到真机运行的闭环打通。

拆解来看,R2S2R 由 Real-to-Sim 和 Sim-to-Real 两大模块构成。

Real-to-Sim 的核心任务,是将现实中的机器人本体、传感器、物体以及交互过程映射进仿真环境,构建出与真实任务高度对齐的虚拟空间。

Sim-to-Real 则负责让机器人在这些虚拟环境中完成策略训练与性能评估,随后将优化后的策略直接部署回物理世界。

李飞飞在 X 平台发文指出,基于该方法训练出的策略,即便从未接触过任何真实世界数据,也能实现连续自主运行 1 小时,全程无需人工介入。

不仅如此,R2S2R 还大幅降低了机器人策略评估的规模化门槛。

通过确保策略在仿真与现实中的运行过程保持一致,真实世界中出现的成功、失败及其触发条件,都能在虚拟空间中被精准复现与分析。

可以说,R2S2R 不仅打通了世界模型从“生成世界”到“训练、评估及部署真实机器人”的全链路闭环,更推动了李飞飞此前提出的世界模型三分法中至关重要的一环——

仿真器。

在她的经典理论框架中,世界模型承担三种职能:渲染器负责生成视觉观察,仿真器模拟世界状态演变,规划器则输出具体行动指令。

而 R2S2R 所做的,正是推动 World Labs 生成的世界从“视觉上逼真”,进化为机器人真正能够进入、交互并进行深度学习的训练场。

要扩展具身智能的规模,先要扩展机器人学习所依赖的世界

那么,为何必须扩展机器人的学习环境?且为何一定要依托仿真?

World Labs 在其博客中给出了答案:

当前机器人发展的主要瓶颈,已不再局限于模型架构本身,而是缺乏能够大规模获取的经验数据与评估体系。

一方面,真实世界中的物体位置、光照条件、物理属性及交互过程时刻处于动态变化之中。

若要使机器人真正走出实验室,就必须提前覆盖足够丰富的场景,并反复测试其在何种条件下能成功,又会在何处遭遇失败。

另一方面,与大模型训练所依赖的海量互联网数据不同,机器人的每一条经验都必须源自真实发生的事件。

每一轮实验均需占用硬件资源,涉及人工重置物体、恢复故障现场及系统维护等繁琐工作。即便拥有海量的人类操作视频,也难以系统性地覆盖不同环境、物体属性、机器人状态及各类失败条件。

因此,仿真的最大价值并非仅仅是“节省数据采集成本”,而在于能够主动制造现实中昂贵、危险或难以重复的场景,让机器人反复经历成功与失败的循环。

但以往的仿真技术存在明显短板。

它不仅需要为每一项真实任务单独搭建环境,导致成本高企、效率低下,而且仿真与现实之间往往存在视觉、几何结构及物理动力学层面的差异。

更为关键的是,机器人在仿真中学会的策略,迁移至真实世界后未必依然有效;仿真中的测试结果,也未必能准确反映真实表现。

基于上述背景,World Labs 推出了这套从现实到仿真再回归现实的训练引擎(R2S2R),旨在用于机器人策略的训练与评估。

其中,Real-to-Sim 负责将现实中的机器人、传感器、物体及交互过程重建为与任务对齐的虚拟世界。这不仅要求还原世界的外观,还需尽可能保留机器人与物体交互时的运动轨迹与物理反馈。

Sim-to-Real 则利用这些构建好的世界进行策略训练与评估,识别模型容易出错的状态,并判断仿真中的表现能否成功迁移至真实硬件。

两者紧密连接,形成了一套完整的闭环系统:

从现实中提取任务,在仿真中规模化地生成经验、训练模型并寻找失败案例,再将策略部署回现实;而现实中产生的新结果,又会反过来修正世界模型、训练数据及机器人策略。

换言之,R2S2R 并非简单地用仿真数据替代真实数据,而是将一个真实的任务扩展为大量可控、可复用的学习世界,使机器人得以更低成本地进行反复训练、评估与迭代。

Real-to-sim-to-real 的具体实践

具体而言,该方法始于 Real-to-Sim 阶段。

团队首先采集机器人本体、传感器、环境、物体及任务演示等信息,随后通过生成式世界建模系统,将其重建为一个可交互的虚拟世界。

这个世界不仅要还原外观与几何结构,还要尽可能复现物体的物理特性与动力学行为。

例如,在下面的双机械臂装箱任务中,仿真环境与真实环境执行相同的动作序列,从而产生高度一致的观察结果、物体运动情况及最终效果。

这里的难点在于,真实环境并不会提供一套精确的参数设定。

物体的重量、摩擦系数可能难以精确测量,机器人本体与摄像头也可能与标称规格存在偏差,而电缆、包装等柔性物体的形变更难用简单模型描述。

因此,R2S2R 会根据不同任务的需求,灵活组合使用不同的表示方法与建模手段。

完成重建后,团队会让机器人在现实与仿真中执行完全相同的动作,直接对比视觉观测、物体反应及最终结果,以此验证两边是否真正对齐。

进入 Sim-to-Real 阶段后,对齐后的仿真世界将进一步转化为可扩展的训练与评估引擎。

具体流程是:机器人先在仿真中学习新策略,评估系统随即主动搜寻其容易失败的状态,并围绕这些弱点生成新的交互经验,形成“发现问题—补充数据—改进策略”的闭环,最后再将策略部署至真实硬件。

此外,相较于现实数据采集,仿真允许系统性地调整物体位置、机器人状态、视角、外观、物理属性及任务难度,使策略能够反复经历现实中成本高、难复现甚至不安全的情况,并获得物体状态、接触力、受力分布等硬件上难以采集的监督信号。

而且,一个重建好的任务并不只服务于单一模型或某款特定机器人。同一套仿真环境可以继续适配不同的策略、传感器及机器人平台,从一次性实验转变为可复用的训练基础设施。

报告数据显示,在没有真实世界数据参与、仅在仿真中训练的策略,可以直接迁移至 ALOHA、RB-Y1、YAM、Flexiv 和 xArm 等多种机器人平台,完成装箱、绕线、试管转移及杂乱环境中的单件抓取等任务。

其中,电源线绕行、线缆插拔、试管转移,以及马克笔和铅笔抓取等任务,均实现了连续自主运行 1 小时,期间无失败记录,也无人工接管情况。

这表明,经过对齐的仿真未来可能不仅是现实数据的补充,更将成为机器人训练经验的重要来源。

最后在评估层面。

由于机器人受限于物理世界的运行速度,每测试一个检查点(checkpoint),都需要重新布置场景、运行机器人并处理失败情况,成本高昂,所能覆盖的场景也极为有限。

相比之下,R2S2R 可以预先在数千种受控条件下主动寻找失败案例,提前筛除表现不佳的 checkpoint,仅将最具潜力的策略留给真实硬件进行测试。

这里的关键,并非要求仿真与现实的成功率完全一致,而是双方需得出相同的判断结论:

哪些策略更优,它们在何处成功或失败,以及训练中的提升能否真正迁移至硬件实体。

在 ALOHA 双臂方块交接任务中,团队测试了 GR00T N1.6 和 π₀.₅ 两种策略架构,以及不同的训练配置、ID 和 OOD 场景。每个 checkpoint 分别进行了 2000 次仿真试验和 100 次真机试验。

结果显示,在仿真中表现更优的 checkpoint,在真机上通常也表现更好。仿真不仅保持了不同策略之间的相对排名,也呈现出与现实相似的成功与失败分布。

更重要的是,这种对齐不仅仅体现在仿真画面看起来像现实。

团队会命令机器人在仿真和现实中执行完全相同的动作,再比对两边看到的画面、物体的反应及最终结果是否一致。

即便是在线缆、关节物体等极难模拟的任务中,也要尽可能复现真实的物理变化。

以方块交接为例,当方块放置在机器人不太熟悉的位置时,机械臂会抓得更靠近边缘,险些失手。这种“险些失败”的过程,不仅出现在真机上,也在仿真中被成功复现。

也就是说,仿真还原的不仅仅是机器人最终是成功还是失败,更能还原它走向成功或失败的内在逻辑。

这也意味着,R2S2R 可成为机器人开发中的高通量评估层,用于筛选 checkpoint、发现性能退化,并决定下一轮应补充何种数据。

World Labs 收购 SceniX

事实上,在正式发布 R2S2R 的前一周,World Labs 就已宣布收购 SceniX。

SceniX 是一家专注于机器人仿真、训练与评估的初创公司,其技术方向聚焦于将真实机器人任务搬入数字世界,使原本昂贵、缓慢甚至危险的数据采集与模型评估,能够在仿真中规模化完成。

SceniX 联合创始人李昀烛目前是哥伦比亚大学助理教授,曾在 MIT 获得博士学位,随后在斯坦福跟随李飞飞从事博士后研究。

有趣的是,这两家公司的合作并非始于这段师生关系。

起初,SceniX 只是 World Labs 生成式世界模型 Marble 的客户。直到李飞飞发现该公司由李昀烛创办,双方才进一步意识到彼此技术上的互补性,并启动了收购计划。

World Labs 擅长生成模型、计算机视觉及 3D 重建,能够从稀疏输入中快速生成具有空间一致性的世界;

SceniX 则更熟悉机器人、仿真、学习算法及硬件系统,知晓如何将这些世界真正应用于策略训练、评估与部署。

换句话说,前者解决“世界如何生成”,后者解决“机器人如何在此中学习”。

在 a16z 的访谈中,李昀烛表示,此次收购并不意味着 World Labs 要亲自制造机器人。

它们真正想建设的,是一套与机器人形态和模型架构解耦的基础设施:

无论客户使用的是单臂、双臂还是移动机器人,采用 VLA 还是 World Action Model,均可进入同一个数字世界进行训练与测试。

在未来,双方将围绕仿真、基础模型及动作条件模型逐步整合,并希望率先在仓库、实验室及电子装配等半结构化场景中,与客户完成真实部署验证。

参考链接

[1]https://www.worldlabs.ai/blog/real-to-sim-to-real

[2]https://www.worldlabs.ai/blog/taxonomy-of-world-models?utm_source=chatgpt.com

[3]https://x.com/drfeifei/status/2082137342824075357

相关推荐

最新文章