洱海新闻

李飞飞的世界模型,终于开始训练机器人了

来源:洱海新闻 分类:科技
李飞飞的世界模型,终于开始训练机器人了

henry 来自 凹非寺

量子位 | 公众号 QbitAI

李飞飞教授的World Labs,增添了一块关键组件。

此刻,得益于新并购的机器人企业SceniX,World Labs推出了全新机器人策略训练与评估系统——

Real-to-sim-to-real (R2S2R) 。

这个系统将World Labs在空间智能领域的经营范围,从生成可互动的虚拟环境,进一步拓展到真实机器人的训练、评估及部署,并首次实现了从仿真训练到真实执行的完整链条。

系统内部,R2S2R可以分解为Real-to-Sim和Sim-to-Real两个模块。

Real-to-Sim模块承担的任务是把实际中的机器人、传感器、物体和交互流程转化到仿真平台中,建立与实际任务完全匹配的虚拟场景。

Sim-to-Real模块则让机器人在虚拟空间内完成训练和测试,随后将策略直接转移回实际环境。

李飞飞教授在社交平台上谈道,采用这种训练方法得到的策略,即便从未接触过实际环境数据,依然能够连续自主运行1小时,无需人工辅助。

不仅如此,R2S2R让机器人策略的测试过程实现了可规模化扩张。

通过让策略在仿真与真实环境中的运行路径保持一致,真实世界中成功或失败的结果及其相应条件,都能在虚拟环境中被完整复现和深入分析。

可以说,R2S2R不仅打通了世界模型从创造世界,到训练、检验、部署机器人的全流程闭环,也完善了李飞飞先前提出的模型三分法中的核心部分——

仿真器。

在她的经典分类里,世界模型具有三种主要作用:渲染器生成可视化内容,仿真器模拟世界状态变化,规划器负责决策行动。

而R2S2R的贡献在于,使得World Labs构建的世界从“视觉上逼真”,转变为机器人可以真实进入、相互作用、进行学习的训练基地。

要想把具身智能实现规模化,首先得把机器人学习的世界扩展

那么,为何要让机器人的学习范围扩展,并且选择在仿真环境中进行?

在发布的博客文章中,World Labs阐述了自己的观点:

目前机器人技术的主要障碍,已经不再局限于模型架构,而在于无法以有效方式获取可扩展的经验并进行评估。

一方面,真实环境中的物体位置、光线条件、物理属性以及互动行为随时都在变化。

为了让机器人可以顺利进入实际应用,必须事先覆盖足够多样化的场景,并反复检验其在不同条件下成功的可能性和失败的模式。

另一方面,与大模型训练依赖的互联网数据不同,机器人的每一条经验都需要在实际中产生。

每一轮实验都要消耗硬件资源,需要人工完成物体复位、故障恢复和系统维护工作。即使拥有大批量人类拍摄的视频资料,也很难覆盖所有不同的环境条件、物体特性、机器人状态和失败场景。

因此,仿真的主要价值,不只是“节省获取数据的成本”,更在于能够主动创造在现实里既昂贵、危险或难以重复模拟的情况,让机器人可以在其中多次尝试成功和失败。

但以往的仿真技术存在明显局限。

它不仅需要为每一个实际任务单独建立环境,成本高昂且效率低下,而且虚拟与真实之间的视觉表现、几何形态及物理动态往往存在显著偏差。

关键在于,机器人在仿真中学到的策略,在实际应用中未必有效;仿真环境下的测试结果,也常常无法准确预测真实世界里的表现。

基于这些问题,World Labs设计了从现实到仿真再到现实训练(R2S2R)的仿真系统,用于机器人策略的训练和测试。

Real-to-Sim部分负责将现实中的机器人、传感器、物体和互动行为转化为与任务一致的虚拟环境。不仅要求还原世界的视觉呈现,还需尽可能保留机器人与物体交互时的运动表现和物理响应。

Sim-to-Real部分则利用这些虚拟环境完成策略训练和测试,识别模型容易遭遇的失败情境,并判断虚拟测试的表现能否有效迁移至真实设备。

这两部分结合起来,形成了一个完整的闭环流程:

从现实环境中提取任务需求,在仿真平台中大规模生成经验、训练并发现失败点,然后将策略部署至现实场景;而现实环境中的新数据,又会进一步修正世界模型、训练资料和机器人策略。

相关推荐