LeCun新作：分层世界模型，数据驱动的人型机器人控制

王林

发布时间：2024-06-04 15:43:01

808人浏览过

来源于51CTO.COM

转载

有了大模型作为智能上的加持，人型机器人已然成为新的风口。

科幻电影中「安能辨我不是人」的机器人似乎已经越来越近了。

不过，要想像人类一样思考和行动，对于机器人，特别是人型机器人来说，仍是个艰巨的工程问题。

就拿简单的学走路来说，利用强化学习来训练可能会演变成下面这样：

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

道理上没有什么问题（遵循奖励机制），上楼梯的目标也达到了，除了过程比较抽象，跟大部分人类的行为模式可能不太一样。

机器人之所以很难像人一样“自然”行动，原因在于观察和行动空间的高维性质，以及双足动物形态固有的不稳定性。

对此，LeCun参与的一项工作给出了基于数据驱动的全新解决方案。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

论文地址：https://arxiv.org/pdf/2405.18418

项目介绍：https://nicklashansen.com/rlpuppeteer

先看疗效：

LeCun新作：分层世界模型，数据驱动的人型机器人控制

对比右边的效果，新的方法训练出了更接近于人类的行为，虽然有点「丧尸」的意味，但抽象度降低了不少，至少在大部分人类的能力范围之内。

当然了，也有来捣乱的网友表示，「还是之前那个看着更有意思」。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

在这项工作中，研究人员探索了基于强化学习的、高度数据驱动的、视觉全身人形控制方法，没有任何简化的假设、奖励设计或技能原语。

作者提出了一个分层世界模型，训练高级和低级两个智能体，高级智能体根据视觉观察生成命令，供低级智能体执行。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

开源代码：https://github.com/nicklashansen/puppeteer

这个模型被命名为Puppeteer，利用一个模拟的56-DoF人形机器人，在8个任务中生成了高性能的控制策略，同时合成了自然的类似人类的动作，并具有穿越挑战性地形的能力。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

高维控制的分层世界模型

在物理世界中学习训练出通用的智能体，一直是AI领域研究的目标之一。

而人形机器人通过集成全身控制和感知，能够执行各种任务，于是作为多功能平台脱颖而出。

不过要模仿咱们这种高级动物，代价还是很大的。

比如下图中，人型机器人为了不踩坑，就需要准确地感知迎面而来的地板缝隙的位置和长度，同时仔细协调全身运动，使其有足够的动量和范围来跨越每个缝隙。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

Puppeteer基于LeCun在2022年提出的分层JEPA世界模型，是一种数据驱动的RL方法。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

它由两个不同的智能体组成：一个负责感知和跟踪，通过关节级控制跟踪参考运动；另一个「视觉木偶」（puppeteer），通过合成低维参考运动来学习执行下游任务，为前者的跟踪提供支持。

Puppeteer使用基于模型的RL算法——TD-MPC2，在两个不同的阶段独立训练两个智能体。

（ps：这个TD-MPC2就是文章开篇用来比较的那个动图，别看有点抽象，那实际上是之前的SOTA，发表在今年的ICLR，一作同样也是本文的一作。）

LeCun新作：分层世界模型，数据驱动的人型机器人控制

第一阶段，首先对用于跟踪的世界模型进行预训练，使用预先存在的人类动作捕捉数据作为参考，将运动转换为物理上可执行的动作。这个智能体可以保存起来，在所有下游任务中重复使用。

Q.AI视频生成工具

支持一分钟生成专业级短视频，多种生成方式，AI视频脚本，在线云编辑，画面自由替换，热门配音媲美真人音色，更多强大功能尽在QAI

下载

在第二阶段，训练一个木偶世界模型，该模型以视觉观察为输入，并根据指定的下游任务，整合另一个智能体提供的参考运动作为输出。

这个框架看上去大道至简：两个世界模型在算法上是相同的，只是在输入/输出上不同，并且使用RL进行训练，无需其他任何花里胡哨的东西。

与传统的分层RL设置不同的是，「木偶」输出的是末端执行器关节的几何位置，而不是目标的嵌入。

这使得负责跟踪的智能体易于在任务之间共享和泛化，节省整体计算占用的空间。

研究方法

研究人员将视觉全身人形控制，建模为一个由马尔可夫决策过程（MDP）控制的强化学习问题，该过程以元组（S，A，T，R，γ，∆）为特征，

其中S是状态，A是动作，T是环境转换函数， R是标量奖励函数， γ是折扣因子，∆是终止条件。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

如上图所示，研究人员使用RL在人类MoCap数据上预训练跟踪智能体，用于获取本体感觉信息和抽象参考运动输入，并合成跟踪参考运动的低级动作。

然后通过在线互动，对负责下游任务的高级木偶智能体进行训练，木偶接受状态和视觉信息输入，并输出命令供跟踪智能体执行。

TD-MPC2

TD-MPC2从环境交互中学习一个潜在的无解码器世界模型，并使用学习到的模型进行规划。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

世界模型的所有组件都是使用联合嵌入预测、奖励预测和时间差异损失的组合端到端学习的，而无需解码原始观察结果。

在推理过程中，TD-MPC2遵循模型预测控制（MPC）框架，使用模型预测路径积分（MPPI）作为无导数（基于采样）的优化器进行局部轨迹优化。

为了加快规划速度，TD-MPC2还事先学习了一个无模型策略，用于预启动采样程序。

两个智能体在算法上是相同的，都由以下6个组件组成：

LeCun新作：分层世界模型，数据驱动的人型机器人控制

实验

为了评估方法的有效性，研究人员提出了一种新的任务套件，使用模拟的56自由度人形机器人进行视觉全身控制，总共包含8个具有挑战性的任务，用于对比的方法包括SAC、DreamerV3以及TD-MPC2。

8个任务如下图所示，包括5个视觉条件全身运动任务，以及另外3个没有视觉输入的任务。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

任务的设计具有高度的随机性，包括沿着走廊奔跑、跳过障碍物和缝隙、走上楼梯以及绕过墙壁。

5个视觉控制任务都使用与线性前进速度成正比的奖励函数，而非视觉任务则奖励任何方向的位移。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

上图绘制了学习曲线。结果表明，SAC和DreamerV3在这些任务上无法实现有意义的性能。

TD-MPC2在奖励方面的性能与本文的方法相当，但会产生不自然的行为（参见下图中的抽象动作）。

LeCun新作：分层世界模型，数据驱动的人型机器人控制

此外，为了证明Puppeteer生成的动作确实更「自然」，本文还进行了人类偏好的实验，对46名参与者的测试表明，人类普遍喜欢本文方法生成的运动。

CanvaAI如何导入素材设计_Canva素材管理方法【指南】

AdobeFirefly如何生成背景图_AdobeFirefly背景制作方法【指南】

FigmaAI如何生成设计文案_Figma文本生成技巧【解答】

Murf AI音频情绪控制怎么调整_参数设置方法是什么【技巧】

如何零基础学会用AI制作专属手机铃声利用Suno AI创作个性化旋律

驱动精灵

驱动精灵基于驱动之家十余年的专业数据积累，驱动支持度高，已经为数亿用户解决了各种电脑驱动问题、系统故障，是目前有效的驱动软件，有需要的小伙伴快来保存下载体验吧！

下载

相关专题

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4086

2026.01.21

页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章，大家可以免费体验。

494

2023.08.14

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2904

2024.08.16

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

216

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

412

2026.03.04