0

0

机器人学会转笔、盘核桃了!GPT-4加持,任务越复杂,表现越优秀

WBOY

WBOY

发布时间:2023-10-23 08:21:28

|

1752人浏览过

|

来源于51CTO.COM

转载

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

机器人学会转笔、盘核桃了!GPT-4加持,任务越复杂,表现越优秀

大数据文摘出品

家人们,继人工智能(ai)攻占象棋、围棋、dota之后,转笔这一技能也被 ai 机器人学会了。

机器人学会转笔、盘核桃了!GPT-4加持,任务越复杂,表现越优秀

上面这个笔转的贼溜的机器人,得益于名叫Eureka的智能体(Agent),是来自英伟达、宾夕法尼亚大学、加州理工学院和得克萨斯大学奥斯汀分校的一项研究。

得Eureka“指点”后的机器人还可以打开抽屉和柜子、扔球和接球,或者使用剪刀。据英伟达介绍,Eureka有10种不同的类型,可执行29种不同的任务。

要知道在之前,单就转笔这一功能,仅靠人类专家手工编程,是无法如此顺滑的实现的。

机器人学会转笔、盘核桃了!GPT-4加持,任务越复杂,表现越优秀

机器人盘核桃

而Eureka 能够自主编写奖励算法来训练机器人,且码力强劲:自编的奖励程序在 83% 的任务中超越了人类专家,能使机器人的性能平均提升52%。

Eureka开创了一种从人类反馈中无梯度学习的新途径,它能够轻松吸收人类提供的奖励和文字反馈,从而进一步完善自己的奖励生成机制。

具体而言,Eureka 利用了 OpenAI 的 GPT-4 来编写用于机器人的试错学习的奖励程序。这意味着该系统并不依赖于人类特定任务的提示或预设的奖励模式。

Eureka 通过在 Isaac Gym 中使用 GPU 加速的仿真,能够快速评估大量候选奖励的优劣,从而实现更有效率的训练。接着,Eureka 会生成训练结果的关键统计信息摘要,并指导 LLM(Language Model,语言模型)改进奖励函数的生成。通过这种方式,AI 智能体能够独立地改善对机器人的指令。

机器人学会转笔、盘核桃了!GPT-4加持,任务越复杂,表现越优秀

Eureka的框架

研究人员还发现,任务越复杂,GPT-4 的指令就越能优于所谓的"奖励工程师"的人类指令。参与该研究的研究员甚至称 Eureka 为“超人类奖励工程师”。

Eureka 成功地弥补了高层推理(编码)和低层运动控制之间的鸿沟。其采用了一种被称为 "混合梯度架构":一个纯推理的黑盒子 LLM(Language Model,语言模型)引导一个可学习的神经网络。在这个架构中,外层循环运行 GPT-4 来优化奖励函数(无梯度),而内层循环则运行强化学习以训练机器人的控制器(基于梯度)。

ModelGate
ModelGate

一站式AI模型管理与调用工具

下载

——NVIDIA的高级研究科学家Linxi "Jim" Fan

Eureka 可以整合人类的反馈,以便更好地调整奖励,使其更符合开发者的期望。Nvidia 把这个过程称为"in-context RLHF"(从人类反馈中进行上下文学习)

值得注意的是,Nvidia 的研究团队已经开源了 Eureka 的 AI 算法库。这将使得个人和机构能够通过 Nvidia Isaac Gym 来探索和实验这些算法。Isaac Gym 是建立在 Nvidia Omniverse 平台上的,这是一个基于 Open USD 框架用于创建 3D 工具和应用程序的开发框架。

机器人学会转笔、盘核桃了!GPT-4加持,任务越复杂,表现越优秀

  • 论文链接:https://arxiv.org/pdf/2310.12931.pdf
  • 项目链接:https://eureka-research.github.io/
  • 代码链接:https://github.com/eureka-research/Eureka

如何评价?

在过去的十年中,强化学习取得了巨大的成功,但我们必须承认其中仍存在持续的挑战。之前虽然有尝试引入类似的技术,但与使用语言模型(LLM)来辅助奖励设计的 L2R(Learning to Reward)相比,Eureka 更为突出,因为它消除了特定任务提示的需要。Eureka 之所以能比 L2R 更出色,是因为它能够创建自由表达的奖励算法,并利用环境源代码作为背景信息。

英伟达的研究团队进行了一项调查,以探索在使用人类奖励函数启动时,是否能提供一些优势。实验的目的是想看看是否你们能顺利地用初始 Eureka 迭代的输出替代原始的人类奖励函数。

机器人学会转笔、盘核桃了!GPT-4加持,任务越复杂,表现越优秀

在测试中,英伟达的研究团队在每个任务的情境下,使用相同的强化学习算法和相同的超参数对所有最终奖励函数进行了优化。为了测试这些特定任务的超参数是否经过良好调整以确保人工设计的奖励的有效性,他们采用了经过充分调整的近端策略优化(PPO)实现,这个实现基于之前的工作,没有进行任何修改。对于每个奖励,研究人员进行了五次独立的 PPO 训练运行,并报告了策略检查点达到的最大任务指标值的平均值,作为奖励性能的度量。

结果显示:人类设计者通常对相关状态变量有很好的理解,但在设计有效奖励方面可能缺乏一定的熟练度。

Nvidia 的这项开创性研究在强化学习和奖励设计领域开辟了新的疆界。他们的通用奖励设计算法 Eureka 利用了大型语言模型和上下文进化搜索的力量,能够在广泛的机器人任务领域生成人类水平的奖励,而无需特定任务提示或人工干预,这在很大程度上改变了我们对 AI 和机器学习的理解。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
github中文官网入口 github中文版官网网页进入
github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started,GitHub 是一种基于云的平台,可在其中存储、共享并与他人一起编写代码。 通过将代码存储在GitHub 上的“存储库”中,你可以: “展示或共享”你的工作。 持续“跟踪和管理”对代码的更改。

4290

2026.01.21

页面置换算法
页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章,大家可以免费体验。

500

2023.08.14

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2917

2024.08.16

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

25

2026.03.13

Python异步编程与Asyncio高并发应用实践
Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开,深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例,帮助开发者掌握 Python 在高并发场景中的高效开发方法,并提升系统资源利用率与整体运行性能。

43

2026.03.12

C# ASP.NET Core微服务架构与API网关实践
C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开,系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例,帮助开发者掌握构建高可用微服务系统的关键技术,提高系统的可扩展性与维护效率。

174

2026.03.11

Go高并发任务调度与Goroutine池化实践
Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开,系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示,帮助开发者构建稳定高效的 Go 并发任务处理系统,提高系统在高负载环境下的处理能力与稳定性。

50

2026.03.10

Kotlin Android模块化架构与组件化开发实践
Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开,重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析,帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系,提升团队协作效率与项目迭代速度。

92

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践
JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开,系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理,以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例,帮助开发者理解浏览器底层工作原理,并掌握提升网页加载速度与交互体验的实用技巧。

102

2026.03.06

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
光速学会docker容器
光速学会docker容器

共33课时 | 2.1万人学习

AI绘画教程
AI绘画教程

共2课时 | 0.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号