0

0

李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

花韻仙語

花韻仙語

发布时间:2024-11-15 14:24:02

|

639人浏览过

|

来源于ZAKER

转载

大模型的具身智能决策能力,终于有系统的通用评估基准了。

李飞飞吴佳俊团队新提出的评估框架,对具身智能决策的四项关键子能力来了个全面检查。

这套基准已经被选为了 NeurIPS 数据和测试集(D&B)专栏 Oral 论文,同时也被收录进了 PyPI,只要一行代码就能快速调用。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

该框架名为Embodied Agent Interface(简称 EAI),提供了连接不同模块和基准环境的标准接口。

利用这套框架,作者对 18 款主流模型进行了测试,形成了一篇超百页的论文。

测试结果显示,在已公开的大模型当中,o1-preview 的综合成绩位列第一。

李飞飞本人表示,对这项合作研究感到非常兴奋。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

有网友评价说,这项成果为大模型具身智能决策塑造了未来。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

四项子能力全面评估

首先,EAI 提供了一种统一的目标表示方法,能够兼容不同类型的目标,并支持复杂约束的描述。

团队认为,现有的具身决策任务通常针对特定领域设计目标,缺乏一致性和通用性。

例如,BEHAVIOR 和 VirtualHome 都是具身智能体的评测基准和模拟环境,用于研究智能体在复杂环境中完成任务的能力。

但二者又有所区别,BEHAVIOR 使用基于状态的目标,而 VirtualHome 使用时间扩展的目标。

EAI 则通过引入线性时态逻辑(LTL),实现了目标表示方式的统一,提高了模块之间的互操作性,便于比较不同模型在同一任务上的表现。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

在具体的评估过程当中,EAI 采用了模块化的评估方式,并将评估指标进行了更细粒度的划分。

以往的研究通常将大模型作为整体进行评估,很少关注其在具身决策各个子任务上的表现;

同时,这些现有基准通常只关注任务的最终成功率,很少深入分析模型的错误类型和原因。

为了更深入理解大模型的行为模式和优劣势分布,EAI 提出了四个关键能力模块,并设计了一系列细粒度的评估指标:

将模型能力分为四个关键模块;

定义了清晰的输入输出接口;

从轨迹可执行性、目标满足度、逻辑匹配性等多个角度评估模型的性能;

引入了丰富的注释(如目标状态、关系、动作),以实现自动化的错误分析。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

具体来说,四个关键模块及内容分别是:

目标解释(Goal Interpretation):将自然语言表述的任务目标转化为形式化的 LTL 目标公式;

子目标分解(Subgoal Decomposition):将任务目标分解为一系列子目标,每个子目标也用 LTL 公式表示;

美图AI开放平台
美图AI开放平台

美图推出的AI人脸图像处理平台

下载

动作序列规划(Action Sequencing):根据任务目标生成动作序列,在环境中执行以达成目标状态;

转换建模(Transition Modeling):为每个动作或操作符生成前提条件和效果,形成环境转换模型。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

另外,EAI 选取了两个具有代表性但特点迥异的环境,也就是前面提到的 BEHAVIOR 和 VirtualHome。

相比于单一环境评估,EAI更能考察大模型跨领域的泛化能力,有助于全面理解其适用范围和局限性。

o1-preview 综合成绩第一

利用 EAI 这套标准,研究团队对 GPT、Claude、Gemini 等 18 款主流模型(型号)的决策能力进行了评估。

在 BEHAVIOR 和 VirtualHome 环境下,o1-preview 均获得了排行榜综合成绩第一名。

其中在 BEHAVIOR 环境中,o1-preview 得分为 74.9,比第二名的 Claude 3.5 Sonnet 高了 10 多分,排在之后的是 60 分左右的 Claude 3 Opus 和 GPT-4o。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

到了 VirtualHome 环境下,依然是 o1-preview 领先,但前三名的成绩相对接近。

同时 Gemini 1.5 Pro 变成了第二名,不过整体来看排行靠前的几个模型和 BEHAVIOR 环境类似。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

当然如果比较单项能力,不同模型也体现出了各自不同的优势项目。

比如在 BEHAVIOR 环境中,总分排第二的 Claude 3.5 Sonnet,目标解释能力略高于总分排第一的 o1-preview。

在 VirtualHome 环境中,总分相对靠后的 Mistral Large,在动作序列规划上取得了第一名。

 李飞飞吴佳俊团队新作:推出具身智能决策能力评价基准,o1-preview 登顶

作者还对各模型的失败情况进行了深入分析,发现了将中间状态误识别为最终目标状态、对隐含的物理关系理解不足、忽略重要的前提条件等具体问题。

这些发现能够让研究人员对模型的优缺陷进行更深层的了解,为之后的研究提供了重要参考。

项目主页:

https://embodied-agent-interface.github.io/

论文:

https://arxiv.org/abs/2410.07166

代码:

https://github.com/embodied-agent-interface/embodied-agent-interface

数据集:

https://huggingface.co/datasets/Inevitablevalor/EmbodiedAgentInterface

相关专题

更多
硬盘接口类型介绍
硬盘接口类型介绍

硬盘接口类型有IDE、SATA、SCSI、Fibre Channel、USB、eSATA、mSATA、PCIe等等。详细介绍:1、IDE接口是一种并行接口,主要用于连接硬盘和光驱等设备,它主要有两种类型:ATA和ATAPI,IDE接口已经逐渐被SATA接口;2、SATA接口是一种串行接口,相较于IDE接口,它具有更高的传输速度、更低的功耗和更小的体积;3、SCSI接口等等。

1023

2023.10.19

PHP接口编写教程
PHP接口编写教程

本专题整合了PHP接口编写教程,阅读专题下面的文章了解更多详细内容。

66

2025.10.17

php8.4实现接口限流的教程
php8.4实现接口限流的教程

PHP8.4本身不内置限流功能,需借助Redis(令牌桶)或Swoole(漏桶)实现;文件锁因I/O瓶颈、无跨机共享、秒级精度等缺陷不适用高并发场景。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

439

2025.12.29

go中interface用法
go中interface用法

本专题整合了go语言中int相关内容,阅读专题下面的文章了解更多详细内容。

76

2025.09.10

css3transition
css3transition

css3transition属性用于指定如何从一个CSS样式过渡到另一个CSS样式,本专题为大家提供transition相关的文章、相关下载和相关课程,大家可以免费体验。

230

2023.06.27

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1989

2024.08.16

PHP 命令行脚本与自动化任务开发
PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境(CLI)下的开发与应用,内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理,以及与 Linux 定时任务(Cron)的结合使用。通过实战示例,帮助开发者掌握使用 PHP 构建 自动化脚本、批处理工具与后台任务程序 的能力。

28

2025.12.13

高德地图升级方法汇总
高德地图升级方法汇总

本专题整合了高德地图升级相关教程,阅读专题下面的文章了解更多详细内容。

68

2026.01.16

全民K歌得高分教程大全
全民K歌得高分教程大全

本专题整合了全民K歌得高分技巧汇总,阅读专题下面的文章了解更多详细内容。

127

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Node.js 教程
Node.js 教程

共57课时 | 8.9万人学习

PostgreSQL 教程
PostgreSQL 教程

共48课时 | 7.4万人学习

Django 教程
Django 教程

共28课时 | 3.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号