多模态版Llama2上线，Meta发布AnyMAL

WBOY

发布时间：2023-10-03 17:17:01

1078人浏览过

来源于机器之心

转载

在多个基准测试中均刷新了业界最好的 zero-shot 性能。

一个统一的模型，可以对不同模态输入内容（文本、图像、视频、音频、IMU 运动传感器数据）实现理解，并生成文本响应，技术基于 Llama 2，来自 Meta。

昨天，多模态大模型 AnyMAL 的研究吸引了 AI 研究社区的关注。

大型语言模型（LLM）以其巨大的规模和复杂性而闻名，它极大地增强了机器理解和表达人类语言的能力。LLM 的进步使视觉语言领域有了显著进步，弥合了图像编码器和 LLM 之间的差距，将它们的推理能力结合起来。先前的多模态 LLM 研究集中在结合文本和另一种模态的模型上，如文本和图像模型，或者集中在非开源的专有语言模型上。

如果有一种更好的方法能够实现多模态功能，将各种模态能够嵌入在LLM中使用，这会给我们带来不同的体验吗？

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

多模态版Llama2上线，Meta发布AnyMAL

^输出示例

为了解决这个问题，来自Meta的研究人员最近推出了AnyMAL（Any-Modality Augmented Language Model）。这是一个经过训练的多模态编码器集合，可以将来自各种模态（包括图像、视频、音频和IMU运动传感器数据）的数据转换为LLM的文本嵌入空间

多模态版Llama2上线，Meta发布AnyMAL

论文地址：https://huggingface.co/papers/2309.16058

根据说明，该研究的主要贡献如下所示：

为构建多模态 LLM 提出了一种高效、可扩展的解决方案。本文提供了在大型数据集上预先训练的投影层，这些数据集包含多种模态（例如，2 亿张图像、220 万段音频、50 万 IMU 时间序列、2800 万段视频），所有数据集都与同一个大模型（LLaMA-2- 70B-chat）对齐，从而实现了交错式多模态上下文提示。
本研究使用跨三种模式（图像、视频和音频）的多模态指令集对模型进行了进一步微调，涵盖了简单问答（QA）领域以外的各种不受限制的任务。该数据集包含高质量的人工收集指令数据，因此本研究将其作为复杂多模态推理任务的基准
本文最佳模型在各种任务和模式的自动和人工评估中取得了很好的零误差性能，相较于现有文献中的模型，在 VQAv2 上的相对准确率提高了7.0%，在零误差 COCO 图像字幕上提高了8.4% 的 CIDEr，在 AudioCaps 上提高了14.5% 的 CIDEr，创造了新的 SOTA

方法

^方法概览

预训练模态对齐的内容需要进行改写

通过使用配对的多模态数据（包括特定的模态信号和文本叙述），本研究对LLM进行了预训练，以实现多模态理解能力，如图2所示。具体而言，我们为每个模态训练了一个轻量级适配器，将输入信号投射到特定LLM的文本标记嵌入空间中。这样，LLM的文本标记嵌入空间就变成了一个联合的标记嵌入空间，其中标记可以代表文本或其他模态

关于图像对齐的研究，我们使用了LAION-2B数据集的一个干净子集，并采用了CAT方法进行过滤，对任何可检测到的人脸进行了模糊处理。而对于音频对齐的研究，则使用了AudioSet（2.1M）、AudioCaps（46K）和CLOTHO（5K）数据集。此外，我们还使用了Ego4D数据集进行IMU和文本的对齐（528K）

对于大型数据集，要将预训练扩展到70B参数模型需要大量资源，通常需要使用FSDP封装器在多个GPU上对模型进行分片。为了有效地扩展训练规模，本文在多模态设置中实施了量化策略（4位和8位），其中冻结了模型的LLM部分，只有模态tokenizer是可训练的。这种方法将内存需求缩小了一个数量级。因此，70B AnyMAL能够在单个80GB VRAM GPU上就完成训练，batch size为4。与FSDP相比，本文提出的量化方法只使用了GPU资源的一半，却实现了相同的吞吐量

利用多模态指令数据集进行微调的意思是使用多种模态的指令数据集来进行微调

为了进一步提高模型对不同输入模态的指令跟随能力，研究利用多模态指令调整（MM-IT）数据集进行了额外的微调。具体来说，我们将输入连接为 [ 多模态版Llama2上线，Meta发布AnyMAL ]，这样响应目标就同时以文本指令和模态输入为基础。研究对以下两种情况进行消减：（1）在不改变 LLM 参数的情况下训练投影层；或（2）使用低级适应（Low-Rank Adaptation）进一步调整 LM 行为。研究同时使用人工收集的指令调整数据集和合成数据。

Joker AIx

一站式AI创意生产平台，覆盖图像、视频、音频、文案全品类创作

下载

实验及结果

图像标题生成是一种人工智能技术，用于自动为图像生成相应的标题。这项技术结合了计算机视觉和自然语言处理的方法，通过分析图像的内容和特征，以及对语义和语法的理解，生成与图像相关的描述性标题。图像标题生成在许多领域有广泛的应用，包括图像搜索、图像标注、图像检索等。通过自动化生成标题，可以提高图像的可理解性和搜索引擎的准确性，为用户提供更好的图像检索和浏览体验

表 2 显示了在 COCO 和标有「详细描述」任务（MM-IT-Cap）的 MM-IT 数据集子集上的零样本图像字幕生成性能。可以看出， AnyMAL 变体在这两个数据集上的表现都明显优于基线。值得注意的是，AnyMAL-13B 和 AnyMAL-70B 变体的性能没有明显差距。这一结果表明，底层 LLM 能力对图像标题生成是一种人工智能技术，用于自动为图像生成相应的标题。这项技术结合了计算机视觉和自然语言处理的方法，通过分析图像的内容和特征，以及对语义和语法的理解，生成与图像相关的描述性标题。图像标题生成在许多领域有广泛的应用，包括图像搜索、图像标注、图像检索等。通过自动化生成标题，可以提高图像的可理解性和搜索引擎的准确性，为用户提供更好的图像检索和浏览体验任务的影响较小，但在很大程度上取决于数据规模和配准方法。

多模态版Llama2上线，Meta发布AnyMAL

需要进行的重写是：对多模态推理任务进行人工评估

图 3 显示，与基线（LLaVA：34.4% 的胜率和 MiniGPT4：27.0% 的胜率）相比，AnyMAL 性能强劲，与人工标注的实际样本的差距较小（41.1% 的胜率）。值得注意的是，使用完整指令集微调的模型表现出最高的优先胜率，显示出与人类标注的响应相当的视觉理解和推理能力。还值得注意的是，BLIP-2 和 InstructBLIP 在这些开放式查询中表现不佳（分别为 4.1% 和 16.7% 的优先胜出率），尽管它们在公开的 VQA 基准测试中表现出色（见表 4）。

VQA 基准

在表4中，我们展示了在Hateful Meme数据集、VQAv2、TextVQA、ScienceQA、VizWiz和OKVQA上的零样本性能，并与文献中报告的各自基准上的零样本结果进行了比较。我们的研究重点放在零样本评估上，以便在推理时最准确地估计模型在开放式查询上的性能

多模态版Llama2上线，Meta发布AnyMAL

视频 QA 基准

如表 6 所示，研究在三个具有挑战性的视频 QA 基准上对模型进行了评估。

多模态版Llama2上线，Meta发布AnyMAL

重新生成音频字幕

表 5 显示了 AudioCaps 基准数据集上的重新生成音频字幕结果。AnyMAL 的表现明显优于文献中其他最先进的音频字幕模型（例如，CIDEr +10.9pp，SPICE +5.8pp），这表明所提出的方法不仅适用于视觉，还适用于各种模态。与 7B 和 13B 变体相比，文本 70B 模型表现出了明显的优势。

多模态版Llama2上线，Meta发布AnyMAL

有趣的是，根据从AnyMAL论文提交的方式、类型和时间推测，Meta似乎计划通过其新推出的混合现实/元宇宙头显来收集多模态数据。这些研究成果可能会被整合到Meta的元宇宙产品线中，或者很快应用于消费级应用中

更多详细内容请阅读原文。

Yu-Gi-Oh!卡牌构筑深度指南：策略、角色与Meta分析

AI裁员潮真相揭秘：企业裁员背后的真实原因与应对策略

Meta AI Chatbot风波：退休老人深陷AI情网去世

AI深度探索：Meta AI研究突破与未来应用洞察

Meta SAM：AI图像分割新纪元，零样本学习颠覆传统

相关专题

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2912

2024.08.16

传感器故障解决方法

传感器故障排除指南：识别故障症状（如误读或错误代码）。检查电源和连接（确保连接牢固，无损坏）。校准传感器（遵循制造商说明）。诊断内部故障（目视检查、信号测试、环境影响评估）。更换传感器（选择相同规格，遵循安装说明）。验证修复（检查信号准确性，监测异常行为）。

498

2024.06.04

什么是搜索引擎

搜索引擎是一种互联网工具，用于帮助用户在网上查找信息。搜索引擎的目标是提供最准确、最有价值的搜索结果，使用户能够快速找到所需的信息。本专题为大家提供搜索引擎相关的各种文章、以及下载和课程。

490

2023.08.02

有哪些目录搜索引擎

目录搜索引擎有Google、Bing、Yahoo、Baidu、DuckDuckGo等。想了解更多目录搜索引擎的相关内容，可以阅读本专题下面的文章。

6480

2023.11.06

搜索引擎营销的主要模式

搜索引擎营销的主要模式包括：1. 竞价排名（ppc）；2. 搜索引擎优化（seo）；3. 本地搜索营销；4. 购物广告；5. 视频广告；6. 展示广告；7. 社交媒体营销；8. 移动广告。想了解更多搜索引擎营销的相关内容，可以阅读本专题下面的文章。

473

2024.05.20

PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境（CLI）下的开发与应用，内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理，以及与 Linux 定时任务（Cron）的结合使用。通过实战示例，帮助开发者掌握使用 PHP 构建自动化脚本、批处理工具与后台任务程序的能力。

2025.12.13

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

热门下载

网站特效

网站源码

网站素材

前端模板