从BERT到ChatGPT，百页综述梳理预训练大模型演变史

WBOY

发布时间：2023-04-12 16:19:05

1612人浏览过

来源于51CTO.COM

转载

所有的成功都有迹可循，ChatGPT 也不例外。

前不久，因为对 ChatGPT 的评价过于苛刻，图灵奖得主 Yann LeCun 被送上了热搜。

在他看来，「就底层技术而言，ChatGPT 并没有什么特别的创新，」也不是「什么革命性的东西」。许多研究实验室正在使用同样的技术，开展同样的工作。更重要的是，ChatGPT 及其背后的 GPT-3 在很多方面都是由多方多年来开发的多种技术组成的，是不同的人数十年贡献的结果。因此，LeCun 认为，与其说 ChatGPT 是一个科学突破，不如说它是一个像样的工程实例。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

「ChatGPT 是否具有革命性」是个充满争议的话题。但毋庸置疑，它确实是在此前积累的多项技术的基础上构建起来的，比如核心的 Transformer 是谷歌在几年前提出来的，而 Transformer 又受到了 Bengio 关于注意力概念的工作的启发。如果再往前追溯，我们还能链接到更古早的几十年前的研究。

当然，公众可能体会不到这种循序渐进的感觉，毕竟不是谁都会一篇一篇去看论文。但对于技术人员来说，了解这些技术的演进过程还是非常有帮助的。

在最近的一篇综述文章中，来自密歇根州立大学、北京航空航天大学、理海大学等机构的研究者仔细梳理了该领域的几百篇论文，主要聚焦文本、图像和图学习领域的预训练基础模型，非常值得一读。杜克大学教授、加拿大工程院院士裴健，伊利诺大学芝加哥分校计算机科学系特聘教授俞士纶（Philip S. Yu），Salesforce AI Research 副总裁熊蔡明都是该论文作者之一。

论文链接：https://arxiv.org/pdf/2302.09419.pdf

论文目录如下：

在海外社交平台上，DAIR.AI 联合创始人Elvis S.推荐了这篇综述并获得了一千多的点赞量。

AI Web Designer

AI网页设计师，快速生成个性化的网站设计

下载

引言

预训练基础模型（PFM）是大数据时代人工智能的重要组成部分。「基础模型」的名字来源于 Percy Liang、李飞飞等人发布的一篇综述 ——《On the Opportunities and Risks of Foundation Models》，是一类模型及其功能的总称。在 NLP、CV 和图学习领域，PFM 已经得到了广泛研究。在各种学习任务中，它们表现出了强大的特征表示学习潜力，如文本分类、文本生成、图像分类、目标检测和图分类等任务。无论是用大型数据集在多个任务上训练，还是在小规模任务上进行微调，PFM 都表现出了优越的性能，这使其快速启动数据处理成为可能。

PFM 和预训练

PFM 基于预训练技术，其目的是利用大量的数据和任务来训练一个通用模型，该模型可以在不同的下游应用中很容易地进行微调。

预训练的想法起源于 CV 任务中的迁移学习。但看到该技术在 CV 领域的有效性后，人们也开始利用该技术提高其他领域的模型性能。

当预训练技术应用于 NLP 领域时，经过良好训练的语言模型可以捕捉到对下游任务有益的丰富知识，如长期依赖关系、层次关系等。此外，预训练在 NLP 领域的显著优势是，训练数据可以来自任何未标记的文本语料库，也就是说，几乎存在着无限量的训练数据可以用于预训练过程。早期的预训练是一种静态技术，如 NNLM 和 Word2vec，但静态方法很难适应不同的语义环境。因此，人们提出了动态预训练技术，如 BERT、XLNet 等。图 1 描述了 PFM 在 NLP、CV 和 GL 领域的历史和演变。基于预训练技术的 PFM 使用大型语料库来学习通用语义表征。随着这些开创性工作的引入，各种 PFM 已经出现，并被应用于下游的任务和应用。

最近走红的 ChatGPT 是 PFM 应用的典型案例。它是从生成性预训练 transformer 模型 GPT-3.5 中微调出来的，该模型利用了大量本文和代码进行训练。此外，ChatGPT 还应用了来自人类反馈的强化学习（RLHF），这已经成为让大型 LM 与人类意图保持一致的一种有希望的方式。ChatGPT 卓越的性能表现可能会给每种类型的 PFM 的训练范式带来转变，比如指令对齐技术、强化学习、prompt tuning 和思维链的应用，从而走向通用人工智能。

本文将重点放在文本、图像和图领域的 PFM，这是一个相对成熟的研究分类方法。对于文本来说，它是一个多用途的 LM，用于预测序列中的下一个单词或字符。例如，PFM 可用于机器翻译、问答系统、主题建模、情感分析等。对于图像，它类似于文本上的 PFM，使用巨大的数据集来训练一个适合许多 CV 任务的大模型。对于图来说，类似的预训练思路也被用于获得 PFM，这些 PFM 被用于许多下游任务。除了针对特定数据域的 PFM，本文还回顾并阐述了其他一些先进的 PFM，如针对语音、视频和跨域数据的 PFM，以及多模态 PFM。此外，一场能够处理多模态任务的的 PFM 的大融合正在出现，这就是所谓的 unified PFM。作者首先定义了 unified PFM 的概念，然后回顾了最近研究中达到 SOTA 的 unified PFM（如 OFA、UNIFIED-IO、FLAVA、BEiT-3 等）。

根据上述三个领域现有的 PFM 的特点，作者得出结论，PFM 有以下两大优势。首先，要想提高在下游任务中的性能，模型只需要进行很小的微调。其次，PFM 已经在质量方面得到了审查。我们可以将 PFM 应用于任务相关的数据集，而不是从头开始构建模型来解决类似的问题。PFM 的广阔前景激发了大量的相关工作来关注模型的效率、安全性和压缩等问题。

论文贡献与结构

在这篇文章发布之前，已经有几篇综述回顾了一些特定领域的预训练模型，如文本生成、视觉 transformer、目标检测。

《On the Opportunities and Risks of Foundation Models》总结了基础模型的机会和风险。然而，现有的工作并没有实现对不同领域（如 CV、NLP、GL、Speech、Video）PFM 在不同方面的全面回顾，如预训练任务、效率、效力和隐私。在这篇综述中，作者详细阐述了 PFM 在 NLP 领域的演变，以及预训练如何迁移到 CV 和 GL 领域并被采用。

与其他综述相比，本文没有对所有三个领域的现有 PFM 进行全面的介绍和分析。与对先前预训练模型的回顾不同，作者总结了现有的模型，从传统模型到 PFM，以及三个领域的最新工作。传统模型强调的是静态特征学习。动态 PFM 对结构进行了介绍，这是主流的研究。

作者进一步介绍了 PFM 的一些其他研究，包括其他先进和统一的 PFM、模型的效率和压缩、安全以及隐私。最后，作者总结了未来的研究挑战和不同领域的开放问题。他们还在附录 F 和 G 中全面介绍了相关的评价指标和数据集。

总之，本文的主要贡献如下：

对 PFM 在 NLP、CV 和 GL 中的发展进行了详实和最新的回顾。在回顾中，作者讨论并提供了关于这三个主要应用领域中通用 PFM 的设计和预训练方法的见解；
总结了 PFM 在其他多媒体领域的发展，如语音和视频。此外，作者还讨论了关于 PFM 的前沿话题，包括统一的 PFM、模型效率和压缩，以及安全和隐私。
通过对各种模式的 PFM 在不同任务中的回顾，作者讨论了大数据时代超大型模型未来研究的主要挑战和机遇，这指导了新一代基于 PFM 的协作和互动智能。

各个章节的主要内容如下：

论文第 2 章介绍了 PFM 的一般概念架构。

第 3、4、5 章分别总结了 NLP、CV 和 GL 领域中现有的 PFM。

第 6、7 章介绍了 PFM 的其他前沿研究，包括前沿和统一的 PFM、模型效率和压缩，以及安全和隐私。

第 8 章总结了 PFM 的主要挑战。第 9 章对全文进行了总结。

aishort提示生成失败怎么办_aishort常见报错处理办法【解答】

WorkBuddy技能包运行失败怎么办_WorkBuddy技能执行错误解决办法

Perplexity如何使用Gemini模型_Perplexity多模型协作搜索教程【高级】

OpenClaw隐藏设置_OpenClaw隐藏配置详解【详解】

Perplexity自定义搜索范围_Perplexity Focus模式使用教程【核心】

相关专题

Python 自然语言处理（NLP）基础与实战

本专题系统讲解 Python 在自然语言处理（NLP）领域的基础方法与实战应用，涵盖文本预处理（分词、去停用词）、词性标注、命名实体识别、关键词提取、情感分析，以及常用 NLP 库（NLTK、spaCy）的核心用法。通过真实文本案例，帮助学习者掌握使用 Python 进行文本分析与语言数据处理的完整流程，适用于内容分析、舆情监测与智能文本应用场景。

418

2026.01.27

ChatGPT注册

ChatGPT注册方法：1、访问OpenAI的官方网站，进入注册页面；2、完成注册后收到一份邮件，打开后点击验证账号；3、选择一个适合您需求的订阅计划；4、获得访问ChatGPT的权限即可。

559

2023.09.12

国内免费ChatGPT大全

ChatGPT是一种基于深度学习技术的自然语言处理模型，由OpenAI开发。它是GPT的一个变体，专门设计用于生成上下文相关的文本回复。ChatGPT被训练成一个聊天机器人，可以与用户进行对话交互。更多关于ChatGPT的文章详情请查看本专题，希望对大家能有所帮助。

618

2023.10.25

手机安装chatgpt的方法

手机安装chatgpt的方法：1、在ChatGTP官网或手机商店上下载ChatGTP软件；2、打开后在设置界面中，选择语言为中文；3、在对局界面中，选择人机对局并设置中文相谱；4、开始后在聊天窗口中输入指令，即可与软件进行交互。想了解更多chatgpt的相关内容，可以阅读本专题下面的文章。

3045

2024.03.05

chatgpt国内可不可以使用

chatgpt在国内可以使用，但不能注册，港澳也不行，用户想要注册的话，可以使用国外的手机号进行注册，注意注册过程中要将网络环境切换成国外ip。想了解更多chatgpt的相关内容，可以阅读本专题下面的文章。

1101

2024.03.05

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2917

2024.08.16

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

136

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

热门下载

网站特效

网站源码

网站素材

前端模板