GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

WBOY

发布时间：2023-11-03 14:17:30

1133人浏览过

来源于51CTO.COM

转载

近期来，大型语言模型在各种自然语言处理任务中取得了显著的突破，特别是在需要进行复杂思维链（CoT）推理的数学问题上

比如在 GSM8K、MATH 这样的高难度数学任务的数据集中，包括 GPT-4 和 PaLM-2 在内的专有模型已取得显著成果。在这方面，开源大模型还有相当的提升空间。为了进一步提高开源大模型处理数学任务的 CoT 推理能力，一种常见的方法是使用注释 / 生成的问题 - 推理数据对（ CoT 数据）对这些模型进行微调，这些数据对会直接教导模型如何在这些任务中执行 CoT 推理。

最近，西安交通大学、微软和北京大学的研究人员在一篇论文中探讨了一种提升思路，即通过逆向学习过程（即从LLM的错误中学习）来进一步提高其推理能力

就像一个开始学习数学的学生一样，他首先会通过学习教科书上的知识点和例题来提升自己的理解。但同时，他也会进行练习来巩固所学的知识。当他在解题时遇到困难或者失败时，他会意识到自己犯了哪些错误，并且学会如何改正这些错误，这样就形成了一个“错题本”。正是通过从错误中学习，他的推理能力得到了进一步的提高

受这个过程的启发，这项工作探讨了 LLM 的推理能力如何从理解和纠正错误中受益。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文地址：https://arxiv.org/pdf/2310.20689.pdf

AIBox 一站式AI创作平台

AIBox365一站式AI创作平台，支持ChatGPT、GPT4、Claue3、Gemini、Midjourney等国内外大模型

下载

具体而言，研究人员首先生成了错误-修正数据对（称为修正数据），然后利用修正数据对LLM进行微调。在生成修正数据：需要进行重写的内容时，他们使用了多个LLM（包括LLaMA和GPT系列模型），以收集不准确的推理路径（即最终答案不正确），随后使用GPT-4作为“修正器”，为这些不准确的推理路径生成修正

生成的修正包含三条信息：(1) 原始解法中不正确的步骤；(2) 解释该步骤不正确的原因；(3) 如何修正原始解法以得出正确的最终答案。在过滤掉最终答案不正确的修正后，人工评估结果表明，修正数据在后续的微调阶段表现出了足够的质量。研究者使用 QLoRA 对 CoT 数据和修正数据微调了 LLM，从而执行了「从错误中学习」（LEMA）。

研究表明，目前的LLM可以采用逐步推进的方法来解决问题，但这种多步骤生成过程并不意味着LLM本身具有强大的推理能力。这是因为它们可能只是模仿人类推理的表面行为，而没有真正理解所需的底层逻辑和规则

这种不理解会导致在推理过程中出现错误，因此需要「世界模型」的帮助，因为「世界模型」对现实世界的逻辑和规则具有先验意识。从这个角度来看，本文中 LEMA 框架可以看成是采用了 GPT-4 作为「世界模型」，教导更小的模型遵守这些逻辑和规则，而不仅仅是模仿 step-by-step 的行为。

现在，让我们来了解一下这项研究的具体实施步骤

方法概览

请看下图1（左），显示了LEMA的整体流程，包括生成修正数据：需要进行重写的内容和微调LLM这两个主要阶段。而图1（右）展示了LEMA在GSM8K和MATH数据集上的性能表现

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

生成修正数据：需要进行重写的内容

给定一个问答示例 GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升、一个修正器模型 M_c 和一个推理模型 M_r，研究者生成了错误修正数据对，其中表示问题 q_i 的不准确推理路径，c_i 表示对的修正。

修正不准确的推理路径。研究者首先使用推理模型 M_r，为每个问题 q_i 采样了多个推理路径，然后只保留那些最终得不出正确答案 a_i 的路径，如下公式（1）所示。

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

为错误生成修正。对于问题 q_i 和不准确的推理路径 GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升，研究者使用修正器模型 M_c 来生成一个修正，然后在修正中检查正确答案，如下公式（2）所示。

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

这里的 P_c 包括了四个带有注释的错误修正示例，可以指导修正器模型在生成的修正中包含哪种类型的信息

具体而言，带有注释的修正包括以下三类信息：

错误步骤：原始推理路径中哪一步出错了。
解释：该步骤中出现了什么类型的错误；
正确解决方案：如何修正不准确的推理路径以更好地解决原始问题。

请看下图，图示1简要展示了生成修正所使用的提示

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

生成修正的人工评估。在生成更大规模的数据之前，研究者首先手动评估了生成修正的质量。他们以 LLaMA-2-70B 为 M_r、以 GPT-4 为 M_c，并基于 GSM8K 训练集生成了 50 个错误修正数据对。

研究人员对修正进行了分类，分为三个质量等级，分别是优秀、良好和糟糕。以下是三个等级的示例

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

评估结果发现，50 个生成修正中有 35 个达到了优秀质量、11 个为良好、4 个为糟糕。根据这一评估结果，研究者推断使用 GPT-4 生成修正的整体质量足以进行进一步的微调阶段。因此，他们生成了更多大规模的修正，并将所有最终得出正确答案的修正用于需要进行微调的是LLM。

需要进行微调的是LLM

在生成修正数据：需要进行重写的内容之后，研究者微调了 LLM，从而评估这些模型是否可以从错误中学习。他们主要在以下两种微调设置下进行性能比较。

一是在思维链（CoT）数据上微调。研究者仅在问题原理（question-rationale）数据上微调模型。尽管每个任务中有带注释的数据，但他们额外采用了 CoT 数据增强。研究者使用 GPT-4 为训练集中的每个问题生成了更多推理路径，并过滤掉最终答案错误的路径。他们利用 CoT 数据增强来构建一个强大的微调基线，该基线仅使用 CoT 数据，并有助于对控制微调的数据大小进行消融研究。

二是在 CoT 数据 + 修正数据上微调。除了 CoT 数据，研究者还将生成的错误修正数据用于微调（即 LEMA）。他们同样进行了控制数据大小的消融实验，以减少增量对数据大小的影响。

附录 A 中的示例 5 和示例 6 分别展示了用于微调的 CoT 数据和修正数据的输入 - 输出格式

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

实验结果

研究人员通过实验结果证明了LEMA在五个开源LLM和两个具有挑战性的数学推理任务上的有效性

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

LEMA 在各种 LLM 和任务中都能持续提升性能，与仅在 CoT 数据上进行微调相比。例如，使用 LLaMA-2-70B 的 LEMA 在 GSM8K 和 MATH 上分别取得了 83.5% 和 25.0% 的成绩，而仅在 CoT 数据上进行微调则分别取得了 81.4% 和 23.6% 的成绩

GPT-4 做「世界模型」，让LLM从「错题」中学习，推理能力显著提升

此外，LEMA 与专有 LLM 兼容：带有 WizardMath-70B /MetaMath-70B 的 LEMA 在 GSM8K 上实现了 84.2%/85.4% 的 pass@1 准确率，在 MATH 上实现了 27.1%/26.9% 的 pass@1 准确率，超过了众多开源模型在这些挑战性任务上取得的 SOTA 性能。

随后的消融研究表明，在相同的数据量下，LEMA 仍然优于 CoT-alone 微调。这表明，CoT 数据和校正数据的有效性并不相同，因为两种数据源的结合比使用单一数据源能产生更多的改进。这些实验结果和分析强调了从错误中学习在增强 LLM 推理能力方面的潜力。

如需查看更多研究细节，请参阅原始论文

InternVL-U— 上海AI Lab等开源的多模态一体化模型

Solaris— 谢赛宁研究团队开源的多人视频世界生成模型

OpenClaw能在平板电脑上流畅玩吗_OpenClaw安卓平板优化使用方法【技巧】

Dify如何连接知识库实现问答_Dify知识库配置方法【操作】

Perplexity写代码怎么用_Perplexity编程问题排查与修复教程【进阶】

相关专题

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2923

2024.08.16

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

273

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

105

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

230

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

618

2026.03.04

热门下载

网站特效

网站源码

网站素材

前端模板