0

0

如何在PyTorch中加载预训练模型 PyTorch模型加载与微调实践

P粉602998670

P粉602998670

发布时间:2025-08-02 17:03:01

|

847人浏览过

|

来源于php中文网

原创

在pytorch中加载预训练模型的关键在于理解模型结构与权重的匹配关系。1. 对于resnet、vgg等常见模型,可通过torchvision.models直接加载预训练版本,使用weights参数指定权重类型更推荐;2. 自定义模型需手动加载权重,创建模型后使用load_state_dict并设置strict=false忽略不匹配部分;3. 微调时可冻结部分层,通过设置requires_grad=false锁定参数;4. 推荐仅保存和加载模型状态字典以提高灵活性,并注意设备一致性问题。掌握这些要点即可应对大多数情况。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

如何在PyTorch中加载预训练模型 PyTorch模型加载与微调实践

在PyTorch中加载预训练模型其实并不复杂,关键在于理解模型结构和权重之间的关系。如果你用的是常见的模型架构(比如ResNet、VGG等),通常可以直接从

torchvision.models
中获取对应的预训练版本。而对于自定义模型或部分修改后的模型,就需要更细致地处理权重加载方式。

如何在PyTorch中加载预训练模型 PyTorch模型加载与微调实践

使用torchvision快速加载常见预训练模型

对于像ResNet、AlexNet这类经典模型,推荐使用

torchvision.models
中的接口。这些模型默认提供是否加载预训练权重的选项。

如何在PyTorch中加载预训练模型 PyTorch模型加载与微调实践

例如:

import torchvision.models as models

model = models.resnet18(pretrained=True)

这样一行代码就能加载一个带预训练权重的ResNet18模型。如果你想换成其他变种,比如

resnet50
或者
vgg16
,只需要替换名字即可。

如何在PyTorch中加载预训练模型 PyTorch模型加载与微调实践

需要注意的是:从 PyTorch 1.8 开始,

pretrained
参数被逐步弃用,取而代之的是通过
weights
参数指定具体权重类型。比如:

model = models.resnet18(weights=models.ResNet18_Weights.IMAGENET1K_V1)

这种方式更清晰,也方便你选择不同来源的预训练权重。

自定义模型加载预训练权重

如果你对模型结构做了改动,比如改了最后一层分类器的输出维度,就不能直接使用

pretrained=True
,而是需要手动加载权重。

一般做法是先创建你的模型结构,然后加载原始权重文件,并忽略不匹配的部分。

步骤如下:

  • 创建模型结构
  • 加载预训练权重字典
  • 使用
    load_state_dict
    并设置
    strict=False

示例代码:

Tome
Tome

先进的AI智能PPT制作工具

下载
model = MyModifiedResNet()
pretrained_dict = torch.load('resnet18.pth')
model.load_state_dict(pretrained_dict, strict=False)

这里的关键是确保大部分层的名字和结构都能对应上,否则会报错。如果模型结构差异太大,可能需要手动映射某些层。

微调时冻结部分层

微调模型时,有时候我们只想训练最后几层,而保持前面的特征提取层不变。这时候可以通过设置

requires_grad
来冻结部分参数。

以ResNet为例,假设你想冻结所有层,只训练最后的全连接层:

for param in model.parameters():
    param.requires_grad = False

# 只训练最后的fc层
model.fc = nn.Linear(512, new_num_classes)

这样,在反向传播过程中,只有

model.fc
的参数会被更新。

当然,也可以有选择地冻结某些层,而不是全部。比如只冻结前几层卷积层,保留后面层可训练。

权重保存与加载格式注意事项

PyTorch模型保存的常见方式有两种:

  • 保存整个模型:
    torch.save(model, PATH)
  • 仅保存模型状态字典:
    torch.save(model.state_dict(), PATH)

推荐使用第二种方式,因为它更灵活,特别是在模型类定义发生变化后仍然能加载权重。

加载时也要注意设备问题。如果保存的是GPU上的模型,而在CPU环境下加载,需要加上

map_location='cpu'

model.load_state_dict(torch.load(PATH, map_location='cpu'))

否则可能会遇到设备不匹配的问题。


基本上就这些操作了。加载预训练模型本身不难,但要注意结构匹配、设备一致性和是否需要冻结部分层。掌握这几个点,大多数情况都能应对。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
C# ASP.NET Core微服务架构与API网关实践
C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开,系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例,帮助开发者掌握构建高可用微服务系统的关键技术,提高系统的可扩展性与维护效率。

76

2026.03.11

Go高并发任务调度与Goroutine池化实践
Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开,系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示,帮助开发者构建稳定高效的 Go 并发任务处理系统,提高系统在高负载环境下的处理能力与稳定性。

38

2026.03.10

Kotlin Android模块化架构与组件化开发实践
Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开,重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析,帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系,提升团队协作效率与项目迭代速度。

83

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践
JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开,系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理,以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例,帮助开发者理解浏览器底层工作原理,并掌握提升网页加载速度与交互体验的实用技巧。

97

2026.03.06

Rust内存安全机制与所有权模型深度实践
Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开,深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例,分析内存安全保障原理与零成本抽象优势,并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学,掌握在高性能与安全性并重场景中的工程实践能力。

223

2026.03.05

PHP高性能API设计与Laravel服务架构实践
PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开,重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景,深入分析性能瓶颈定位与优化思路,帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

458

2026.03.04

AI安装教程大全
AI安装教程大全

2026最全AI工具安装教程专题:包含各版本AI绘图、AI视频、智能办公软件的本地化部署手册。全篇零基础友好,附带最新模型下载地址、一键安装脚本及常见报错修复方案。每日更新,收藏这一篇就够了,让AI安装不再报错!

169

2026.03.04

Swift iOS架构设计与MVVM模式实战
Swift iOS架构设计与MVVM模式实战

本专题聚焦 Swift 在 iOS 应用架构设计中的实践,系统讲解 MVVM 模式的核心思想、数据绑定机制、模块拆分策略以及组件化开发方法。内容涵盖网络层封装、状态管理、依赖注入与性能优化技巧。通过完整项目案例,帮助开发者构建结构清晰、可维护性强的 iOS 应用架构体系。

246

2026.03.03

C++高性能网络编程与Reactor模型实践
C++高性能网络编程与Reactor模型实践

本专题围绕 C++ 在高性能网络服务开发中的应用展开,深入讲解 Socket 编程、多路复用机制、Reactor 模型设计原理以及线程池协作策略。内容涵盖 epoll 实现机制、内存管理优化、连接管理策略与高并发场景下的性能调优方法。通过构建高并发网络服务器实战案例,帮助开发者掌握 C++ 在底层系统与网络通信领域的核心技术。

34

2026.03.03

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
10分钟--Midjourney创作自己的漫画
10分钟--Midjourney创作自己的漫画

共1课时 | 0.1万人学习

Midjourney 关键词系列整合
Midjourney 关键词系列整合

共13课时 | 0.9万人学习

AI绘画教程
AI绘画教程

共2课时 | 0.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号