0

0

TensorFlow 模型训练:数据集划分与数据标准化

碧海醫心

碧海醫心

发布时间:2025-07-13 18:22:29

|

493人浏览过

|

来源于php中文网

原创

tensorflow 模型训练:数据集划分与数据标准化

本文旨在解决 TensorFlow 模型训练中,使用完整数据集训练导致损失变为 NaN 的问题。通过对比划分数据集和完整数据集的训练结果,分析了未标准化数据和激活函数可能导致梯度爆炸的原因,并提供了使用 StandardScaler 进行数据标准化的解决方案。

在构建和训练 TensorFlow 模型时,一个常见的问题是模型在训练过程中损失函数变为 NaN(Not a Number),导致训练失败。这通常表明模型训练过程中出现了数值不稳定,例如梯度爆炸。本文将探讨一种特定情况,即当使用完整数据集训练模型时出现 NaN 损失,而将数据集划分为训练集和测试集后训练却能正常进行。

问题分析:数据尺度与梯度爆炸

当模型使用完整数据集训练时,如果数据集未经标准化,且模型中使用了 ReLU 等激活函数,就可能出现梯度爆炸问题。这是因为:

  1. 未标准化数据: 数据集中不同特征可能具有不同的尺度。例如,一个特征的取值范围可能是 [0, 1],而另一个特征的取值范围可能是 [1000, 10000]。这种尺度差异会导致模型在训练过程中对某些特征的权重进行过大的调整。
  2. ReLU 激活函数: ReLU 激活函数在输入大于 0 时输出等于输入,这可能导致梯度在网络中不断累积,最终导致梯度爆炸。

当使用完整数据集训练时,每个 epoch 的数据量更大,梯度更新的次数也更多。这会加速权重的爆炸,从而更快地导致 NaN 损失。而当数据集被划分为训练集和测试集时,每个 epoch 的数据量减少,梯度更新的频率降低,因此可能缓解梯度爆炸的问题,使得模型能够正常训练一段时间。

解决方案:数据标准化

解决上述问题的关键在于对数据进行标准化,使得所有特征具有相似的尺度。常用的标准化方法包括:

Destoon B2B网站
Destoon B2B网站

Destoon B2B网站管理系统是一套完善的B2B(电子商务)行业门户解决方案。系统基于PHP+MySQL开发,采用B/S架构,模板与程序分离,源码开放。模型化的开发思路,可扩展或删除任何功能;创新的缓存技术与数据库设计,可负载千万级别数据容量及访问。 系统特性1、跨平台。支持Linux/Unix/Windows服务器,支持Apache/IIS/Zeus等2、跨浏览器。基于最新Web标准构建,在

下载
  • StandardScaler (Z-score standardization): 将数据转换为均值为 0,标准差为 1 的分布。
  • MinMaxScaler: 将数据缩放到 [0, 1] 的范围内。
  • RobustScaler: 使用中位数和四分位数来缩放数据,对异常值更具鲁棒性。

在 TensorFlow 中,可以使用 sklearn.preprocessing 模块中的 StandardScaler 进行数据标准化。

代码示例:

from sklearn.preprocessing import StandardScaler
import numpy as np

# 假设 train_data 和 test_data 是 numpy 数组
# 或者 tf.Tensor 对象,需要转换为 numpy 数组

# 示例数据
train_data = np.random.rand(100, 10) * 100  # 模拟训练数据
test_data = np.random.rand(50, 10) * 100  # 模拟测试数据

# 初始化 StandardScaler
scaler = StandardScaler()

# 仅在训练数据上拟合 scaler
scaler.fit(train_data)

# 使用 scaler 转换训练数据和测试数据
train_data_scaled = scaler.transform(train_data)
test_data_scaled = scaler.transform(test_data)

# 打印标准化后的数据
print("Original train data shape:", train_data.shape)
print("Scaled train data shape:", train_data_scaled.shape)
print("Original test data shape:", test_data.shape)
print("Scaled test data shape:", test_data_scaled.shape)

# 将标准化后的数据转换为 TensorFlow 数据集
import tensorflow as tf

train_dataset = tf.data.Dataset.from_tensor_slices((train_data_scaled, np.random.rand(100)))
test_dataset = tf.data.Dataset.from_tensor_slices((test_data_scaled, np.random.rand(50)))

train_dataset = train_dataset.batch(32).prefetch(tf.data.AUTOTUNE)
test_dataset = test_dataset.batch(32).prefetch(tf.data.AUTOTUNE)

注意事项:

  • 数据划分: 在进行数据标准化之前,务必先将数据集划分为训练集和测试集。
  • Scaler 拟合: 仅使用训练集的数据来拟合 StandardScaler。这是为了避免测试集的信息泄露到训练过程中,保证模型的泛化能力。
  • 数据转换: 使用相同的 StandardScaler 对象来转换训练集和测试集。

总结

当 TensorFlow 模型在完整数据集上训练时出现 NaN 损失,而在划分数据集后训练正常,很可能是由于数据尺度不一致和激活函数共同作用导致的梯度爆炸问题。通过使用 StandardScaler 等方法对数据进行标准化,可以有效缓解梯度爆炸,提高模型训练的稳定性。请务必在划分数据集后,仅使用训练集的数据来拟合 scaler,并使用相同的 scaler 对象转换训练集和测试集,以保证模型的泛化能力。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python AI机器学习PyTorch教程_Python怎么用PyTorch和TensorFlow做机器学习
Python AI机器学习PyTorch教程_Python怎么用PyTorch和TensorFlow做机器学习

PyTorch 是一种用于构建深度学习模型的功能完备框架,是一种通常用于图像识别和语言处理等应用程序的机器学习。 使用Python 编写,因此对于大多数机器学习开发者而言,学习和使用起来相对简单。 PyTorch 的独特之处在于,它完全支持GPU,并且使用反向模式自动微分技术,因此可以动态修改计算图形。

24

2025.12.22

Python 深度学习框架与TensorFlow入门
Python 深度学习框架与TensorFlow入门

本专题深入讲解 Python 在深度学习与人工智能领域的应用,包括使用 TensorFlow 搭建神经网络模型、卷积神经网络(CNN)、循环神经网络(RNN)、数据预处理、模型优化与训练技巧。通过实战项目(如图像识别与文本生成),帮助学习者掌握 如何使用 TensorFlow 开发高效的深度学习模型,并将其应用于实际的 AI 问题中。

50

2026.01.07

php中文乱码如何解决
php中文乱码如何解决

本文整理了php中文乱码如何解决及解决方法,阅读节专题下面的文章了解更多详细内容。

1

2026.01.28

Java 消息队列与异步架构实战
Java 消息队列与异步架构实战

本专题系统讲解 Java 在消息队列与异步系统架构中的核心应用,涵盖消息队列基本原理、Kafka 与 RabbitMQ 的使用场景对比、生产者与消费者模型、消息可靠性与顺序性保障、重复消费与幂等处理,以及在高并发系统中的异步解耦设计。通过实战案例,帮助学习者掌握 使用 Java 构建高吞吐、高可靠异步消息系统的完整思路。

1

2026.01.28

Python 自然语言处理(NLP)基础与实战
Python 自然语言处理(NLP)基础与实战

本专题系统讲解 Python 在自然语言处理(NLP)领域的基础方法与实战应用,涵盖文本预处理(分词、去停用词)、词性标注、命名实体识别、关键词提取、情感分析,以及常用 NLP 库(NLTK、spaCy)的核心用法。通过真实文本案例,帮助学习者掌握 使用 Python 进行文本分析与语言数据处理的完整流程,适用于内容分析、舆情监测与智能文本应用场景。

23

2026.01.27

拼多多赚钱的5种方法 拼多多赚钱的5种方法
拼多多赚钱的5种方法 拼多多赚钱的5种方法

在拼多多上赚钱主要可以通过无货源模式一件代发、精细化运营特色店铺、参与官方高流量活动、利用拼团机制社交裂变,以及成为多多进宝推广员这5种方法实现。核心策略在于通过低成本、高效率的供应链管理与营销,利用平台社交电商红利实现盈利。

120

2026.01.26

edge浏览器怎样设置主页 edge浏览器自定义设置教程
edge浏览器怎样设置主页 edge浏览器自定义设置教程

在Edge浏览器中设置主页,请依次点击右上角“...”图标 > 设置 > 开始、主页和新建标签页。在“Microsoft Edge 启动时”选择“打开以下页面”,点击“添加新页面”并输入网址。若要使用主页按钮,需在“外观”设置中开启“显示主页按钮”并设定网址。

51

2026.01.26

苹果官方查询网站 苹果手机正品激活查询入口
苹果官方查询网站 苹果手机正品激活查询入口

苹果官方查询网站主要通过 checkcoverage.apple.com/cn/zh/ 进行,可用于查询序列号(SN)对应的保修状态、激活日期及技术支持服务。此外,查找丢失设备请使用 iCloud.com/find,购买信息与物流可访问 Apple (中国大陆) 订单状态页面。

192

2026.01.26

npd人格什么意思 npd人格有什么特征
npd人格什么意思 npd人格有什么特征

NPD(Narcissistic Personality Disorder)即自恋型人格障碍,是一种心理健康问题,特点是极度夸大自我重要性、需要过度赞美与关注,同时极度缺乏共情能力,背后常掩藏着低自尊和不安全感,影响人际关系、工作和生活,通常在青少年时期开始显现,需由专业人士诊断。

7

2026.01.26

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

相关下载

更多

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
10分钟--Midjourney创作自己的漫画
10分钟--Midjourney创作自己的漫画

共1课时 | 0.1万人学习

Midjourney 关键词系列整合
Midjourney 关键词系列整合

共13课时 | 0.9万人学习

AI绘画教程
AI绘画教程

共2课时 | 0.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号