0

0

如何用Python实现数据挖掘?sklearn入门实例

看不見的法師

看不見的法師

发布时间:2025-07-11 14:26:02

|

623人浏览过

|

来源于php中文网

原创

python 做数据挖掘入门并不难,掌握基础工具和流程即可上手。1. 准备环境与数据:安装 python 及 numpy、pandas、scikit-learn 等库,使用自带的鸢尾花数据集;2. 数据预处理:包括标准化、缺失值处理、类别编码,并拆分训练集和测试集;3. 选择模型并训练:如 knn、svm、决策树、随机森林等,以 knn 为例进行分类训练;4. 评估模型性能:通过准确率、混淆矩阵、分类报告等方式评估模型效果;5. 简单调参尝试提升效果:调整参数如 n_neighbors 并观察对结果的影响,后续可用网格搜索优化参数。整个流程完整清晰,适用于真实数据场景。

如何用Python实现数据挖掘?sklearn入门实例

想用 Python 做数据挖掘,其实入门并不难。掌握一些基础工具和流程,就能开始上手实战。其中,scikit-learn(也就是 sklearn)是 Python 中最常用的数据挖掘和机器学习库之一,功能全面、接口友好,非常适合初学者使用。

如何用Python实现数据挖掘?sklearn入门实例

下面通过一个简单的实例带你了解如何使用 sklearn 进行数据挖掘的基本操作。


一、准备环境与数据

在正式开始之前,确保你已经安装好了 Python 和必要的库:

立即学习Python免费学习笔记(深入)”;

如何用Python实现数据挖掘?sklearn入门实例
  • Python 3.x
  • numpy、pandas(用于数据处理)
  • matplotlib、seaborn(可选,用于可视化)
  • scikit-learn(核心)

你可以用 pip 安装这些库:

pip install numpy pandas scikit-learn matplotlib seaborn

为了方便演示,我们使用 sklearn 自带的鸢尾花数据集(Iris),这是一个经典的分类问题数据集,适合入门练习。

如何用Python实现数据挖掘?sklearn入门实例
from sklearn.datasets import load_iris
iris = load_iris()
X, y = iris.data, iris.target

这样我们就加载了特征数据 X 和目标变量 y


二、数据预处理:清洗 + 特征工程初步

数据挖掘的第一步通常是数据预处理。即使你拿到的是“干净”的数据,也可能需要做一些标准化或编码转换。

常见的预处理步骤包括:

  • 数据归一化或标准化(如 Z-score)
  • 缺失值处理(本例中没有缺失值)
  • 类别型变量编码(如 one-hot 编码)
  • 拆分训练集和测试集

以拆分训练集和测试集为例:

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)

这一步非常重要,因为我们需要用一部分数据来训练模型,另一部分来评估效果。

云从科技AI开放平台
云从科技AI开放平台

云从AI开放平台

下载

三、选择模型并训练

接下来就是选择合适的模型进行训练了。对于初学者来说,可以从以下几个常见模型入手:

  • K近邻(KNeighborsClassifier)
  • 支持向量机(SVC)
  • 决策树(DecisionTreeClassifier)
  • 随机森林(RandomForestClassifier)

比如我们用 KNN 来做分类:

from sklearn.neighbors import KNeighborsClassifier
model = KNeighborsClassifier(n_neighbors=3)
model.fit(X_train, y_train)

这段代码做了两件事:

  1. 实例化了一个 KNN 分类器,设定最近邻居数为3;
  2. 使用训练数据拟合模型。

四、评估模型性能

训练完模型后,下一步是看它表现怎么样。常用的评估方法有:

  • 准确率(accuracy_score)
  • 混淆矩阵(confusion_matrix)
  • 分类报告(classification_report)

继续上面的例子:

from sklearn.metrics import accuracy_score, classification_report

y_pred = model.predict(X_test)
print("准确率:", accuracy_score(y_test, y_pred))
print(classification_report(y_test, y_pred))

你会看到类似这样的输出:

准确率: 1.0
              precision    recall  f1-score   support

           0       1.00      1.00      1.00        10
           1       1.00      1.00      1.00        10
           2       1.00      1.00      1.00        10

    accuracy                           1.00        30

说明这个模型在这个小数据集上表现很好,预测准确率达到满分。


五、简单调参尝试提升效果

虽然不是必须的,但你可以尝试调整模型参数来进一步优化结果。例如,KNN 中的 n_neighbors 参数可以试试不同的值:

for k in [1, 3, 5, 7]:
    model = KNeighborsClassifier(n_neighbors=k)
    model.fit(X_train, y_train)
    print(f"k={k} 的准确率:", accuracy_score(y_test, model.predict(X_test)))

你会发现不同参数对结果的影响。这只是调参的一个小小例子,后续你可以用网格搜索(GridSearchCV)来做更系统的调优。


基本上就这些了。整个流程下来,你已经完成了一个完整的数据挖掘任务:从数据加载、预处理、建模、评估到调参。虽然用的是一个小而经典的数据集,但套路是一样的,换更大的真实数据也适用。

不复杂,但容易忽略细节。比如数据是否真的代表整体?有没有过拟合?要不要交叉验证?这些都可以慢慢深入。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

80

2025.12.04

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

32

2026.01.31

pip安装使用方法
pip安装使用方法

安装步骤:1、确保Python已经正确安装在您的计算机上;2、下载“get-pip.py”脚本;3、按下Win + R键,然后输入cmd并按下Enter键来打开命令行窗口;4、在命令行窗口中,使用cd命令切换到“get-pip.py”所在的目录;5、执行安装命令;6、验证安装结果即可。大家可以访问本专题下的文章,了解pip安装使用方法的更多内容。

373

2023.10.09

更新pip版本
更新pip版本

更新pip版本方法有使用pip自身更新、使用操作系统自带的包管理工具、使用python包管理工具、手动安装最新版本。想了解更多相关的内容,请阅读专题下面的文章。

437

2024.12.20

pip设置清华源
pip设置清华源

设置方法:1、打开终端或命令提示符窗口;2、运行“touch ~/.pip/pip.conf”命令创建一个名为pip的配置文件;3、打开pip.conf文件,然后添加“[global];index-url = https://pypi.tuna.tsinghua.edu.cn/simple”内容,这将把pip的镜像源设置为清华大学的镜像源;4、保存并关闭文件即可。

803

2024.12.23

python升级pip
python升级pip

本专题整合了python升级pip相关教程,阅读下面的文章了解更多详细内容。

371

2025.07.23

硬盘接口类型介绍
硬盘接口类型介绍

硬盘接口类型有IDE、SATA、SCSI、Fibre Channel、USB、eSATA、mSATA、PCIe等等。详细介绍:1、IDE接口是一种并行接口,主要用于连接硬盘和光驱等设备,它主要有两种类型:ATA和ATAPI,IDE接口已经逐渐被SATA接口;2、SATA接口是一种串行接口,相较于IDE接口,它具有更高的传输速度、更低的功耗和更小的体积;3、SCSI接口等等。

1946

2023.10.19

PHP接口编写教程
PHP接口编写教程

本专题整合了PHP接口编写教程,阅读专题下面的文章了解更多详细内容。

657

2025.10.17

Python异步编程与Asyncio高并发应用实践
Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开,深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例,帮助开发者掌握 Python 在高并发场景中的高效开发方法,并提升系统资源利用率与整体运行性能。

37

2026.03.12

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号