0

0

如何用最近邻法填补缺失值时避免残留 NaN

碧海醫心

碧海醫心

发布时间:2026-01-16 21:55:03

|

263人浏览过

|

来源于php中文网

原创

如何用最近邻法填补缺失值时避免残留 NaN

最近邻插值法(`interpolate(method='nearest')`)在处理缺失年龄值时,可能因数据局部稀疏或边界位置缺乏邻近有效值而无法填充部分 nan,尤其在测试集分布偏离训练集时更易发生。

pandas.Series.interpolate(method='nearest') 并非基于多维特征的 KNN 算法,而是一种一维序列插值方法:它仅沿 Series 的索引顺序查找前后最近的非空值(即按行号/索引位置找“相邻”,而非按 pclass、sex、fare 等特征找语义相近样本)。因此,当 NaN 出现在序列开头、结尾,或连续多个 NaN 块中时,该方法会失效——这正是你遇到的 index 416 和 417 仍为 NaN 的根本原因。

例如:

import pandas as pd
s = pd.Series([None, None, 25.0, None, 30.0])
print(s.interpolate(method='nearest'))
# 输出:[NaN, 25.0, 25.0, 25.0, 30.0] → 开头两个 NaN 无法被填充

✅ 正确做法:若需基于多维相似性(如 pclass, sex, fare)进行年龄插补,应使用真正的 k-近邻回归(KNNImputer)

Tellers AI
Tellers AI

Tellers是一款自动视频编辑工具,可以将文本、文章或故事转换为视频。

下载
from sklearn.impute import KNNImputer
import numpy as np

# 构造用于插补的特征矩阵(建议包含与年龄强相关的列)
features = ['pclass', 'sex', 'sibsp', 'parch', 'fare']
X_test = titanic_Test[features].copy()

# 注意:KNNImputer 要求输入为数值型且无 NaN(故仅对 age 列单独处理时需谨慎)
# 更稳妥的做法:在完整数据集(含训练集)上拟合,再转换测试集
imputer = KNNImputer(n_neighbors=5)
titanic_Test['age_imputed'] = imputer.fit_transform(
    pd.concat([titanic_Train[features], titanic_Test[features]], axis=0)
)[len(titanic_Train):, features.index('pclass')]  # 示例示意,实际需对齐列

⚠️ 关键注意事项:

  • interpolate(method='nearest') 是索引驱动,不考虑特征语义;
  • KNNImputer 是特征驱动,但要求所有参与计算的列均无缺失(否则需级联处理或先用简单策略填充);
  • Titanic 测试集中 age 缺失往往集中在特定子群(如低票价二等舱女性),建议结合分组统计(如 titanic_Train.groupby(['pclass','sex'])['age'].median())作为兜底策略。

综上,残留 NaN 不是代码错误,而是方法误用——请根据插补逻辑目标,明确选择「序列邻近」还是「特征相似」范式,并选用对应工具

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

52

2025.12.04

页面置换算法
页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章,大家可以免费体验。

403

2023.08.14

Java JVM 原理与性能调优实战
Java JVM 原理与性能调优实战

本专题系统讲解 Java 虚拟机(JVM)的核心工作原理与性能调优方法,包括 JVM 内存结构、对象创建与回收流程、垃圾回收器(Serial、CMS、G1、ZGC)对比分析、常见内存泄漏与性能瓶颈排查,以及 JVM 参数调优与监控工具(jstat、jmap、jvisualvm)的实战使用。通过真实案例,帮助学习者掌握 Java 应用在生产环境中的性能分析与优化能力。

19

2026.01.20

PS使用蒙版相关教程
PS使用蒙版相关教程

本专题整合了ps使用蒙版相关教程,阅读专题下面的文章了解更多详细内容。

61

2026.01.19

java用途介绍
java用途介绍

本专题整合了java用途功能相关介绍,阅读专题下面的文章了解更多详细内容。

87

2026.01.19

java输出数组相关教程
java输出数组相关教程

本专题整合了java输出数组相关教程,阅读专题下面的文章了解更多详细内容。

39

2026.01.19

java接口相关教程
java接口相关教程

本专题整合了java接口相关内容,阅读专题下面的文章了解更多详细内容。

10

2026.01.19

xml格式相关教程
xml格式相关教程

本专题整合了xml格式相关教程汇总,阅读专题下面的文章了解更多详细内容。

13

2026.01.19

PHP WebSocket 实时通信开发
PHP WebSocket 实时通信开发

本专题系统讲解 PHP 在实时通信与长连接场景中的应用实践,涵盖 WebSocket 协议原理、服务端连接管理、消息推送机制、心跳检测、断线重连以及与前端的实时交互实现。通过聊天系统、实时通知等案例,帮助开发者掌握 使用 PHP 构建实时通信与推送服务的完整开发流程,适用于即时消息与高互动性应用场景。

19

2026.01.19

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 3.9万人学习

Pandas 教程
Pandas 教程

共15课时 | 0.9万人学习

ASP 教程
ASP 教程

共34课时 | 3.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号