0

0

Pandas DataFrame行求和:解决混合数据类型导致0值结果的问题

心靈之曲

心靈之曲

发布时间:2025-11-20 12:00:08

|

863人浏览过

|

来源于php中文网

原创

Pandas DataFrame行求和:解决混合数据类型导致0值结果的问题

本教程旨在解决pandas dataframe在对包含混合数据类型的行进行求和时,numeric_only=true参数失效并返回0值的问题。核心解决方案是利用pd.to_numeric函数的errors='coerce'参数,将非数值型数据安全转换为nan,然后再进行行求和,从而确保准确计算。文章还将演示如何将总秒数转换为可读的时间格式。

在数据分析实践中,我们经常需要对Pandas DataFrame的行进行数值求和。然而,当DataFrame中包含混合数据类型(例如,数字以字符串形式存储,或存在非数字文本、列表等)时,直接使用df.sum(axis=1, numeric_only=True)可能无法得到预期的结果,甚至会返回一列0.0。本教程将深入探讨这个问题的原因,并提供一个健壮的解决方案。

理解 numeric_only=True 的局限性

pandas.DataFrame.sum() 方法提供了一个 numeric_only=True 参数,旨在只对DataFrame中的数值列进行求和。然而,其工作机制可能与直觉有所不同。当一个列被指定为 numeric_only=True 时,Pandas会检查该列的整体数据类型(dtype)。如果该列中包含任何非数值型数据(即使大部分是数字,但有一两个字符串或列表),Pandas会认为该整列是非数值列,并将其排除在求和计算之外。

例如,如果一个日期列中包含了像 '29160' (字符串形式的数字) 和 'No hours logged' (非数字字符串) 这样的混合值,Pandas会将整个列识别为 object 类型,并因 numeric_only=True 而将其跳过。如果所有需要求和的列都存在这种情况,那么最终的行求和结果将是对一个空集合求和,默认返回0.0。

解决方案:使用 pd.to_numeric 进行预处理

要正确地对包含混合数据类型的行进行求和,我们需要在求和之前,将所有潜在的数值型数据统一转换为真正的数值类型。pandas.to_numeric() 函数是完成此任务的理想工具,尤其是结合 errors='coerce' 参数。

pd.to_numeric(series, errors='coerce') 会尝试将Series中的每个元素转换为数值类型。如果转换成功,它将返回对应的数值;如果转换失败(例如,遇到 'No hours logged' 或 [10:02, Odd number: missing entry] 这样的非数字字符串),errors='coerce' 参数将把这些无效值替换为 NaN (Not a Number)。NaN 值在进行求和时会被自动忽略,从而确保求和的准确性。

示例数据准备

首先,我们准备一个示例DataFrame,它模拟了实际数据中可能出现的混合数据类型情况。

Magic AI Avatars
Magic AI Avatars

神奇的AI头像,获得200多个由AI制作的自定义头像。

下载
import pandas as pd
import numpy as np # 用于可能的NaN操作

data = {
    'id': {0: 514, 1: 2414, 2: 3225, 3: 3434, 4: 3864, 5: 4716, 6: 5793},
    'name': {0: 'alexis', 1: 'donald', 2: 'mackenzie', 3: 'louisa', 4: 'olga', 5: 'rick', 6: 'roberta'},
    '2023-11-28': {0: 'No hours logged', 1: '29160', 2: '28500', 3: '25380', 4: '15600', 5: '30180', 6: '29220'},
    '2023-11-29': {0: 'No hours logged', 1: '29160', 2: '28620', 3: '18840', 4: '19080', 5: '28800', 6: '29220'},
    '2023-11-30': {0: 'No hours logged', 1: '28860', 2: '28560', 3: '26040', 4: '14400', 5: '28740', 6: '29460'},
    '2023-12-01': {0: 'No hours logged', 1: '28620', 2: '28620', 3: 'No hours logged', 4: '13800', 5: '28620', 6: '29280'},
    '2023-12-02': {0: 'No hours logged', 1: '[10:02, Odd number: missing entry]', 2: '28980', 3: '25560', 4: '5220', 5: '28680', 6: '29340'},
    '2023-12-03': {0: 'No hours logged', 1: 'No hours logged', 2: 'No hours logged', 3: 'No hours logged', 4: '17820', 5: 'No hours logged', 6: 'No hours logged'},
    '2023-12-04': {0: 'No hours logged', 1: 'No hours logged', 2: 'No hours logged', 3: 'No hours logged', 4: 'No hours logged', 5: 'No hours logged', 6: 'No hours logged'},
    '2023-12-05': {0: 'No hours logged', 1: '28860', 2: '28740', 3: '24900', 4: '14400', 5: '28680', 6: '29040'},
}
df = pd.DataFrame(data)
print("原始DataFrame:")
print(df)

执行精确的行求和

接下来,我们将使用 pd.to_numeric 结合 apply 方法对选定的日期列进行预处理,然后进行行求和。

# 注意:'id'是索引为0的列,'name'是索引为1的列。
# 我们需要从索引为2的列(即第一个日期列)开始选择。
# 使用 .iloc[:, 2:] 选择从第三列到最后一列的所有数据。
# 对选定列的每一列应用 pd.to_numeric,将非数字值转换为 NaN。
# 最后,对转换后的DataFrame按行求和 (axis=1)。
df['total_hours'] = (
    df.iloc[:, 2:]
      .apply(lambda x: pd.to_numeric(x, errors='coerce'))
      .sum(axis=1)
)

print("\n添加'total_hours'列后的DataFrame(仅显示相关列):")
print(df[['id', 'name', 'total_hours']])

运行上述代码,您会看到 total_hours 列现在包含了每行实际的工时总和(以秒为单位),而不是0.0。例如,对于 donald 这一行,所有有效的秒数都被正确地加总。

格式化总工时为可读时间

原始问题提到希望将总秒数转换为 HH:MM 格式。Pandas的 pd.to_timedelta() 函数可以非常方便地完成这个任务,它将秒数转换为 timedelta 对象,可以直接表示为天、小时、分钟和秒。

# 将total_hours(秒)转换为timedelta对象
df['total_hours_formatted'] = pd.to_timedelta(df['total_hours'], unit='s')

print("\n格式化后的总工时:")
print(df[['id', 'name', 'total_hours', 'total_hours_formatted']])

通过 pd.to_timedelta(df['total_hours'], unit='s'),我们得到了一个更易读的时间格式,例如 1 days 16:11:00,这比原始的秒数更加直观。

注意事项与总结

  1. 数据类型检查: 在进行任何数值计算之前,始终建议检查相关列的数据类型 (df.dtypes)。这有助于识别潜在的混合数据类型问题。
  2. errors='coerce' 的重要性: 当处理可能含有非数值字符串的列时,errors='coerce' 是将数据清洗为可计算形式的关键。它能优雅地处理无效数据,避免程序崩溃。
  3. 精确的列选择: 使用 iloc 或明确的列名列表来确保只对目标列进行操作,避免包含不需要的非数值列(如 id 或 name)。
  4. pd.to_timedelta 的应用: 对于时间相关的数值求和,这是一个非常有用的后续处理步骤,能显著提高数据可读性。
  5. 性能考量: 对于非常大的DataFrame,apply 函数可能会比矢量化操作慢。但在大多数情况下,对于行级别的转换和求和,它的可读性和灵活性使其成为一个很好的选择。

通过上述方法,您可以有效地处理Pandas DataFrame中混合数据类型的行求和问题,确保计算的准确性,并将结果以更友好的格式呈现。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

71

2025.12.04

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

1

2026.01.31

数据类型有哪几种
数据类型有哪几种

数据类型有整型、浮点型、字符型、字符串型、布尔型、数组、结构体和枚举等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

310

2023.10.31

php数据类型
php数据类型

本专题整合了php数据类型相关内容,阅读专题下面的文章了解更多详细内容。

222

2025.10.31

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

361

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

212

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1505

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

625

2023.11.24

AO3官网入口与中文阅读设置 AO3网页版使用与访问
AO3官网入口与中文阅读设置 AO3网页版使用与访问

本专题围绕 Archive of Our Own(AO3)官网入口展开,系统整理 AO3 最新可用官网地址、网页版访问方式、正确打开链接的方法,并详细讲解 AO3 中文界面设置、阅读语言切换及基础使用流程,帮助用户稳定访问 AO3 官网,高效完成中文阅读与作品浏览。

89

2026.02.02

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Java 教程
Java 教程

共578课时 | 55.9万人学习

国外Web开发全栈课程全集
国外Web开发全栈课程全集

共12课时 | 1.0万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号