Python多进程怎么加速分析_Pandas结合multiprocessing模块性能提速

P粉602998670

发布时间：2026-03-19 13:23:30

315人浏览过

来源于php中文网

原创

multiprocessing.Pool 直接 map pandas.DataFrame 报错因 DataFrame 默认无法被 pickle 完整序列化，尤其含自定义方法、扩展类型或未关闭文件句柄时；实操应传 numpy.ndarray 或纯 Python 数据结构，避免传整个 DataFrame。

python多进程怎么加速分析_pandas结合multiprocessing模块性能提速

为什么 `multiprocessing.Pool` 直接 map `pandas.DataFrame` 会报错

因为 DataFrame 默认不能被 pickle 完整序列化（尤其含自定义方法、某些扩展类型或未关闭的文件句柄时），而 multiprocessing 子进程必须靠 pickle 传递数据。常见报错是 AttributeError: Can't pickle local object 或 TypeError: cannot serialize '_io.TextIOWrapper'。

实操建议：

立即学习“Python免费学习笔记（深入）”；

把数据切片逻辑放在主进程，只传 numpy.ndarray 或纯 Python 字典/列表给子进程，避免传整个 DataFrame
若必须传 DataFrame，确保它不含不可序列化字段（如 pd.Series.plot 对象、io.StringIO 实例）
用 functools.partial 绑定固定参数时，别绑定 DataFrame 或函数内闭包变量，改用显式参数传入

`apply_async` 和 `map` 哪个更适合 Pandas 分块处理

map 简单但阻塞等待全部完成；apply_async 可并发提交 + 手动收集结果，更灵活，也更容易加超时和错误捕获。

实操建议：

立即学习“Python免费学习笔记（深入）”；

用 apply_async 配合 result.get(timeout=60)，防止某个子任务卡死拖垮整体
别在子进程中调用 pd.read_csv —— 每次都打开文件、解析 header，IO 开销大；应提前读好，再按行索引切片传入
如果每块数据量小（concurrent.futures.ProcessPoolExecutor，API 更清晰，异常堆栈也更可读

为什么开了 8 个进程，CPU 却只跑 20%？

根本不是进程数问题，而是 Pandas 内部大量操作（如 groupby、merge、apply）默认启用多线程（通过 numexpr 或 OpenBLAS），和你的 multiprocessing 形成资源争抢，反而降低吞吐。

靠岸学术

一款集翻译，阅读，文献管理于一体的英文文献阅读器

下载

实操建议：

立即学习“Python免费学习笔记（深入）”；

启动子进程前，强制关掉 Pandas 的并行后端：import os; os.environ['NUMEXPR_NUM_THREADS'] = '1'; os.environ['OMP_NUM_THREADS'] = '1'
子进程入口函数开头加 import pandas as pd; pd.options.mode.chained_assignment = None，避免警告触发锁
用 psutil.Process().cpu_affinity([i]) 绑定每个子进程到不同 CPU 核（需 Linux/macOS），减少上下文切换

怎么安全地把子进程结果拼回一个 DataFrame

直接用 pd.concat(list_of_results) 很危险：如果某子进程返回空 DataFrame、列顺序不一致、或 dtypes 强制转换失败（比如一列在部分块里是 int64，另一块是 float64），concat 会静默降级或报错。

实操建议：

立即学习“Python免费学习笔记（深入）”；

所有子进程返回统一结构的字典：{'data': ndarray, 'columns': list, 'index': array}，主进程用 pd.DataFrame 构造，不依赖自动推断
若必须返回 DataFrame，在子进程里加校验：assert set(df.columns) == expected_cols and len(df) > 0
拼接前先统一 dtypes：df.astype(common_dtypes, errors='ignore')，其中 common_dtypes 是主进程预估的各列最终类型

真正卡住性能的，往往不是进程数或切分逻辑，而是子进程里没关掉 Pandas 自带的线程池、或者忘了清理 matplotlib 后端——这些细节不打日志根本看不出来。

Python如何监控异步程序的运行_集成asyncio的性能分析与监控工具

Python memoryview怎么用_零拷贝内存操作与性能优化

Python怎么爬取并分析数据_网络爬虫数据入库清洗与Pandas全链路

如何让自定义迭代器支持多次遍历？

Python怎么写入带BOM的UTF-8_utf-8-sig编码解决Excel乱码

数码产品性能查询

该软件包括了市面上所有手机CPU，手机跑分情况，电脑CPU，电脑产品信息等等，方便需要大家查阅数码产品最新情况，了解产品特性，能够进行对比选择最具性价比的商品。

下载

相关标签:

python Python pandas

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Python 中如何为“类型 → 同类型处理函数”映射字典实现精确类型提示下一篇：Python闭包怎么写_嵌套函数与外部变量状态保存技巧

作者最新文章

怎样配置Java编程的Apollo配置中心环境_分布式Java开发

2026-03-19 14:16

CSS如何使用Skeleton框架实现轻量响应_快速布局移动端页面

2026-03-19 14:16

如何调整连接池大小以达到最佳性能_最大并发连接计算与超时配置

2026-03-19 14:17

CSS如何利用flex制作一条自适应分割线横穿文字

2026-03-19 14:17

CSS如何制作带动态边框的响应式输入框_通过Focus伪类触发css位移动效

2026-03-19 14:19

如何通过GC日志判断是否发生内存泄漏_GC后可用堆内存持续减少的趋势分析

2026-03-19 14:20

CSS如何处理全浮动布局中的整体居中_给最外层容器设定固定宽度并使用margin: auto居中

2026-03-19 14:21

如何实现SQL查询结果的按需输出：字段选择与别名

2026-03-19 14:21

CSS解决移动端浮动布局适配问题_转用flexbox替换浮动

2026-03-19 14:22

Tailwind CSS如何实现水平居中的按钮组_利用flex justify-center

2026-03-19 14:23

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

AI办公学习 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

python开发工具

php中文网为大家提供各种python开发工具，好的开发工具，可帮助开发者攻克编程学习中的基础障碍，理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容，供大家免费下载使用。

781

2023.06.15

python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章，大家可以免费的下载体验。

697

2023.07.20

python能做什么

python能做的有：可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

784

2023.07.25

format在python中的用法

Python中的format是一种字符串格式化方法，用于将变量或值插入到字符串中的占位符位置。通过format方法，我们可以动态地构建字符串，使其包含不同值。php中文网给大家带来了相关的教程以及文章，欢迎大家前来阅读学习。

890

2023.07.31

python教程

Python已成为一门网红语言，即使是在非编程开发者当中，也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章，大家可以免费体验学习。

1564

2023.08.03

python环境变量的配置

Python是一种流行的编程语言，被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后，我们需要配置环境变量，以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

598

2023.08.04

python eval

eval函数是Python中一个非常强大的函数，它可以将字符串作为Python代码进行执行，实现动态编程的效果。然而，由于其潜在的安全风险和性能问题，需要谨慎使用。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

591

2023.08.04

scratch和python区别

scratch和python的区别：1、scratch是一种专为初学者设计的图形化编程语言，python是一种文本编程语言；2、scratch使用的是基于积木的编程语法，python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容，供大家免费下载体验。

759

2023.08.11

Go Web框架Gin接口开发与中间件设计实践

本专题围绕 Go 在 Web 后端开发中的主流框架 Gin 展开，系统讲解高性能接口开发与中间件机制设计。内容涵盖路由分组、请求绑定、参数校验、统一响应封装、日志与鉴权中间件实现，以及接口限流与异常处理策略。通过实战项目案例，帮助开发者构建结构清晰、性能优良的 Go Web 服务体系，提升接口开发效率与系统可维护性。

2026.03.19

热门下载

网站特效

网站源码

网站素材

前端模板