按自定义迭代序号对齐并横向合并多个DataFrame

花韻仙語

发布时间：2026-02-12 14:51:09

119人浏览过

来源于php中文网

原创

按自定义迭代序号对齐并横向合并多个DataFrame

本文介绍如何基于指定的迭代标识（如"1_1"、"2_2"等）从多个dataframe中精准提取行，并沿列方向（axis=1）对齐合并，适用于性能测试数据比对等场景。

在实际数据分析（尤其是系统性能基准测试）中，常需对比不同实验轮次下相同迭代编号（如 1_1, 2_2）的指标（如 IOPS、延迟），但各DataFrame的行顺序、长度及覆盖范围往往不一致。此时，不能直接使用 merge 或 join（因需严格匹配键值），也不能依赖索引位置（因顺序不可靠）；正确做法是：先按用户指定的迭代ID列表对每个DataFrame进行语义对齐（semantic alignment）——即重排行序、补全缺失（设为NaN）、确保输出顺序与目标列表完全一致，再水平拼接。

核心思路分三步：

将 'iteration' 列设为索引；
使用 .reindex() 按目标ID列表强制重排并对齐（未命中ID自动填充NaN）；
重置索引并用 pd.concat(..., axis=1) 横向合并多个对齐后的DataFrame。

以下为完整实现代码：

传声港

AI驱动的综合媒体服务平台，提供 “媒体发稿 + 自媒体宣发 + 效果监测” 一站式服务

下载

import pandas as pd

# 示例数据（与问题一致）
df1 = pd.DataFrame({
    'iteration': ['1_1', '2_2', '3_3', '4_4', '5_5', '6_6', '7_7', '8_8', '9_9'],
    'IOPS': [46090, 12, 49164, 98311, 196604, 249843, 298974, 348108, 397230],
    'Latency': [0.7300, 0.0221, 0.1236, 0.1318, 0.2076, 0.1467, 0.1578, 0.1604, 0.1707]
})

df2 = pd.DataFrame({
    'iteration': ['1_1', '2_2', '3_3', '4_4', '5_5', '6_6'],
    'IOPS': [46074, 12, 49159, 98307, 298976, 397265],
    'Latency': [0.6977, 0.0279, 0.1921, 0.2189, 0.2337, 0.2622]
})

# 定义对齐函数：按指定 iteration 列表重排 DataFrame
def align_by_iteration(df, target_iters):
    return (df.set_index('iteration')
              .reindex(target_iters)  # 关键：保持 target_iters 的顺序，缺失行填 NaN
              .reset_index()          # 恢复 iteration 为普通列
           )

# 对两个 DataFrame 分别对齐后横向拼接
df3 = pd.concat([
    align_by_iteration(df1, ['1_1', '2_2', '3_3', '9_9']),
    align_by_iteration(df2, ['1_1', '2_2', '5_5', '6_6'])
], axis=1)

print(df3)

输出结果将严格按输入列表顺序对齐，且列名自动保留原始前缀（无重复列名冲突）：

  iteration    IOPS  Latency iteration    IOPS  Latency
0       1_1   46090   0.7300       1_1   46074   0.6977
1       2_2      12   0.0221       2_2      12   0.0279
2       3_3   49164   0.1236       5_5  298976   0.2337
3       9_9  397230   0.1707       6_6  397265   0.2622

✅ 关键优势与注意事项：

顺序严格保证：.reindex() 确保输出行顺序与 target_iters 列表完全一致，不受原始DataFrame顺序影响；
缺失值显式处理：若某ID在源DataFrame中不存在，对应行所有字段为 NaN，便于后续识别数据缺口；
可扩展性强：支持任意数量DataFrame，只需将 (df, target_list) 元组传入 starmap 或循环调用 align_by_iteration；
避免隐式索引错误：切勿省略 .set_index('iteration') 步骤——直接对原始DataFrame用 .loc[target_list] 会因索引类型不匹配报错；
列名管理提示：若需区分来源列（如添加 _df1/_df2 后缀），可在 concat 前使用 add_suffix()，例如 align_by_iteration(...).add_suffix('_A')。

该方法兼顾准确性、可读性与工程鲁棒性，是处理非对称实验数据比对的标准实践。

相关标签:

循环数据分析

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：如何正确使用 Matplotlib 绘制分组箱线图（Boxplot）下一篇：如何通过单个按钮同时执行两个带参数的命令操作

作者最新文章

Selenium 与 Froxy 代理集成的正确配置方法

2026-02-10 16:20

html5如何画一个三角形

2026-02-10 16:21

九牧之野如何配将阵容最强阵容搭配攻略

2026-02-10 16:27

Web3j Solidity 代码生成后编译失败的解决方案

2026-02-10 16:45

如何让程序在用户输入无效命令时重复提示而非退出

2026-02-10 17:01

被取消的《指环王》MMO游戏截图泄露！《古墓丽影》团队制作

2026-02-10 17:23

战火勋章平民最强阵容一览表战火勋章平民强力搭配

2026-02-10 17:30

html背景图片如何只显示一张图片大小

2026-02-10 17:30

如何提取 DataFrame 中末尾连续同号段（含零过渡）的所有行

2026-02-10 17:43

乱斗西游2平民最强阵容 0氪金阵容搭配推荐

2026-02-10 17:52

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI 编程开发 AI 聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI 编程开发 AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI 编程开发 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 AI 聊天问答

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI 编程开发 AI 文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI 文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

AI 图片处理图片拼接

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI 编程开发 AI 文本写作

智谱清言 - 免费全能的AI助手

AI 编程开发 Agent智能体

相关专题

数据分析的方法

数据分析的方法有：对比分析法，分组分析法，预测分析法，漏斗分析法，AB测试分析法，象限分析法，公式拆解法，可行域分析法，二八分析法，假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

485

2023.07.04

数据分析方法有哪几种

数据分析方法有：1、描述性统计分析；2、探索性数据分析；3、假设检验；4、回归分析；5、聚类分析。本专题为大家提供数据分析方法的相关的文章、下载、课程内容，供大家免费下载体验。

287

2023.08.07

网站建设功能有哪些

网站建设功能包括信息发布、内容管理、用户管理、搜索引擎优化、网站安全、数据分析、网站推广、响应式设计、社交媒体整合和电子商务等功能。这些功能可以帮助网站管理员创建一个具有吸引力、可用性和商业价值的网站，实现网站的目标。

747

2023.10.16

数据分析网站推荐

数据分析网站推荐：1、商业数据分析论坛；2、人大经济论坛-计量经济学与统计区；3、中国统计论坛；4、数据挖掘学习交流论坛；5、数据分析论坛；6、网站数据分析；7、数据分析；8、数据挖掘研究院；9、S-PLUS、R统计论坛。想了解更多数据分析的相关内容，可以阅读本专题下面的文章。

523

2024.03.13

Python 数据分析处理

本专题聚焦 Python 在数据分析领域的应用，系统讲解 Pandas、NumPy 的数据清洗、处理、分析与统计方法，并结合数据可视化、销售分析、科研数据处理等实战案例，帮助学员掌握使用 Python 高效进行数据分析与决策支持的核心技能。

2025.09.08

Python 数据分析与可视化

本专题聚焦 Python 在数据分析与可视化领域的核心应用，系统讲解数据清洗、数据统计、Pandas 数据操作、NumPy 数组处理、Matplotlib 与 Seaborn 可视化技巧等内容。通过实战案例（如销售数据分析、用户行为可视化、趋势图与热力图绘制），帮助学习者掌握从原始数据到可视化报告的完整分析能力。

2025.10.14