
本文介绍如何从多个长度不一但结构相同的dataframe中提取指定列(如'd'),横向拼接为新dataframe,并支持按行计算均值(自动忽略nan)。
本文介绍如何从多个长度不一但结构相同的dataframe中提取指定列(如'd'),横向拼接为新dataframe,并支持按行计算均值(自动忽略nan)。
在实际数据分析中,常需整合来自不同来源(如实验重复、时间分片或模型输出)的多个DataFrame,并对某关键列进行横向对比与统计。当各DataFrame列名一致但行数不同(例如 df1 有115行、df2 有220行、df3 有90行)时,直接使用 pd.concat(..., axis=1) 并指定 keys 参数是最简洁、高效且语义清晰的解决方案。
核心思路是:提取每份DataFrame中的目标列 → 按列方向(axis=1)拼接 → 自动对齐索引(缺失位置补NaN)→ 支持后续行级聚合(如 .mean(axis=1))。
以下为完整实现步骤:
✅ 正确做法:使用 pd.concat + keys 实现横向堆叠
import pandas as pd
# 示例数据(实际中替换为你的 df1, df2, ..., dfn)
df1 = pd.DataFrame({'a': [2, 3], 'b': [2, 3], 'c': [2, 3], 'd': [10, 20], 'e': [1, 2]})
df2 = pd.DataFrame({'a': [5, 6, 7, 8, 9], 'b': [5, 6, 7, 8, 9], 'c': [5, 6, 7, 8, 9], 'd': [15, 25, 35, 45, 55], 'e': [3, 4, 5, 6, 7]})
df3 = pd.DataFrame({'a': [7, 8, 9, 10], 'b': [7, 8, 9, 10], 'c': [7, 8, 9, 10], 'd': [12, 22, 32, 42], 'e': [8, 9, 10, 11]})
df4 = pd.DataFrame({'a': [8, 9, 10, 11, 12], 'b': [8, 9, 10, 11, 12], 'c': [8, 9, 10, 11, 12], 'd': [18, 28, 38, 48, 58], 'e': [12, 13, 14, 15, 16]})
# 所有DataFrame组成的列表
dataFrameList = [df1, df2, df3, df4]
# 提取每份DataFrame中的列'd',并赋予唯一列名 d1, d2, d3, d4...
target_col = 'd'
column_names = [f'{target_col}{i+1}' for i in range(len(dataFrameList))]
extracted_series = [df[target_col] for df in dataFrameList]
# 横向拼接:axis=1 + keys=column_names → 自动生成多级列或扁平列名(取决于版本)
newDataFrame = pd.concat(extracted_series, axis=1, keys=column_names)
print("拼接后的结果(自动对齐,缺失处为NaN):")
print(newDataFrame)
print("\n每行均值(跳过NaN):")
print(newDataFrame.mean(axis=1).round(2))
? 输出说明:
- 新DataFrame列名为 d1, d2, d3, d4,对应原始各df的'd'列;
- 行索引自动对齐:最长df决定总行数,其余不足处填充 NaN;
- newDataFrame.mean(axis=1) 默认 skipna=True,可直接获得每行有效数值的算术平均。
⚠️ 注意事项与最佳实践
- 列名唯一性:务必通过 keys= 参数显式命名各列,避免默认索引导致列名冲突(如全部为 'd');
- 索引对齐逻辑:pd.concat(..., axis=1) 默认按索引对齐(outer join),若原始DataFrame索引无意义,建议统一重置为 range(len(df)) 或确保索引可比;
-
内存效率:对于超大数据集,可考虑生成器表达式替代列表推导式:
pd.concat((df[target_col] for df in dataFrameList), axis=1, keys=column_names)
-
扩展应用:后续可轻松添加标准差、中位数等统计量:
stats_df = newDataFrame.agg(['mean', 'std', 'min', 'max'], axis=1)
该方法简洁、健壮、符合pandas设计哲学,无需手动构造空DataFrame或循环赋值,是处理此类“列提取+横向堆叠”任务的标准范式。











