如何高效合并多个时间序列数据框并按ID对齐月度收入字段

阿枫大大_9733

阿枫大大_9733

2026-05-10

867人浏览

原创

如何高效合并多个时间序列数据框并按ID对齐月度收入字段

本文介绍一种结合拼接(concat)与逐轮索引对齐的策略,用于将多个含相同id但不同月份收入的数据框合并为宽格式,确保主id表结构稳定、历史收入按列分月填充、缺失值补零。

本文介绍一种结合拼接(concat)与逐轮索引对齐的策略,用于将多个含相同id但不同月份收入的数据框合并为宽格式,确保主id表结构稳定、历史收入按列分月填充、缺失值补零。

在处理按月更新的客户或实体指标(如收入、活跃度)时,常遇到多个结构一致但时间点不同的DataFrame——每个代表当月快照,需统一为以id_number为主键、各月收入为独立列的宽表。关键约束在于:保留首次出现的非收入字段(如company、type),同时为每期Income创建带序号的新列(如Income_1、Income_2),未覆盖的ID对应位置填0。

直接使用pd.merge()链式连接易导致字段冲突或重复行;而pd.concat(..., join='outer')虽能保留所有ID,却无法自动对齐非收入列的“首次优先”逻辑。因此,推荐采用两阶段法:

第一阶段:构建唯一ID主干表

先拼接所有DataFrame(忽略Income列),再基于id_number去重,确保每个ID仅保留首次出现的company和type值:

dfs = [df_22_3, df_22_4, df_22_5]
result = (
    pd.concat(dfs, ignore_index=True)
    .drop(columns='Income')
    .drop_duplicates(subset='id_number', keep='first')
    .sort_values('id_number')  # 可选:按ID排序提升可读性
    .reset_index(drop=True)
)

第二阶段:逐轮注入月度收入

对每个原始DataFrame,利用set_index('id_number')['Income']构造Series,再通过.reindex()严格按result['id_number']顺序对齐,并用fill_value=0补缺:

for i, df in enumerate(dfs, start=1):
    result[f'Income_{i}'] = (
        df.set_index('id_number')['Income']
        .reindex(result['id_number'], fill_value=0)
        .values  # .values 确保返回numpy数组,避免索引对齐警告
    )

✅ 关键细节说明:

  • reindex(..., fill_value=0) 比 map() 或 merge() 更简洁,且天然支持缺失ID补零;
  • 使用 .values 而非 .reset_index(drop=True),避免因索引类型不一致引发的赋值警告;
  • keep='first' 在drop_duplicates中明确指定保留首条记录,符合“ID首次出现字段优先”要求。

最终结果即为标准宽表结构,可直接用于时序分析或可视化:

# 可选:将 Income_1 重命名为 Income 以符合习惯
result = result.rename(columns={'Income_1': 'Income'})
print(result)

输出:

  id_number     company type  Income  Income_2  Income_3
0      A123  Insurance1    A     100       150       180
1      B456  Insurance2    A     200       250         0
2      C789  Insurance3    C     300         0       320
3      D012  Insurance1    B       0       400         0
4      E034  Insurance5    B       0         0       500

该方法时间复杂度为O(n),扩展性强——无论新增多少月度DataFrame,只需追加至dfs列表并复用循环逻辑,无需修改主干逻辑。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

320

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

232

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

431

25

FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

2026.10.08

0

20

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

120

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

100

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

80

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

80

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

100

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习