如何高效聚合多个时间序列DataFrame并计算各日期的“Yes/No”占比

酷涛君_8041

酷涛君_8041

2026-06-27

885人浏览

原创

如何高效聚合多个时间序列DataFrame并计算各日期的“Yes/No”占比

本文介绍一种基于pandas的高效方法,通过pd.concat()横向合并多个同索引(日期)dataframe,再利用apply()与value_counts(normalize=true)逐行统计“yes/no”占比,避免嵌套循环,显著提升可读性与执行效率。

本文介绍一种基于pandas的高效方法,通过pd.concat()横向合并多个同索引(日期)dataframe,再利用apply()与value_counts(normalize=true)逐行统计“yes/no”占比,避免嵌套循环,显著提升可读性与执行效率。

在处理多源时序分类数据(如50个含日期索引、单列“Yes/No”标签的DataFrame)时,手动遍历每个日期和每个DataFrame不仅代码冗长,还易出错且性能低下。推荐采用向量化聚合 + 行级统计的范式,核心步骤如下:

1. 横向拼接所有DataFrame

使用 pd.concat(..., axis=1) 将所有DataFrame按列合并,自动对齐相同日期索引。即使部分DataFrame日期不完全一致,pandas也会以并集为新索引,缺失位置填充 NaN(后续会妥善处理):

import pandas as pd

# 示例:3个DataFrame(实际中可替换为包含50个df的列表)
dfs = [test1, test2, test3]  # 假设已定义
combined = pd.concat(dfs, axis=1)

✅ 优势:无需预检查索引一致性;自动对齐日期;内存友好(不复制原始数据)。

Pandas Linux版 2.3.3
Pandas Linux版 2.3.3

Pandas 2.3.3 历史版本下载,来自 PyPI 官方发布,适合旧项目兼容、数据分析脚本复现和指定环境安装。

下载

2. 按行统计“Yes/No”占比

对合并后的DataFrame逐行应用 value_counts(normalize=True),直接获得该日期下所有DataFrame中“Yes”和“No”的比例:

# 统计每行(即每个日期)的Yes/No占比,自动忽略NaN
results = combined.apply(
    lambda row: row.value_counts(normalize=True), 
    axis=1
).fillna(0)  # 将未出现的类别(如某日无"No")补0,确保列完整

# 可选:保留4位小数提升可读性
results = results.round(4)

输出结果是一个MultiIndex DataFrame(行索引为日期,列名为“Yes”“No”),例如:

            yes   no
2024-01-01  1.0  0.0
2024-01-01  0.6  0.4
...

3. 进阶技巧与注意事项

  • 获取频次而非占比:移除 normalize=True 参数,value_counts() 返回绝对计数;
  • 统一列名:若需区分来源,可在拼接后重命名列(如 combined.columns = [f'df_{i}' for i in range(len(dfs))]);
  • 缺失值鲁棒性:value_counts(..., dropna=False) 可显式包含 NaN 计数(本例中通常不需);
  • 性能提示:对50+ DataFrame,建议先验证索引是否已排序(combined.index.is_monotonic_increasing),避免隐式排序开销。

该方法将原本O(N×M)复杂度的嵌套循环简化为O(N+M)级别的向量化操作,代码简洁、逻辑清晰,且天然支持任意数量的输入DataFrame——是处理同类聚合任务的标准实践。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

320

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

232

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

471

25

PixTV官网入口地址合集
PixTV官网入口地址合集

本专题汇总了 PixTV AI 一站式视频创作平台的官方入口与使用教程。无需下载软件,浏览器直接访问即可使用。平台将剧本、图像、视频、声音与剪辑整合在“无限画布”中,接入 GPT Image 2.5、Seedance 2.5 等头部模型。本专题整理了从新建画布、角色锚定、分镜拆分到视频生成与导出的完整操作指南,助你快速上手 AI 短剧与漫剧创作。

2026.10.10

20

15

Kratos框架HTTP与gRPC服务开发教程
Kratos框架HTTP与gRPC服务开发教程

本专题围绕Kratos框架双协议服务开发,涵盖HTTP路由与处理器编写、参数获取、gRPC服务实现与客户端调用、metadata上下文传递、encoding编解码注册、统一响应封装、超时控制与流式响应实现方法。

2026.10.10

20

15

Kratos框架Protobuf接口定义与代码生成合集
Kratos框架Protobuf接口定义与代码生成合集

本专题讲解Kratos框架接口定义体系,涵盖proto编写规范、proto add/client/server生成命令、http注解路由、validate校验、OpenAPI文档生成、跨服务proto复用与兼容性设计。

2026.10.10

0

15

C++虚函数怎么定义和调用
C++虚函数怎么定义和调用

C++虚函数是实现运行时多态的重要机制。本专题从virtual关键字的基本用法入手,介绍基类与派生类之间的函数重写、基类指针调用派生类方法,以及动态绑定的执行过程,帮助初学者掌握虚函数的核心语法。

2026.10.10

20

26

C++类与对象的封装方法教程
C++类与对象的封装方法教程

C++封装是面向对象编程的核心特性之一,通过类将数据与操作数据的函数组织在一起,并利用访问权限控制外部访问。本专题介绍类的定义、成员变量、成员函数以及public、private和protected的使用方法,帮助初学者掌握封装的基本原理。

2026.10.10

0

32

C++构造函数定义与调用方法
C++构造函数定义与调用方法

C++构造函数用于初始化类对象,是面向对象编程的重要基础。本专题从构造函数的定义、声明和调用入手,介绍默认构造函数、带参数构造函数、拷贝构造函数及成员初始化列表,帮助初学者掌握对象创建与初始化的基本方法。

2026.10.10

20

16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Pandas 官方文档与用户指南
Pandas 官方文档与用户指南

共0课时 | 0人学习

Pandas 教程
Pandas 教程

共15课时 | 1.9万人学习