resample必须先设置datetimeindex,因它仅支持datetimeindex、timedeltaindex或periodindex;若时间列为普通列,需先转datetime类型再set_index,否则报错。

resample 为什么必须先设置 datetimeindex
因为 resample 不是普通聚合函数,它只作用于具有时间索引的 DataFrame 或 Series。如果时间列只是普通列(比如叫 'date'),直接调用 df.resample('D') 会报错:TypeError: Only valid with DatetimeIndex, TimedeltaIndex or PeriodIndex。
正确做法是先用 set_index() 把时间列设为索引,再调用 resample:
df = df.set_index('date')<br>df_resampled = df.resample('D').mean()
注意:如果 'date' 列还不是 datetime 类型,得先转换:df['date'] = pd.to_datetime(df['date']),否则 set_index 后索引仍是 object 类型,resample 依然失败。
常见频率字符串怎么选:'D'、'MS'、'15T' 的区别
频率字符串决定重采样窗口的边界和对齐方式,选错会导致数据偏移或丢失。
-
'D':日频,窗口从当天 00:00 开始,到 23:59:59.999 结束 -
'MS':月起始频(Month Start),窗口从每月 1 日 00:00 开始,不是自然月(如 1 月 1 日 → 2 月 1 日) -
'M':月结束频(Month End),窗口截止到每月最后一天 23:59:59.999 -
'15T':15 分钟频(T = minute),窗口按整点对齐(如 00:00–00:14、00:15–00:29),不是按原始数据时间截断
例如,原始数据最早时间是 '2023-01-01 08:03',用 resample('D') 仍会从 '2023-01-01' 开始聚合;但用 resample('24H') 则从该时间点向后推 24 小时切分,行为不同。
如何保留原始时间戳作为新索引的起点
默认 resample 返回的索引是窗口的右边界(如 'D' 对应每天 23:59:59.999),常让人困惑。想让索引显示窗口左边界(如每天 00:00),加参数 label='left' 和 closed='left':
Python 3.14.2是Python编程语言在2025年12月5日发布的稳定版本,属于3.14系列的第二个维护更新。该版本包含了18项修复,重点解决了多进程、数据类及正则表达式等模块的回归问题,并修复了CVE-2025-12084等安全漏洞。此版本标志着自由线程模式(移除GIL)正式获得官方支持,是Python发展的重要里程碑。
df.resample('D', label='left', closed='left').mean()
其中:
– label 控制返回索引显示哪一端('left' 或 'right')
– closed 控制区间是否包含左/右端点('left' 表示 [start, end),'right' 表示 (start, end])
二者需配合使用,否则可能漏掉首条或末条数据。
聚合时遇到 NaN 怎么办:agg() 里指定不同列不同函数
时间序列中,不同字段适合不同聚合逻辑:数值列常用 mean() 或 sum(),但状态类字段(如 'status')可能需要 first() 或 last(),而计数类字段要 count()。
直接传函数(如 .mean())会统一处理所有数值列,不够灵活。改用 agg() 并传入字典:
df.resample('H').agg({<br> 'temperature': 'mean',<br> 'humidity': 'max',<br> 'device_id': 'nunique',<br> 'event_flag': 'sum'<br>})
注意:
– 字典 key 必须是列名,value 是函数名字符串或实际函数对象
– 若某列未在字典中,会被自动丢弃
– 'nunique' 这类非标准函数名可用字符串,也可传 pd.Series.nunique
重采样本身不补数据,遇到全 NaN 窗口,默认返回 NaN;如需填充,得在 resample 后链式调用 fillna() 或 bfill(),不能靠 resample 参数解决。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










