
本文介绍如何在 Pandas 中结合 groupby 与时间频次(如每5分钟)和另一列(如价格)进行多级分组,并对指定列(如成交量)计算组内累积和,进而筛选出首次超过指定阈值(如100)的记录。
本文介绍如何在 pandas 中结合 `groupby` 与时间频次(如每5分钟)和另一列(如价格)进行多级分组,并对指定列(如成交量)计算**组内累积和**,进而筛选出首次超过指定阈值(如100)的记录。
在金融或时序数据分析中,常需按固定时间窗口(如5分钟K线)和离散维度(如成交价格)联合分组,并追踪某指标(如成交量)的组内累计过程——而非简单聚合(如 sum)。此时,groupby(...).cumsum() 是核心工具,它保留原始行结构,在每个逻辑分组内逐行累加,便于定位“突破点”。
首先,需将字符串时间列转换为 datetime 类型,否则无法使用 .dt.floor('5T') 等时间操作:
import pandas as pd
data = {
'time': ['10:00', '10:01', '10:02', '10:02', '10:03', '10:04', '10:06', '10:10', '10:15'],
'price': [100, 101, 101, 103, 101, 101, 105, 106, 107],
'volume': [50, 60, 30, 80, 20, 50, 10, 40, 40]
}
df = pd.DataFrame(data)
# 补全年份日期(因仅含时间,需指定基准日以构造完整 datetime)
df['time'] = pd.to_datetime('2024-01-01 ' + df['time'])
接着,使用 df['time'].dt.floor('5T') 将时间向下取整至最近的5分钟边界(如 '10:02' → '10:00', '10:06' → '10:05'),再与 'price' 组成复合分组键:
df['cum_volume'] = (
df.groupby([df['time'].dt.floor('5T'), 'price'])['volume']
.cumsum()
)
该操作确保:同一5分钟窗口内、相同价格的所有记录,其 cum_volume 值按原始顺序累加。例如,10:01/10:02/10:03/10:04 均属于 '10:00' 窗口,且价格均为 101,因此它们的 volume(60→30→20→50)被依次累加为 60 → 90 → 110 → 160。
最后,通过布尔索引或 query() 快速筛选突破阈值的行:
result = df[df['cum_volume'] > 100]
# 或等价写法:
# result = df.query('cum_volume > 100')
print(result)
输出将精准返回首次达到并超过100的时刻及后续同组记录(如示例中的 10:03 和 10:04)。
⚠️ 注意事项:
- 时间列必须为 datetime64 类型,否则 .dt 访问器不可用;
- '5T' 与 '5min' 等价,但推荐使用 '5T'(更通用);
- cumsum() 依赖原始 DataFrame 的行序,若数据未按时间排序,应先执行 df.sort_values('time', inplace=True);
- 若需获取“每个分组中首个超阈值的时间”,可在结果上进一步 groupby(['time'.dt.floor('5T'), 'price']).first()。
此方法兼具灵活性与性能,是处理带条件的时序分组累积分析的标准实践。











