
本文详解如何基于 functions 列为 4 或 7 的行(对应 cat == '4-7')划分逻辑组,并为每组内所有行高效填充该组 Price 的 min/max 值,满足业务中“跨行滚动区间极值”的典型需求。
本文详解如何基于 `functions` 列为 4 或 7 的行(对应 `cat == '4-7'`)划分逻辑组,并为每组内所有行高效填充该组 price 的 min/max 值,满足业务中“跨行滚动区间极值”的典型需求。
在金融、交易或时序数据分析中,常需根据特定标记事件(如 functions 为 4 或 7)将数据划分为连续段,并为每一段计算其价格(Price)的全局最小值和最大值——而非滚动窗口,而是以标记行为边界、向后覆盖至下一标记前的所有行。Pandas 提供了简洁高效的向量化方案,完全避免低效的 for 循环和手动索引管理。
✅ 核心思路:用 cumsum() 构建分组标识符
关键在于将每个 cat == '4-7'(或等价地 functions.isin([4, 7]))的行视为一个新分组的起点。我们利用布尔序列的累积和(cumsum)生成唯一组 ID:
# 方法1:以当前"4-7"行为起点,向后覆盖到下一个"4-7"前(含当前行)
group = df['cat'].eq('4-7').cumsum()
# 方法2(更贴合题意):以当前"4-7"行为终点,向前覆盖到上一个"4-7"后(含当前行)
# → 先倒序标记,cumsum,再倒序还原
group = df.loc[::-1, 'cat'].eq('4-7').cumsum()[::-1]
df['cat'].eq('4-7') 生成布尔 Series,cumsum() 将每个 True 视为新组起始,自动为连续行分配相同组号。例如:
| index | cat | .eq('4-7') | cumsum() → group |
|---|---|---|---|
| 30 | 3-8 | False | 0 |
| 31 | 4-7 | True | 1 |
| 32 | 3-8 | False | 1 |
| 33 | 3-8 | False | 1 |
| 34 | 3-8 | False | 1 |
| 35 | 1-6 | False | 1 |
| 36 | 4-7 | True | 2 |
这样,第31–35行同属 group=1,其 min/max 即为这5行 Price 的极值。
✅ 向量化实现:groupby().transform()
一旦分组完成,使用 transform('min') 和 transform('max') 即可为每组内所有行广播计算结果:
import pandas as pd
import numpy as np
# 确保数据已加载为 DataFrame df
group = df.loc[::-1, 'cat'].eq('4-7').cumsum()[::-1] # 以当前行为终点的分组
df['min'] = df.groupby(group)['Price'].transform('min')
df['max'] = df.groupby(group)['Price'].transform('max')
# 可选:仅在 functions ∈ [4, 7] 的行保留值,其余置空(按题目示例格式)
mask = df['functions'].isin([4, 7])
df['min'] = df['min'].where(mask)
df['max'] = df['max'].where(mask)
? 为什么用倒序
cumsum?
题目要求“min/max 计算从上一个 4 或 7 开始,到当前 4 或 7 结束”。正序cumsum()会以第一个 4/7 为起点向后延伸;而倒序处理再反转,能自然形成“以当前行为终点”的分组逻辑,完美匹配示例输出(如第36行7对应的 min=50876.45,即从第31行4到第36行7的区间极值)。
⚠️ 注意事项与进阶技巧
-
空值处理:若数据末尾无
4-7行,最后一组可能不完整。可通过group.fillna(method='ffill')或预填充确保分组连续。 -
性能优势:相比循环遍历,
groupby.transform是纯向量化操作,对万级数据提速 10x+。 -
灵活条件替换:若未来需用
functions判断而非cat,直接替换为:group = df.loc[::-1, 'functions'].isin([4, 7]).cumsum()[::-1]
-
包含边界优化(高级):若需让每个
4-7行的 min/max 包含下一个4-7的价格(如示例中第49行4的 max=51511.4,实为后续第53行7的 Price),可结合shift(-1)与np.fmax调整:g = df.groupby(group)['Price'].agg(['min', 'max', 'first']) next_first = g['first'].shift(-1) # 下一组首个 Price df['min'] = df[group].map(np.fmin(g['min'], next_first)) df['max'] = df[group].map(np.fmax(g['max'], next_first))
✅ 总结
通过 cumsum() 构建语义化分组 + transform() 广播聚合,一行代码即可替代易错、低效的手动循环逻辑。该模式适用于任何“事件驱动分段 + 区间统计”的场景,是 Pandas 高级数据处理的典型范式。务必优先使用向量化方案,既提升可读性,又保障性能与健壮性。










