用shift()计算同比需先确保时间索引为排序的datetimeindex,月度数据用shift(12),并处理缺失值与除零;pct_change(12)是其封装,但手动shift更易干预。

用 shift() 计算同比:核心是错位对齐两期数据
年度同比增长本质就是当前期(如2024年3月)和去年同期(2023年3月)的比值变化。Pandas里最直接的方式不是写循环,而是用 shift() 把整列数据向下移动12行(月度数据)或1行(年度汇总),让“今年”和“去年”自动对齐到同一行再计算。
关键点在于:对齐必须基于时间索引且已排序。如果 df.index 是 DatetimeIndex 且按升序排列,df['value'].shift(12) 就会把2023-03-01的值挪到2024-03-01这一行——前提是数据是规则月频(如每月1号)。若存在缺失月份或非标准频率,shift(12) 会按行数硬移,可能错配。
- 月度数据:用
shift(12),但需确认数据无断点(可用df.asfreq('MS')补齐) - 季度数据:用
shift(4)(假设是Q-DEC等标准季频) - 年度数据:直接
shift(1) - 若索引是字符串(如'2024-03'),先转成
DatetimeIndex再sort_index()
避免常见错误:shift() 后除零、NaN 和时序错位
直接写 (df['sales'] / df['sales'].shift(12) - 1) * 100 很容易报错或出怪数。原因有三:一是前12行 shift(12) 返回 NaN,导致同比结果全为 NaN;二是分母为0(比如去年某月销量为0);三是未处理缺失月份导致错位(例如2023年2月缺数,那2024年2月的同比实际对的是2023年1月)。
- 加
.dropna()或用pd.Series.div(..., fill_value=None)控制除零行为 - 用
df['sales'].replace(0, pd.NA)预先把0转为缺失,避免除零警告 - 更稳妥的做法:先用
df.resample('MS').sum().fillna(0)统一重采样,再shift(12) - 检查对齐效果:打印
df[['sales', 'sales_last_year']].head(15)看是否真对应了同月
替代方案:diff() 和 pct_change() 的适用边界
pct_change(periods=12) 看起来更简洁,但它底层也是调用 shift(),只是封装了一层。区别在于:pct_change() 默认忽略缺失值做除法,而手动写 shift() 更易干预中间步骤(比如加条件过滤、替换分母)。
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
-
df['sales'].pct_change(12)≈(df['sales'] / df['sales'].shift(12) - 1),但前者对除零返回NaN,后者抛异常(取决于环境) -
diff(12)只算绝对差值,不能直接得“%”,但适合看增量稳定性 - 若需滚动同比(如最近12个月 vs 上一个12个月),得用
rolling(24).sum()拆解,不能只靠shift()
真实场景示例:带月份标签的销售表计算同比
假设你有月度销售表 df,索引是 DatetimeIndex,列是 'sales':
df = df.sort_index() # 必须确保升序 df['sales_ly'] = df['sales'].shift(12) df['yoy_pct'] = (df['sales'] / df['sales_ly'] - 1) * 100 df['yoy_pct'] = df['yoy_pct'].where(df['sales_ly'] != 0) # 分母为0则置空
注意:这里没用 fillna(0) 去补 sales_ly,因为补0会导致同比变成无穷大;保留 NaN 反而更真实——表示“无可比同期数据”。真正上线时,常需配合 df.loc[df.index >= '2023-01-01', 'yoy_pct'] 截断首年无效值。
最易被忽略的是时间索引的完整性。哪怕只缺一个月,shift(12) 就会整体偏移——这不是函数问题,是数据前提没满足。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










