numpy 本身不提供开箱即用的平滑滤波器,但可通过 np.convolve 或 scipy.ndimage.convolve1d 高效实现;移动平均需手动归一化核、注意边界处理与 nan 影响。

NumPy 本身不提供开箱即用的「平滑滤波器」(如高斯、Savitzky-Golay),但能高效支撑其底层实现——关键在于用 np.convolve 或 scipy.ndimage.convolve1d(后者更稳),而非徒手写循环。
用 np.convolve 做简单移动平均平滑
这是最轻量、纯 NumPy 的方式,适合一维信号(如时间序列),但要注意边界处理和归一化。
- 移动平均核必须手动归一化:比如长度为 5 的均值滤波,要用
np.ones(5)/5,不能只用np.ones(5),否则结果整体放大 -
mode参数决定输出长度:"valid"最安全(丢弃边界,无填充),"same"保持原长(但 NumPy 不自动补零,需手动 pad 或改用scipy.signal.convolve) - 示例:
import numpy as np<br>x = np.array([1, 2, 3, 4, 5, 4, 3, 2, 1])<br>kernel = np.ones(3) / 3<br>y = np.convolve(x, kernel, mode="same") # 注意:mode="same" 在 NumPy 中会补零,但首尾两元素是近似值
为什么不用 np.mean 滑动窗口?
有人想用 np.mean 配合切片循环实现滑动平均,这在小数组上可行,但实际中极易出错且慢。
- 手动管理索引易越界,尤其当窗口大小 > 数组长度时,
IndexError直接中断 - Python 循环 + 切片触发大量内存拷贝,
np.convolve底层调用优化过的 C 实现,速度通常快 10–100 倍 - 无法利用 CPU 向量化指令;而
convolve内部已做 stride 和 cache 友好处理
遇到 NaN 数据怎么办?
原始信号含 np.nan 时,np.convolve 会污染整个结果(只要核覆盖任一 NaN,对应输出即为 NaN)。这不是 bug,是设计行为。
- 先用
pd.Series(x).rolling(w).mean()(如果允许引入 pandas)——它默认跳过 NaN - 纯 NumPy 方案:用
np.nanmean+ 手动滑动(仅当数据稀疏 NaN 且窗口小才可接受) - 更鲁棒的做法:用
scipy.ndimage.uniform_filter1d(x, size=5, mode="nearest"),它天然支持mode控制边界,并跳过 NaN(需设origin=0和mode="constant"配合cval=np.nan,但注意版本差异)
真正难的不是写出一个能跑的平滑函数,而是选对核、控住边界、处理缺失值、并意识到 np.convolve 的 "same" 模式在首尾其实做了隐式零填充——这点常被忽略,导致信号起止处失真。如果数据敏感,务必可视化前 5 和后 5 个点的输入/输出对比。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











