z-score超±3通常为离群点,但直接用于时间序列易误判;应先滚动中心化或stl分解残差再检测,isolationforest更适合多维/非平稳场景。

用 scipy.stats.zscore 快速识别离群点,但要注意标准化范围
z-score 超过 ±3 通常被视作离群点,但它对时间序列直接应用容易误判——因为原始序列常含趋势或季节性,直接计算会把上升段末尾全标成异常。
正确做法是先做差分或用滚动窗口中心化:
import numpy as np<br>from scipy.stats import zscore<br><br># 假设 ts 是一维 ndarray<br>rolling_mean = ts.rolling(window=10).mean()<br>residuals = ts - rolling_mean<br>z_scores = np.abs(zscore(residuals, nan_policy='omit'))<br>outliers = np.where(z_scores > 3)[0]注意
nan_policy='omit' 必须显式指定,否则含 NaN 时 zscore 直接抛 ValueError: Input contains NaN。用 sklearn.ensemble.IsolationForest 处理多维时间特征更鲁棒
单变量 z-score 对脉冲型异常还行,但遇到平台偏移、缓慢漂移或多个指标联动异常(比如温度突升+湿度骤降),就得上无监督模型。IsolationForest 不依赖分布假设,适合小样本和高维时序特征工程后的输入:
from sklearn.ensemble import IsolationForest<br>import pandas as pd<br><br># 构造特征:滞后项 + 移动标准差 + 一阶差分<br>df = pd.DataFrame({'value': ts})<br>df['lag1'] = df['value'].shift(1)<br>df['roll_std'] = df['value'].rolling(5).std()<br>df['diff'] = df['value'].diff()<br>df_clean = df.dropna()<br><br>model = IsolationForest(contamination=0.02, random_state=42)<br>pred = model.fit_predict(df_clean)<br>outlier_mask = pred == -1关键参数 contamination 不是阈值,而是预估异常比例;设太高会漏检,设太低(如 0.1)会导致正常波动也被干掉。建议先用 contamination=0.01~0.03 试,再看 model.decision_function() 分布调优。用 statsmodels.tsa.seasonal.STL 分离趋势/季节/残差后只在残差上找异常
对有明显周期性的数据(如每小时服务器 CPU、每日销售量),强行用全局统计方法找异常等于忽略结构,STL 分解能剥离可解释成分,让异常检测聚焦在“不可预测的扰动”上:
from statsmodels.tsa.seasonal import STL<br>import numpy as np<br><br>stl = STL(ts, seasonal=13) # 13 是周周期(小时级数据常用)<br>result = stl.fit()<br>residual = result.resid<br><br># 在 residual 上用 IQR 或 MAD 判定<br>q1, q3 = np.percentile(residual, [25, 75])<br>iqr = q3 - q1<br>lower_bound = q1 - 1.5 * iqr<br>upper_bound = q3 + 1.5 * iqr<br>outliers = np.where((residual upper_bound))[0]
seasonal 参数必须匹配真实周期(日数据填 7,月数据填 12),填错会导致趋势泄漏到残差里,后续所有异常判定都失真。另外 STL 默认要求长度 ≥ 2×seasonal + 1,短于该长度会报 ValueError: Not enough periods in data。替换异常值时别直接用均值,优先考虑 interpolate(method='time') 或前后加权平均
时间序列的连续性比静态数据重要得多,用全局均值或中位数填充会扭曲局部动态特征,尤其在高频数据中造成虚假平稳段。
推荐两种稳妥方式:
- 用
pandas.Series.interpolate(method='time'),它按时间索引线性插值(前提是索引是datetime类型) - 若索引非时间型,改用加权平均:取前 3 个和后 3 个非异常点,按距离倒数加权,避免边界震荡
ts_series = pd.Series(ts)<br>ts_series.iloc[outliers] = np.nan<br>filled = ts_series.interpolate(method='time', limit_direction='both')注意
limit_direction='both' 很关键——默认只向前填充,连续多个异常时后面仍为 NaN。真正难的不是识别出哪些点异常,而是判断“这个异常该不该修”。传感器断连产生的长段 NaN 后突然一个尖峰,和真实故障信号可能长得一样;业务侧临时促销带来的销量跃升,在统计模型眼里也是离群点。这类问题没法靠算法自动解,得把 outliers 索引连同前后 5 个点的原始值、残差、以及业务日志时间戳一起导出,人工过一遍才能下结论。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











