梯度下降的核心在于手动推导并实现损失函数对权重的偏导及更新步骤,而非调用库函数;需明确梯度计算(如dw=2np.mean((y_pred-y)x))、学习率影响、标准化必要性及前向/梯度/更新三步分离。

梯度下降的核心是 gradient 计算和 weight -= lr * gradient 更新
不是调用 scikit-learn 或 PyTorch 就算理解了梯度下降——关键在手动推导并实现每一步。你得清楚:损失函数对每个权重的偏导怎么算,学习率怎么影响更新步长,以及为什么不能直接用解析解(比如正规方程)时才需要迭代。
以最简单的线性回归为例:y = w * x + b,目标是最小化均方误差 loss = np.mean((y_pred - y_true) ** 2)。它的梯度可以直接手推:dw = 2 * np.mean((y_pred - y_true) * x),db = 2 * np.mean(y_pred - y_true)。这些不是魔法,而是链式法则的直白展开。
- 别跳过手动求导——哪怕只推一次,能立刻区分
dw和db的维度差异 -
np.mean()比np.sum()更稳定,尤其在 batch size 变化时,避免梯度随样本数放大 - 初始
w和b别设为 0——用np.random.randn()更利于观察收敛过程是否卡住
NumPy 实现必须显式分离前向、梯度、更新三步
把计算揉成一行(比如 w -= lr * 2 * np.mean((w*x+b-y)*x))看着短,但掩盖了数据流,调试时根本看不出是前向出错、梯度符号反了,还是更新步长炸了。拆开写,才能逐段验证。
for epoch in range(100):
y_pred = w * X + b # 前向
loss = np.mean((y_pred - y) ** 2) # 损失
dw = 2 * np.mean((y_pred - y) * X) # 梯度
db = 2 * np.mean(y_pred - y)
w -= lr * dw # 更新
b -= lr * db
- 每次循环里打印
loss,确认它单调下降;一旦上升,大概率是lr太大或梯度符号错了 -
X和y必须是np.ndarray,且形状匹配——常见坑:X是 (N,) 而y是 (N, 1),乘法会广播出错 - 梯度公式里的
2来自d(x²)/dx = 2x,漏掉会导致收敛变慢,但不会发散
lr 太大会震荡,太小会龟速,没有通用值
0.01 在简单线性回归上可能刚好,但在特征量纲差异大的数据上(比如身高用米、收入用元),lr=0.01 会让某个权重几乎不动,另一个疯狂震荡。这不是调参玄学,是梯度本身被缩放了。
- 先做
from sklearn.preprocessing import StandardScaler对X标准化,再试lr=0.1——你会发现收敛快得多 - 如果不用标准化,至少检查
np.std(X)和np.std(y),让lr反比于它们的量级(例如lr = 0.1 / np.std(X)) - 别用固定
lr跑到底——加个简单衰减:lr = lr0 / (1 + 0.01 * epoch),能缓解后期抖动
验证收敛性比画损失曲线更重要
损失下降不等于权重接近真值。你得对比最终 w, b 和真实生成参数(如果是模拟数据),或用 np.allclose(w_final, w_true, atol=1e-3) 判定。
- 如果
loss下降到 1e-5 但w还差 10%,说明梯度计算有误(比如忘了除以样本数或漏了系数 2) - 用
np.linalg.norm(grad)监控梯度模长——理想情况它该逐渐趋近 0;如果卡在 0.1 附近,可能是学习率太小或陷入鞍点 - 批量大小(batch size)为 1 时叫随机梯度下降(SGD),但 NumPy 手动实现建议先用全量(batch size = len(X)),排除 mini-batch 带来的噪声干扰
真正卡住的地方往往不是公式写错,而是数组形状隐式广播、梯度正负号抄反、或者学习率和数据尺度完全不匹配——这些没法靠“多跑几次”解决,得盯着中间变量看。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











