
本文详解如何修正梯度下降实现中因梯度推导错误、参数更新逻辑混乱导致的θ值发散或不收敛问题,重点展示如何基于目标损失函数(erreurj)严格推导解析梯度,并采用单步向量化更新替代嵌套循环,确保算法稳定收敛至理论极小点。
本文详解如何修正梯度下降实现中因梯度推导错误、参数更新逻辑混乱导致的θ值发散或不收敛问题,重点展示如何基于目标损失函数(erreurj)严格推导解析梯度,并采用单步向量化更新替代嵌套循环,确保算法稳定收敛至理论极小点。
在机器学习实践中,梯度下降失效往往并非源于算法思想本身,而是隐藏在细节中的三类典型错误:梯度计算与损失函数不匹配、参数更新未同步、以及迭代过程引入冗余状态依赖。本教程以一个具体案例切入——用户实现的 erreurJ(theta) = 1/4 × [σ(θ₁)² + σ(θ₀ + θ₁)²](其中 σ(z) = z² − 1)——剖析并重构其梯度下降流程。
? 核心问题定位
原代码中存在两个关键缺陷:
-
梯度函数
gradient(X, Y, Ysol, ...)与损失函数erreurJ脱节:该函数试图用链式法则数值近似梯度,但输入X,Y,Ysol并未参与erreurJ的定义,导致计算对象错误; -
参数更新嵌套于
for i in range(len(theta))循环中:每次只更新一个分量theta[i],而后续h = calculh(theta, X)又立即使用已部分更新的 theta 计算新输出,破坏了梯度方向的一致性,引发震荡或偏移。
✅ 正确解法:解析梯度 + 向量化更新
我们直接对 erreurJ(θ₀, θ₁) 求偏导(注意 σ(z) = z²−1 ⇒ σ′(z) = 2z):
$$ egin{aligned} J( heta) &= rac{1}{4}left[ sigma( heta_1)^2 + sigma( heta_0 + heta_1)^2 ight] &= rac{1}{4}left[ ( heta_1^2 - 1)^2 + (( heta_0 + heta_1)^2 - 1)^2 ight] end{aligned} $$
展开并求导后可得解析梯度(与答案中 grad(theta) 一致):
def grad(theta):
w, b = theta[0], theta[1]
# ∂J/∂w, ∂J/∂b(经符号微分验证)
dw = 2*b**3 + 3*b**2*w + 3*b*w**2 - 2*b + w**3 - w
db = b**3 + 3*b**2*w + 3*b*w**2 - b + w**3 - w
return np.array([dw, db])
✅ 关键改进:
pasfixe()函数不再传入X,Y,Ysol,h等无关变量,仅依赖theta和预设的sigma,调用grad(theta)获取完整梯度向量,再执行原子化更新:theta = theta - eta * grad(theta) # 一次性更新两个参数
? 完整可运行代码(精简优化版)
import numpy as np
from random import randint, random
import matplotlib.pyplot as plt
# 定义激活函数及其导数
sigma = lambda z: z**2 - 1
sigmaprime = lambda z: 2 * z
# 损失函数(仅依赖 theta)
def erreurJ(theta, sigma):
return 0.25 * (sigma(theta[1])**2 + sigma(theta[0] + theta[1])**2)
# 解析梯度(核心!必须与 erreurJ 严格对应)
def grad(theta):
w, b = theta[0], theta[1]
dw = 2*b**3 + 3*b**2*w + 3*b*w**2 - 2*b + w**3 - w
db = b**3 + 3*b**2*w + 3*b*w**2 - b + w**3 - w
return np.array([dw, db])
# 改进后的梯度下降主函数
def pasfixe(theta, eta, epsilon, sigma, sigmaprime):
theta = np.array(theta, dtype=np.float64)
n = 0
while np.linalg.norm(grad(theta)) > epsilon and n 100): # 发散保护
return np.array([100.0, 100.0])
return theta
# 参数设置
eta = 0.01 # 学习率需调低(原0.1易震荡)
epsilon = 1e-4
n_trials = 5000
# 随机初始化并批量运行
lst = [[3 * random() * (-1)**randint(0, 1),
3 * random() * (-1)**randint(0, 1)] for _ in range(n_trials)]
listetheta = []
for init_theta in lst:
result = pasfixe(init_theta, eta, epsilon, sigma, sigmaprime)
listetheta.append(result.tolist())
# 可视化:按收敛结果着色
plt.figure(figsize=(8, 6))
for i, (init_w, init_b) in enumerate(lst):
final_w, final_b = listetheta[i]
rounded = [round(final_w), round(final_b)]
if rounded == [-2, 1]: plt.plot(init_w, init_b, 'bo', markersize=2)
elif rounded == [2, -1]: plt.plot(init_w, init_b, 'co', markersize=2)
elif rounded == [0, -1]: plt.plot(init_w, init_b, 'go', markersize=2)
elif rounded == [0, 1]: plt.plot(init_w, init_b, 'mo', markersize=2)
elif final_w**2 + final_b**2 >= 10: plt.plot(init_w, init_b, 'ro', markersize=2)
plt.xlabel("Initial Weight $w_0$")
plt.ylabel("Initial Bias $b_0$")
plt.title("Convergence Basins of Gradient Descent
on $J(\theta) = \frac{1}{4}[\sigma(\theta_1)^2 + \sigma(\theta_0+\theta_1)^2]$")
plt.grid(True, alpha=0.3)
plt.show()
⚠ 注意事项与调试建议
-
学习率敏感性:
eta=0.1在本例中过大,易跳过极小点;推荐从0.001~0.01起调,观察np.linalg.norm(grad(theta))是否单调衰减; -
梯度验证:可用数值梯度检验
grad(theta)正确性(如scipy.optimize.check_grad); -
初始化范围:
[-3,3]合理,但若扩大至[-10,10],需增强发散判断(如np.any(np.isnan(theta))); -
可视化增强:可叠加等高线图
plt.contour(..., erreurJ)直观对比收敛路径与损失地形。
通过严格绑定梯度与损失函数、消除更新时序干扰,本方案使梯度下降回归数学本质——沿负梯度方向高效滑向极小点,最终复现预期的收敛区域分布图。










