tf.keras.optimizers.schedules 是首选方案,因其自动兼容 eager 模式、分布式训练和 savedmodel 导出,支持 checkpoint,并以 step 数为单位精准控制学习率衰减。

为什么 tf.keras.optimizers.schedules 是首选方案
TensorFlow 2.x 中动态学习率衰减不再推荐手动在训练循环里计算或修改 optimizer.learning_rate,因为容易破坏 eager 模式下的图构建、影响分布式训练和 SavedModel 导出。官方调度器(如 ExponentialDecay、PiecewiseConstantDecay)会自动注册为可追踪变量,在 tf.function 内部正确求值,且与 Checkpoint 兼容。
- 调度器返回的是一个可调用对象,不是标量 —— 直接传给优化器即可,无需
.numpy()或.value() - 初始学习率必须设为调度器的起点值,不能同时在优化器和调度器里重复设置
- 所有调度器都以 step 数(非 epoch 数)为输入,注意
step是全局训练步数,不是每个 batch 的序号(Keras 自动传入)
ExponentialDecay 最常用但容易错配参数
这是最直观的指数衰减,但三个参数的物理意义常被混淆:
-
initial_learning_rate:训练开始时的学习率(例如1e-3) -
decay_steps:学习率下降一个 decay rate 所需的 step 数 —— 不是 epoch 数,也不是 batch size;若每 epoch 有 1000 步,想每 10 个 epoch 衰减一次,这里填10000 -
decay_rate:每次衰减后的乘子(例如0.96表示保留 96%,不是“衰减 96%”)
schedule = tf.keras.optimizers.schedules.ExponentialDecay(
initial_learning_rate=1e-3,
decay_steps=5000, # 每 5000 步衰减一次
decay_rate=0.96,
staircase=True # 设为 True 才是阶梯式衰减(推荐),False 是连续衰减
)
optimizer = tf.keras.optimizers.Adam(learning_rate=schedule)
-
staircase=False会导致学习率在每个 step 都微调,对调试不友好,也难复现 - 如果用
model.fit(),step 数由 Keras 自动累计;若自定义训练循环,需确保tf.Variable(step, trainable=False)并在每步后assign_add(1)
需要分段控制?用 PiecewiseConstantDecay 更稳妥
当你要明确指定“前 10 个 epoch 用 1e-3,接下来 5 个用 5e-4,最后用 1e-4”,别手写 if-else,直接用分段常数调度:
- 边界点(
boundaries)单位是 step,不是 epoch;需提前算好:假设 batch_size=32、dataset_len=32000,则每 epoch ≈ 1000 步 → 前 10 epoch 对应10000步 -
values长度必须比boundaries多 1(首段、中段、末段)
boundaries = [10000, 15000] # step 边界 values = [1e-3, 5e-4, 1e-4] # 对应三段学习率 schedule = tf.keras.optimizers.schedules.PiecewiseConstantDecay(boundaries, values) optimizer = tf.keras.optimizers.SGD(learning_rate=schedule, momentum=0.9)
- 错误做法:把 epoch 数直接塞进
boundaries→ 学习率几乎不变(因为 step 数远大于 epoch 数) - 注意
values是列表,不是元组;传错类型会报TypeError: Expected list
自定义衰减逻辑?继承 tf.keras.optimizers.schedules.LearningRateSchedule
当内置调度器不够用(比如带 warmup 的余弦退火),不要在 @tf.function 外写 Python 逻辑,而应子类化并实现 <strong>call</strong>:
class WarmUpCosineDecay(tf.keras.optimizers.schedules.LearningRateSchedule):
def __init__(self, initial_learning_rate, warmup_steps, total_steps):
self.initial_learning_rate = initial_learning_rate
self.warmup_steps = warmup_steps
self.total_steps = total_steps
<pre class="brush:python;toolbar:false;">def __call__(self, step):
# warmup 阶段线性上升
warmup_lr = self.initial_learning_rate * (step / self.warmup_steps)
# 余弦退火主阶段
cosine_step = tf.minimum(step, self.total_steps)
cosine_decay = 0.5 * (1 + tf.cos(np.pi * cosine_step / self.total_steps))
decayed = self.initial_learning_rate * cosine_decay
return tf.where(step <p>schedule = WarmUpCosineDecay(1e-3, warmup_steps=2000, total_steps=50000)</p>
- 必须用
tf.where和tf.minimum,不能用 Python 的if/else或min(),否则无法 trace 进图 - 所有数值运算要用
tf.*,包括tf.cos、tf.pi(没有np.pi)—— 否则会在 eager 模式下报错或静默失败
step 数的准确性决定一切。哪怕只差一个数量级,学习率可能从 1e-3 一路掉到 1e-8 早于训练结束,模型根本学不动。调试时建议在 callback 里打印 optimizer.learning_rate(step).numpy() 看实际值,别只信参数名。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











