pytorch中nn.conv2d的默认初始化是kaiming均匀分布,即调用torch.nn.init.kaiming_uniform_(weight, a=math.sqrt(5)),偏置则按1/√fan_in的均匀分布初始化。

PyTorch中nn.Conv2d的默认初始化是什么?
PyTorch 1.12+ 版本中,nn.Conv2d(以及 nn.Linear 等)在实例化时**自动调用 torch.nn.init.kaiming_uniform_**(非线性为 relu 时)或 kaiming_normal_(leaky_relu 时),前提是权重未被手动赋值。这个行为由 reset_parameters() 方法触发,而该方法在 nn.Module.__init__ 中被隐式调用。
但注意:一旦你显式给 weight 赋值(比如 conv.weight = ...),默认初始化就失效了;另外,自定义 nn.Module 子类若重写了 reset_parameters 却没调用 super().reset_parameters(),也会跳过默认逻辑。
- 验证方式:创建
conv = nn.Conv2d(3, 64, 3)后打印conv.weight.mean().item(),通常在 ±0.05 内,符合 Kaiming 均匀分布的理论均值 - 不推荐依赖默认行为做关键实验——显式初始化更可控、可复现
如何对已有模型批量重置卷积层权重?
训练中途想重初始化部分层(比如微调时只重置最后几层),或加载预训练权重后想覆盖某几层,需手动遍历并调用初始化函数。
核心是用 model.modules() 或 model.named_modules() 过滤出 nn.Conv2d 实例,再对其 weight 和可选的 bias 调用初始化函数:
for m in model.modules():
if isinstance(m, nn.Conv2d):
nn.init.kaiming_normal_(m.weight, mode='fan_out', nonlinearity='relu')
if m.bias is not None:
nn.init.constant_(m.bias, 0)
这里 mode='fan_out' 是 PyTorch 默认值,适合前向传播方差稳定;若网络以反卷积或上采样为主,可改用 'fan_in'。
- 别漏掉
bias:虽然很多论文忽略它,但nn.init.constant_(m.bias, 0)是常见稳妥做法 - 避免对
BatchNorm2d的weight也调用kaiming_*——它的weight是缩放因子,应初始化为 1(nn.init.ones_(m.weight))
nn.init.xavier_uniform_ 和 kaiming_normal_ 怎么选?
选择取决于你用的激活函数和网络深度:
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
- 用
nn.Tanh或nn.Sigmoid→ 选xavier_uniform_或xavier_normal_(它们假设线性激活,适配饱和型函数) - 用
nn.ReLU、nn.LeakyReLU→ 必须选kaiming_*系列,否则前向信号易衰减或爆炸 - 深层网络(>50 层)建议用
kaiming_normal_(高斯分布更利于梯度流动),轻量模型用kaiming_uniform_已足够
示例对比:
# ReLU 模型里错误地用了 Xavier nn.init.xavier_uniform_(conv.weight) # 可能导致早期层梯度消失 <h1>正确写法</h1><p>nn.init.kaiming<em>normal</em>(conv.weight, nonlinearity='relu')</p>
自定义初始化函数要注意什么?
如果你写自己的初始化逻辑(比如按通道分组初始化、或引入噪声),必须确保:
- 操作直接作用于
tensor.data(如m.weight.data.normal_(0, 0.01)),而不是m.weight本身,否则可能破坏计算图或引发 in-place 错误 - 初始化后调用
m.weight.requires_grad = True(虽然通常默认就是 True,但显式设一遍更安心) - 不要在
forward中做初始化——那会每次前向都重置,模型根本学不起来
一个易错点:nn.init 函数全部是 in-place 操作,传入的 tensor 会被原地修改。所以 weight = nn.init.kaiming_normal_(weight) 是冗余的,直接写 nn.init.kaiming_normal_(m.weight) 即可。
真正容易被忽略的是:不同设备(CPU/GPU)下随机数生成器状态独立,如果模型先在 CPU 初始化、再 .to(device),初始化结果不变;但如果在 GPU 上初始化,需确保 torch.cuda.manual_seed() 与 CPU 种子一致,否则多卡训练时各卡初始权重不同。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










