最快方法是直接用torchvision.models.resnet50(pretrained=true)加载预训练权重并替换fc层为nn.linear(2048, num_classes),同时严格按imagenet规范做resize(256)+centercrop(224)和normalize([0.485,0.456,0.406],[0.229,0.224,0.225])。

直接用 torchvision.models.resnet50 加预训练权重,再微调最后的全连接层,是最快能跑通 ResNet 图像分类的方法。硬从零手写 ResNet 模块反而容易出错,也不利于调试。
加载预训练 ResNet 并替换分类头
PyTorch 官方实现的 resnet50 默认输出 1000 类(ImageNet),你自己的数据集类别数不同,必须改 fc 层。不改会导致 RuntimeError: mat1 and mat2 shapes cannot be multiplied。
- 用
model = torchvision.models.resnet50(pretrained=True)加载带 ImageNet 权重的模型 - 检查原
fc层:打印model.fc,能看到它是Linear(in_features=2048, out_features=1000, bias=True) - 替换成你的类别数:
model.fc = nn.Linear(2048, num_classes),别漏掉num_classes是整数(比如 12) - 如果想冻结前面所有层只训分类头,加
for param in model.parameters(): param.requires_grad = False,再单独放开model.fc的参数
输入图像尺寸与归一化必须匹配预训练要求
ResNet 预训练时用的是 224×224 图像,并按 ImageNet 统计值做了归一化。喂进模型前不做对应处理,准确率会断崖式下跌,且 loss 不降、梯度爆炸都可能发生。
- 缩放和裁剪用
transforms.Resize(256)+transforms.CenterCrop(224),别直接Resize(224)—— 会拉伸变形 - 归一化必须用 ImageNet 的均值和标准差:
transforms.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225]) - 顺序不能错:先
ToTensor()(自动把 [0,255] → [0,1]),再Normalize();反过来会报TypeError: tensor is not a torch image
训练时 batch size 太大会 OOM,但太小又影响 BN 层效果
resnet50 的 bottleneck 模块里大量使用 BatchNorm,它依赖 batch 内统计量。batch size 小于 8 时,BN 的 running_mean / running_var 更新不稳定,验证准确率波动大,甚至收敛失败。
- 显存够就优先用
batch_size=32或64;2080Ti 上跑 224×224 输入,batch_size=64通常刚好 - 显存不足时,可改用
torch.cuda.amp.autocast()混合精度训练,省一半显存,且基本不影响精度 - 千万别为了塞更大 batch 而关掉 BN —— 改成 InstanceNorm 或 LayerNorm 会导致迁移效果大幅下降
- 如果只能用
batch_size=4,建议换resnet18,它的 BN 层对小 batch 更鲁棒
真正卡住的地方往往不是网络结构,而是数据加载 pipeline 中 transforms 写错顺序、归一化参数抄错一位、或者忘了把模型 .to(device) 导致 tensor 在 CPU 和 GPU 间隐式拷贝——这些错误不会报明显异常,但 loss 停滞、acc 不涨,得逐行 print shape 和 device 才能揪出来。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











