fpn在pytorch中需手动组合实现,核心是横向1×1卷积对齐通道+自顶向下上采样相加+3×3输出卷积;必须用nn.modulelist为各层单独定义卷积,输入需ordereddict且通道数严格匹配,输出按p2→p5高到低分辨率顺序。

FPN在PyTorch中不是独立模块,而是通过nn.Module组合实现
PyTorch官方 torchvision 中的 torchvision.models.detection.backbone_utils.FPN 是现成可用的封装,但它不直接暴露“FPN层”的训练细节——它本质是把主干网络(如 ResNet)的若干中间特征图做上采样+相加+卷积,输出多尺度特征。你无法靠调用一个函数就“自动获得FPN”,必须明确指定输入特征层级、通道数和输出通道数。
常见错误是直接对 backbone 输出做 F.interpolate 后拼接,却忽略横向连接(lateral connection)中的 1×1 卷积降维,导致通道不匹配或梯度传递异常。
-
backbone必须返回 OrderedDict,key 为字符串(如 "0", "1", "2", "3"),value 为对应 stage 的 feature map;否则FPN初始化会报错KeyError: '0' - 各 stage 输出通道需与
in_channels_list严格一致,例如 ResNet50 第2~5 stage 输出通道分别是 256, 512, 1024, 2048,对应in_channels_list = [256, 512, 1024, 2048] -
out_channels通常设为 256(主流检测头如 RetinaNet / FCOS 默认输入通道),所有输出层统一该值
手动构建FPN时,lateral conv和output conv不能共用同一组权重
FPN 核心是两路操作:横向路径(lateral)做 1×1 卷积对齐通道,自顶向下路径(top-down)做上采样后相加,最后再经 3×3 卷积(output conv)消除混叠。如果复用同一个 nn.Conv2d 实例,会导致不同层级共享参数,破坏多尺度表征能力。
典型错误写法:self.lateral_conv = nn.Conv2d(...) 然后在 forward 中循环调用它处理不同尺寸特征——这会让 P2/P3/P4/P5 共享同一组权重,实际效果接近单尺度特征。
- 应为每个 lateral 层单独定义
nn.Conv2d,例如self.lateral_convs = nn.ModuleList([nn.Conv2d(c, out_c, 1) for c in in_channels_list]) - output conv 同理,建议用
nn.ModuleList管理,避免隐式复用 - 上采样推荐用
F.interpolate(x, scale_factor=2, mode="nearest"),避免nn.Upsample引入额外可学习参数
FPN输出顺序必须从高分辨率到低分辨率(P2→P5)
目标检测 head(如 RetinaNetHead 或自定义 anchor-free head)默认按 P2→P3→P4→P5 顺序接收特征,且假设 P2 分辨率最高(如 1/4 输入尺寸)、P5 最低(1/32)。若输出顺序颠倒(如 P5→P2),anchor stride 或 regressed offset 会全部错位,loss 爆涨但不报错。
torchvision 的 FPN 类内部已按 key 字典序排序("0"FPN 会把 res5 当作最低层输入。
- 确保 backbone 返回的 dict keys 是数字字符串且升序,例如
{"0": feat2, "1": feat3, "2": feat4, "3": feat5} - 输出字典 keys 应为
{"0": p2, "1": p3, "2": p4, "3": p5},与输入一一对应 - 若需跳过某层(如不用 P2),应在构造 FPN 时显式传入
in_channels_list和out_channels,而非删减输入 dict
FPN本身不包含检测头,必须接 separate head 才能训练
FPN 只是特征提取器,输出的是多尺度 feature map,不是分类/回归结果。直接拿 FPN(...)(x) 的输出去算 loss 会报维度错误——因为它的输出仍是 Dict[str, Tensor],而检测 loss 需要 [B, C, H, W] 形状的 logits 和 bbox preds。
常见误操作:把 FPN 当作完整模型导出 ONNX,结果推理时只拿到特征图,没有后续 head,无法部署。
- 必须搭配 detection head,例如 torchvision 的
RetinaNetHead或自定义FCOSHead - head 的输入通道数必须与 FPN 输出通道一致(默认 256),否则
RuntimeError: Given groups=1, weight of size [...] - 训练时 loss 计算需对每个 level 分别进行(如 per-level focal loss + IoU loss),不能把所有 level 的 pred stack 后统一算
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











