跨机器加载pytorch模型失败的主因是未固定随机状态、设备不匹配、自定义类缺失或版本不兼容;应保存state_dict、调用model.eval()、加载时指定map_location并确保环境一致。

模型保存时没固定随机状态,跨机器加载出错
PyTorch 模型在 A 机保存、B 机加载失败,常见原因之一是 torch.save() 保存了含随机状态的模块(比如 Dropout 或 BatchNorm 的训练态),而 B 机 PyTorch 版本或 CUDA 环境不同,导致反序列化时内部张量校验失败或行为不一致。
- 务必在保存前调用
model.eval(),关闭Dropout和BatchNorm的训练逻辑 - 避免保存整个模型对象(
torch.save(model, ...)),改用保存状态字典:torch.save(model.state_dict(), ...) - 如果必须保存完整模型,确保两台机器的 PyTorch 版本完全一致(包括
1.13.1+cu117这种带 CUDA 后缀的版本)
保存和加载时设备不匹配引发 RuntimeError
在 GPU 上训练并保存的模型,直接在无 GPU 的机器上调用 torch.load(...) 会报错:RuntimeError: Attempting to deserialize object on a CUDA device。
- 保存时无需特殊操作,但加载时必须显式指定
map_location: - 加载到 CPU:用
torch.load('model.pth', map_location='cpu') - 加载到特定 GPU:用
torch.load('model.pth', map_location='cuda:0') - 更健壮写法:
torch.load('model.pth', map_location=torch.device('cpu')),避免字符串硬编码
自定义类或模块未在加载环境中定义
如果模型里用了自定义 nn.Module 子类(比如 MyResBlock),而加载机器没导入该类,torch.load() 会抛出 AttributeError: Can't get attribute 'MyResBlock' on <module></module>。
- 确保加载脚本中已执行
from my_model_module import MyResBlock(不是只 import model 文件本身) - 不要把自定义类写在 Jupyter notebook 的 cell 里——这类对象无法被序列化还原
- 检查
sys.path是否包含自定义模块路径;必要时用sys.path.insert(0, '/path/to/your/module') - 若用
state_dict方式保存,只要模型结构代码一致,就不依赖类定义(但需保证model.load_state_dict(...)前已实例化好结构)
Python 或 PyTorch 版本差异触发 pickle 兼容问题
高版本 Python(如 3.11)保存的模型,在低版本(如 3.8)上加载可能失败,尤其当模型里存了 lambda、嵌套函数或新语法对象时;PyTorch 1.12+ 默认用 protocol 5 序列化,旧版本不支持。
- 保存时强制降级 pickle 协议:
torch.save(..., _use_new_zipfile_serialization=True, pickle_protocol=4) - 更稳妥做法:统一使用
state_dict+ 显式模型定义,避开 pickle 反序列化逻辑 - 验证方式:在目标机器上先运行
import torch; print(torch.__version__, sys.version),再比对保存环境
跨机器部署模型最稳的路径就是:保存 state_dict + 记录模型结构代码 + 固定 torch.manual_seed + 加载时指定 map_location。任何省略其中一环,都可能卡在某个看似无关的报错上。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











