设 torch.manual_seed(42) 仍不可复现,因仅重置 cpu rng;gpu、cudnn、dataloader 子进程、python/numpy random、环境变量 pythonhashseed 及第三方库 rng 均需单独设种。

torch.manual_seed() 只控制 PyTorch CPU RNG,不碰 GPU、NumPy、Python random、cuDNN、DataLoader 子进程——这五个地方任何一个跑偏,结果就不可复现。
为什么设了 torch.manual_seed(42) 还是每次结果不一样?
因为 PyTorch 的随机数生成器(RNG)是分层隔离的:torch.manual_seed() 仅重置 CPU RNG 状态;GPU RNG 完全独立,且默认未初始化。你在 GPU 上调用 torch.rand(1000, device='cuda'),实际用的是未设置过的 CUDA RNG,输出自然每次不同。
常见错误现象:
- 同一脚本在 CPU 上可复现,换 GPU 就飘
- 模型权重初始化一致,但
DataLoadershuffle 后 batch 顺序总变 - 训练 loss 前 10 epoch 看似稳定,第 11 epoch 开始抖动
实操建议:
- 必须显式调用
torch.cuda.manual_seed(seed)和torch.cuda.manual_seed_all(seed)(多卡时) - 不要依赖
torch.manual_seed()“自动同步” GPU 种子——版本行为不一致,尤其在 PyTorch ≥2.0 中更不可靠 - 验证是否生效:在 seed 设置后立即生成一个 GPU tensor,打印其前 3 个值,两次运行应完全一致
torch.backends.cudnn.benchmark=True 是隐藏的随机开关
cuDNN 默认开启 benchmark,它会在首次运行卷积/池化时尝试多种算法(如 Winograd、FFT),选“最快”的那个。但这个“最快”取决于当前 GPU 负载、显存碎片、甚至驱动调度——同一 kernel 可能选不同实现路径,浮点累加顺序随之改变,误差逐步放大。
典型症状:
inference.sh 的 Python SDK:运行 AI 应用、构建智能体,并集成 150 多个模型。包名:inferencesh (pip install inferencesh)。支持同步/异步……
- 训练 loss 曲线每次运行起始段形态不同(非单调、拐点位置漂移)
- 相同模型在 A100 和 V100 上指标差异超 1%,即使 seed 全设
实操建议:
- 强制关闭:
torch.backends.cudnn.benchmark = False - 同时启用确定性模式:
torch.backends.cudnn.deterministic = True(注意:会小幅降低吞吐) - 如果必须开 benchmark(如推理部署),请接受不可复现性,并改用
torch.use_deterministic_algorithms(True)(PyTorch ≥1.8)作兜底
DataLoader 的 num_workers > 0 本质是多进程随机黑洞
每个 worker 进程继承父进程 seed,但不会自动重置自己的 RNG 状态;OS 调度顺序、进程启动时间差、共享内存竞争,都会让各 worker 内部的 random / numpy / torch RNG 走向不同演化路径。
使用场景:
- 带
shuffle=True的训练集加载 - 用了 Albumentations 或 torchvision.transforms.RandomXXX
实操建议:
- 调试/验证阶段一律用
num_workers=0 - 生产环境需多进程时,必须在每个 worker 初始化函数中重设所有种子:
worker_init_fn=lambda id: torch.manual_seed(seed + id),且要同步random和np.random - 第三方增强库(如 Albumentations)必须显式传
seed=xxx参数,否则它用自己的 RNG,完全绕过你的 seed 设置
还有三个常被忽略的随机源
它们不常被写进“set_seed”模板,但出问题时最难排查:
-
os.environ['PYTHONHASHSEED']:影响 dict/set 遍历顺序、模块导入顺序,间接改变模型结构初始化顺序(比如nn.Sequential中 layer 构建顺序) -
torch.use_deterministic_algorithms(True):强制所有算子走确定性路径(包括atomicAdd替代方案),但部分算子会报错或降级为 CPU 实现 - 第三方库 RNG:scikit-learn 的
train_test_split、lightning 的Trainer、huggingfacedatasets的shuffle,都得单独设 seed
最容易被忽略的地方是:随机性不是“有没有 seed”,而是“seed 是否传播到每一个 RNG 实例”。哪怕只漏掉一个子进程、一个第三方 transform、一个环境变量,整个实验链就断了。复现失败时,别急着改模型,先检查这七处 RNG 是否全部钉死。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










