只调用random.seed()不够,因为它仅控制python内置random模块;numpy、pytorch(cpu/gpu)、cudnn、dataloader多进程等均有独立随机源,必须全部显式设置种子并禁用非确定性选项(如cudnn.benchmark=true)才能确保结果稳定复现。

只要在实验开始前正确设置所有相关随机源的种子,结果就能稳定复现——但漏掉任何一个随机源,就可能前功尽弃。
为什么只调用 random.seed() 不够
Python 有多个独立的随机数生成器:标准库 random、numpy、torch、甚至 tensorflow 都维护自己的状态。只设 random.seed(42) 只能固定 random.choice() 或 random.shuffle() 的行为,对 np.random.randn() 或 torch.randn() 完全无效。
-
random.seed()控制 Python 内置random模块 -
np.random.seed()控制 NumPy 的全局随机状态(注意:NumPy 1.17+ 推荐用Generator实例) -
torch.manual_seed()控制 PyTorch CPU 张量的随机性;GPU 还需torch.cuda.manual_seed_all() - 如果用了
sklearn.model_selection.train_test_split(),它默认依赖random,但显式传random_state=42更可靠
PyTorch 训练中必须同时设 CPU 和 GPU 种子
即使你只用 CPU,也建议统一调用 torch.manual_seed();一旦切换到 GPU,torch.cuda.manual_seed() 单独调用只影响当前设备,而 torch.cuda.manual_seed_all() 才能覆盖所有 GPU。更关键的是:某些 CUDA 操作(如 cuDNN 卷积)自带非确定性算法,必须额外禁用。
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
- 调用
torch.manual_seed(42)后,紧接着加torch.cuda.manual_seed_all(42) - 加上
torch.backends.cudnn.deterministic = True强制使用确定性卷积算法 - 加上
torch.backends.cudnn.benchmark = False禁用 cuDNN 自动选优(它会缓存不同算法的性能数据,破坏可复现性) - 注意:开启
deterministic可能略微降低训练速度
NumPy 新旧随机 API 的坑
NumPy 1.17 引入了 Generator(推荐)和 RandomState(旧),但很多人还在用已弃用的全局函数 np.random.seed()。它的问题是:全局状态容易被第三方库意外修改,且无法与 Generator 实例隔离。
- 避免
np.random.seed(42)(不推荐,全局污染) - 改用
rng = np.random.default_rng(42),然后用rng.normal()、rng.permutation()等 - 如果必须用旧接口(比如老代码或某些库强制依赖),至少确保它在其他库初始化前调用
- 验证是否生效:连续两次调用
rng.integers(0, 10, size=3)应返回完全相同数组
最易忽略的一点是:数据加载器(如 DataLoader 的 shuffle=True)和多进程(num_workers > 0)会引入额外随机性。PyTorch 中需通过 worker_init_fn 为每个子进程单独设种子——否则即使主进程种子固定,子进程仍用系统时间初始化,每次运行结果都不同。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










