应使用 np.random.default_rng() 创建独立随机数生成器实例,避免全局状态污染;推荐显式初始化 rng = np.random.default_rng(seed=42),所有随机方法如 rng.normal()、rng.uniform()、rng.choice() 均从此调用,注意参数差异与 size 形状规范,并优先向量化生成以提升性能。

用 np.random.default_rng() 替代旧版 np.random 全局状态
NumPy 1.17+ 推荐用 np.random.default_rng() 创建独立随机数生成器实例,避免多线程或多次调用时状态污染。旧写法如 np.random.randn() 直接操作全局 RNG,容易在函数复用、单元测试或并行场景下出错。
实操建议:
- 始终显式创建生成器:
rng = np.random.default_rng(seed=42),seed可控且可复现 - 所有随机方法都从
rng调用,比如rng.normal()、rng.uniform() - 不要混用新旧接口:
np.random.seed()对default_rng()实例无效 - 若需多个隔离的随机流(如不同模拟分支),分别创建
default_rng()实例,传不同 seed 或不传(自动熵初始化)
normal()、uniform()、choice() 三个最常用分布的参数差异
生成测试数据时,选对方法比调参更重要。这三个函数覆盖 90% 的常见需求,但参数习惯和默认行为有明显区别:
-
rng.normal(loc=0.0, scale=1.0, size=None):正态分布,loc是均值,scale是标准差(不是方差) -
rng.uniform(low=0.0, high=1.0, size=None):均匀分布,low包含,high不包含(左闭右开) -
rng.choice(a, size=None, replace=True, p=None):从数组或整数范围中抽样;a若为整数(如5),等价于range(a);replace=False时size不能超过a长度
示例:生成 1000 个 [−2, 5) 区间均匀浮点数:rng.uniform(-2, 5, size=1000);生成带权重的类别标签:rng.choice(['A','B','C'], size=100, p=[0.6,0.3,0.1])
生成结构化测试数据时,size 参数的形状陷阱
size 控制输出数组维度,但容易误写成元组嵌套或标量混淆,尤其当需要二维表格型数据(如模拟 CSV 行列)时:
- 要生成 100 行 × 5 列的正态数据,写
rng.normal(size=(100, 5)),不是size=100,5(语法错误)或size=[100,5](虽可运行但易读性差) -
size=100返回一维数组;size=(100,)也是 1D,但显式声明更清晰;size=()返回标量(0 维) - 与
reshape混用需谨慎:先生成再 reshape 可能打乱分布逻辑,应优先靠size一步到位 - 批量生成不同形状数据时,避免重复写
size,可用字典预定义:shapes = {'features': (1000, 12), 'labels': (1000,)},再rng.normal(size=shapes['features'])
性能敏感场景下,避免在循环里反复调用随机函数
如果需要生成大量小批次数据(比如每轮训练喂一批噪声),在 Python 循环中反复调用 rng.normal() 会显著拖慢速度——函数调用开销 + 内存分配碎片化。
- 正确做法:一次性生成大数组,再切片使用。例如模拟 100 轮、每轮 32 个样本:
all_noise = rng.normal(size=(100, 32)),循环中用all_noise[i] - 若每轮 shape 不同,仍可预分配最大尺寸,用索引截取,避免频繁 malloc
- 注意内存:超大数组(如亿级)可能 OOM,此时需分块生成 + 流式处理,但优先检查是否真需要全量加载
- 不用
list.append()累加随机数组——Python list 追加 NumPy 数组会触发隐式拷贝,改用np.stack()或预分配np.empty()
真正影响效率的往往不是分布算法本身,而是调用频率和内存模式。把随机过程“向量化”一次到位,比调优单次 normal() 参数重要得多。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











