np.load读取.npz文件需指定key,因返回npzfile对象而非数组;.npy可用mmap_mode='r'加速大文件读取;压缩影响加载速度;路径权限和文件完整性常致oserror。

np.load 读取 .npz 文件时必须指定 key
直接用 np.load 打开 .npz 文件不会返回数组,而是返回一个 NpzFile 对象——它像字典一样惰性加载,不显式索引就拿不到数据。常见错误是写 data = np.load("file.npz") 然后直接用 data.shape,结果报 AttributeError: 'NpzFile' object has no attribute 'shape'。
正确做法是先查 key,再取值:
import numpy as np
archive = np.load("data.npz")
print(archive.files) # 查看所有保存的变量名,比如 ['x', 'y', 'meta']
x = archive['x'] # 按 key 取出具体数组
y = archive['y']
注意:.npz 是 zip 压缩格式,内部可存多个数组,但没默认主键;.npy 才是单数组二进制,直接 np.load 就能返回数组。
用 mmap_mode='r' 加速大文件读取(尤其 >1GB)
对超大 .npy 文件,np.load 默认把整个文件读进内存,既慢又占资源。加 mmap_mode='r' 可以让 NumPy 用内存映射方式按需读取——真正访问某行/切片时才从磁盘加载,启动几乎零延迟。
适用场景:
- 只读部分数据(如取前 1000 行做预览)
- 机器内存小于文件大小
- 多进程并发读同一文件(mmap 安全)
示例:
x = np.load("big_file.npy", mmap_mode='r') # 返回 memmap 对象
subset = x[0:1000] # 实际读盘只发生在这里
⚠️ 注意:mmap_mode 不支持 .npz;且 memmap 对象不能直接传给某些函数(如 torch.tensor() 需先 .copy())。
压缩级别影响加载速度,而非 np.load 本身
np.savez_compressed 生成的 .npz 文件确实更小,但解压开销在 np.load 时才发生——不是“越高压缩越慢”,而是“解压耗时 + 数据拷贝耗时”总和变长。实测中,压缩比 >3x 后,加载时间可能比未压缩 .npz 慢 2–5 倍。
权衡建议:
- 存档/传输用
savez_compressed,节省空间 - 高频读取的中间数据,优先用
savez(无压缩)或分拆为多个.npy - 真要压缩又想快?改用
zarr或parquet,它们支持块级解压和并行读取
路径或权限问题常被忽略,导致 OSError
报错 OSError: Failed to interpret file 或 PermissionError 时,90% 不是代码问题,而是:
- 路径含中文或空格,且没用 raw string 或
os.path.join - 文件被其他进程占用(如 Jupyter 正在写、Windows 资源管理器预览缩略图)
-
.npz文件实际是损坏的(比如中断写入),可用unzip -t data.npz检查完整性
安全写法:
import os
path = os.path.join("data", "features.npz")
if os.path.exists(path):
data = np.load(path)
else:
raise FileNotFoundError(f"Missing: {path}")
真正卡住的地方往往不在 NumPy API 本身,而在文件系统层——别急着调参,先 ls -l 或 dir 确认文件存在且可读。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











