在Python中如何使用PyTorch DataLoader多进程加速数据读取?

星浩小哥_8679

星浩小哥_8679

2026-09-06

647人浏览

原创

num_workers > 0 变慢或卡死的根本原因是 getitem 中存在不可跨进程共享的操作,如未加锁文件句柄、含全局状态的库调用或.cuda();应确保其仅做纯读取与轻量变换,并用 if name == '__main__': 包裹主逻辑。

在python中如何使用pytorch dataloader多进程加速数据读取?

为什么 num_workers > 0 有时反而变慢甚至卡死?

根本原因不是进程数设多了,而是数据集的 __getitem__ 方法里做了不能跨进程共享的操作——比如打开了未加锁的文件句柄、调用了含全局状态的库(如某些 OpenCV 初始化)、或直接在 __getitem__ 里创建了 PyTorch Tensor 并用了 .cuda()。多进程启动时会 fork 主进程,这些非法状态被复制后导致子进程阻塞或崩溃。

实操建议:

  • 确保 __getitem__ 只做纯读取+轻量变换(如 PIL 打开 + torchvision.transforms),不涉及 GPU、数据库连接、全局随机种子重设
  • if __name__ == '__main__': 包裹训练主逻辑,防止 Windows/macOS 上 spawn 模式重复导入执行
  • 临时调试时加 pin_memory=False, num_workers=0 看是否恢复正常,确认是多进程引发的问题

DataLoaderpin_memory=True 的真实作用和代价

它把 CPU 上的 Tensor 预先拷贝到“页锁定内存”(pinned memory),让后续 .to('cuda') 能异步、更快地传输到 GPU。但不是所有场景都加速:如果模型前向/反向本身很轻(如小网络+小 batch),数据搬运不再是瓶颈,开启 pin_memory 反而因额外内存拷贝拖慢整体吞吐。

实操建议:

  • 仅当 GPU 利用率长期低于 60% 且 nvidia-smi 显示 PCIe 带宽跑满时,才优先考虑 pin_memory=True
  • 必须配合 num_workers > 0 才有效;num_workers=0 时开启无意义
  • 页锁定内存不可交换,开太多(如 batch_size * 4 * num_workers > 总内存 20%)会导致系统 OOM,尤其在多卡训练时要小心

如何判断 num_workers 设多少才合适?

没有固定公式,取决于 I/O 延迟、CPU 核心数、单次 __getitem__ 耗时。盲目设成 os.cpu_count() 很可能过载——特别是当数据在机械硬盘或远程 NFS 上时,过多进程争抢磁盘寻道反而降低吞吐。

Python数据分析(专业版)
Python数据分析(专业版)

企业级Python数据分析方案,支持机器学习建模、时间序列预测、大数据处理与自动化报表。

下载

实操建议:

  • num_workers=2 开始,用 torch.utils.benchmark.Timer 测单个 epoch 时间,逐步加到 4、8,观察时间是否继续下降
  • Linux 下运行 htop,看 Python 子进程 CPU 占用是否持续高于 80%;若频繁降到 0%,说明 I/O 在等磁盘,该换 SSD 或优化读取逻辑
  • PyTorch 1.12+ 可启用 prefetch_factor=2(默认值),它控制每个 worker 预取 batch 数;对慢存储可设为 3–4,但会增加内存占用

Windows 下 num_workers > 0BrokenPipeError 或直接退出

Windows 不支持 fork,PyTorch 默认用 spawn 启动子进程,要求所有自定义类(尤其是 Dataset)能被 pickle 序列化。常见失败点是 Dataset 里存了 lambda 函数、打开了文件对象、或引用了模块级不可序列化变量(如 cv2.VideoCapture 实例)。

实操建议:

  • Dataset 构造函数中避免保存任何非基本类型对象;把文件路径存为 str,在 __getitem__ 里按需打开
  • 检查是否用了 torch.multiprocessing.set_start_method('fork') —— Windows 不支持,删掉这行
  • 临时方案:用 num_workers=0 + torch.compile(PyTorch 2.0+)加速数据变换部分,比硬扛多进程更稳

实际部署时最容易被忽略的是:不同 storage 类型(本地 SSD / NAS / S3)对 num_workers 的敏感度差异极大,同一套参数在开发机跑得飞快,上生产环境可能雪崩。务必在目标存储上单独压测。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1531

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3584

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1549

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

20397

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2527

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2587

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1063

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2003

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程