在Python中如何使用PyTorch Profiler定位模型训练的性能瓶颈?

大萱大大_6486

大萱大大_6486

2026-06-06

141人浏览

原创

pytorch profiler需正确配置才能精准定位训练瓶颈:必须启用cpu/cuda双活动、合理设置schedule(wait=1,warmup=1,active=3)、开启record_shapes和profile_memory;record_function要包裹实际执行逻辑而非仅模型调用;分析时优先看self cpu time total和gpu kernel utilization曲线,结合with_stack排查协作断点。

在python中如何使用pytorch profiler定位模型训练的性能瓶颈?

PyTorch Profiler 能直接告诉你训练慢在哪——不是靠猜,是看 conv2d 占了 38% 的 CPU 时间,还是 data_loader 在等 I/O,或是 GPU 因 torch.cuda.synchronize() 频繁空转。关键在配置对、分析准、不干扰真实训练节奏。

怎么配 profile 才不白跑?

默认参数几乎没用:不设 schedule 就只录第一个 batch,record_shapes=False 会漏掉张量尺寸异常导致的隐式拷贝,profile_memory=False 则看不到显存峰值是否卡在某个 layer 输出上。

  • activities=[ProfilerActivity.CPU, ProfilerActivity.CUDA] 必须同时开,否则看不到数据搬运(如 copy_to_device)这类跨设备瓶颈
  • schedule=torch.profiler.schedule(wait=1, warmup=1, active=3) 是工业级推荐组合:跳过首 step(避免冷启动抖动),第 2 步预热(让 CUDA kernel 编译完成),只分析紧接其后的 3 步——既降低开销,又避开初始化噪声
  • record_shapes=Trueprofile_memory=True 建议始终开启;with_stack=True 在查自定义模块或封装层时才启用(会明显拖慢 profiler)

训练循环里怎么插 record_function

不加 record_function,Profiler 只能按算子名归类(比如一堆 addmul),根本分不清哪个是 loss 计算、哪个是梯度裁剪。加了它,才能把耗时精准绑定到你代码里的逻辑段。

PyTorch Linux版 2.11.0
PyTorch Linux版 2.11.0

PyTorch 2.11.0 历史版本下载,来自 PyPI 官方发布,适合旧项目兼容、实验复现和指定环境安装。

下载
  • 必须包住实际执行逻辑,而不是仅包模型调用:with record_function("forward"): 下面要跟 model(inputs),不能只写 model
  • backward 段要包含 loss.backward()optimizer.step() 全流程,否则梯度更新耗时会被拆散到不同算子中
  • 别在 data_loader 迭代外加 record_function,否则 DataLoader 的 __next__ 耗时会混进 "forward" 统计里

怎么看输出才能快速定位真瓶颈?

直接调 prof.key_averages().table(sort_by="cpu_time_total", row_limit=10) 容易被表头带偏——比如看到 aten::copy_ 排第一,就去改 tensor.clone(),其实它只是表象,根因可能是输入 tensor 在 CPU 上、而模型在 GPU 上,导致每次 forward 都强制同步拷贝。

  • 优先看 Self CPU time total(非累计),排除被子调用撑高的父项;若某算子 # Calls 异常高(比如 1000+ 次 index_select),大概率是 for 循环写在了 GPU 上
  • 打开 TensorBoard 日志后,重点看 GPU Kernel Utilization 曲线:如果长期低于 60%,说明 GPU 在等 CPU(查 data loader 或 pre-processing);如果曲线锯齿状剧烈波动,说明 kernel 启动太碎(查是否用了 too small batch 或 dynamic shape)
  • 内存视图里出现 cudaMalloc 高频小块分配,往往意味着中间变量没复用(如反复创建新 tensor 而非 .zero_() 复用)

真正卡住训练的,往往不是单个算子慢,而是 CPU-GPU 协作断点——比如 pin_memory=True 没配、num_workers 设为 0、或者 torch.compile 和 profiler 同时启用导致 trace 冲突。这些细节不会出现在 top-10 表里,得靠 with_stack=True 配合日志路径反查。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

相关标签:

pytorch 性能瓶颈

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1571

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3704

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1569

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

21257

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2627

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2687

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1083

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2063

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PyTorch 官方文档与教程
PyTorch 官方文档与教程

共0课时 | 0人学习

Swoole手册
Swoole手册

共0课时 | 0人学习