如何在Python中通过PyTorch Profiler工具定位深度学习模型的性能瓶颈?

落枫同学_6584

落枫同学_6584

2026-07-24

955人浏览

原创

默认参数几乎没用,因不设schedule只录首个batch(含初始化噪声),record_shapes=false漏隐式拷贝,profile_memory=false无法捕获显存峰值,且必须同时启用cpu/cuda活动才能识别跨设备搬运瓶颈。

如何在python中通过pytorch profiler工具定位深度学习模型的性能瓶颈?

torch.profiler.profile 默认不录真瓶颈,直接用会白跑。必须配对启用 CPU 和 CUDA 活动、设 schedule、开 record_shapesprofile_memory,否则看到的只是表象。

为什么默认参数几乎没用?

不设 schedule 就只录第一个 batch,而它常被初始化、JIT 编译、CUDA 上下文建立污染;record_shapes=False 会导致张量尺寸异常引发的隐式拷贝(比如 aten::copy_)无法溯源;profile_memory=False 则看不到某层输出是否卡在显存分配峰值上。

必须同时启用双设备:activities=[ProfilerActivity.CPU, ProfilerActivity.CUDA]——否则跨设备搬运(如 tensor.to("cuda"))会被拆成两段,根本看不出是数据加载慢还是模型计算慢。

  • wait=1:跳过首 step,避开冷启动抖动
  • warmup=1:让 CUDA kernel 完成编译,避免把编译时间算进耗时
  • active=3:只分析紧接其后的 3 步,平衡精度与开销

record_function 怎么插才不混逻辑?

record_function 不是装饰器,是上下文管理器,必须包住实际执行逻辑,而不是仅包模型调用。否则 loss.backward()optimizer.step() 的耗时会被散落在各算子中,无法归到“backward”名下。

常见错误:在 train_loader 迭代外加 record_function("forward"),导致 DataLoader.__next__ 的 I/O 时间全算进 forward 统计里。

python全能编程助手
python全能编程助手

SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、

下载
  • forward 段要包含 model(inputs) 全过程,不能只写 model
  • backward 段必须含 loss.backward() + optimizer.step() + optimizer.zero_grad()
  • data loading 要单独包裹,比如 with record_function("data_load"): 放在 for ... in train_loader: 内部

怎么看输出才能避开误导性排序?

直接调 prof.key_averages().table(sort_by="cpu_time_total") 容易被累计时间带偏——比如看到 aten::add 排第一,其实是它被调用了 2000 次,单次才 0.01ms;真正该盯的是 Self CPU time total,排除子调用膨胀。

若某算子 # Calls 异常高(如 index_select 超 1000 次),大概率是 Python for 循环写在了 GPU 上;若 aten::copy_ 占比高,先查输入 tensor 是否在 CPU、模型是否在 GPU,而非急着改 clone。

  • 优先看 Self CPU time totalGPU Kernel Utilization 曲线
  • 结合 with_stack=True 查自定义模块(但会拖慢 profiler,只在必要时开)
  • prof.export_chrome_trace("trace.json") 导出后,在 Chrome 地址栏输入 chrome://tracing 打开,看 timeline 是否存在长空档

容易被忽略的协作断点

PyTorch Profiler 不会自动标记同步点,但 torch.cuda.synchronize() 或隐式同步(如 tensor.item()tensor.cpu())会让 GPU 频繁空转。这类问题不会出现在算子列表里,只能靠 timeline 中的 gap 发现——如果 GPU 利用率曲线频繁跌零,八成是这里卡住了。

另外,pin_memory=Truenum_workers=0,或 prefetch_factor 设得过大,都会让 data loader 成为隐形瓶颈,而 profiler 可能只显示 __next__ 耗时高,需结合 nvitop 看 CPU/GPU 利用率是否错峰。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1571

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3704

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1569

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

21257

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2627

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2687

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1083

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2063

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程