pytorch profiler默认不启用cuda事件记录,导致gpu时间显示0;必须显式设置profile(record_shapes=true, with_flops=true, profile_memory=true),确保模型和输入在cuda设备上,且在torch.no_grad()外调用。

Profiler启动时为什么GPU时间总是显示0?
PyTorch Profiler默认不启用CUDA事件记录,record_shapes=False 且 with_flops=False 时,GPU内核执行时间不会被采集,导致self_cpu_time_total有值但self_cuda_time_total全为0。必须显式开启CUDA追踪:
- 使用
profile(record_shapes=True, with_flops=True, profile_memory=True) - 确保模型和输入都在CUDA设备上(
model.cuda(),x = x.cuda()) - 在
torch.no_grad()外调用——否则前向传播会被跳过,GPU活动无法捕获
如何定位具体哪一层算子拖慢了训练?
Profiler输出的key_averages()按算子名聚合统计,但模型中自定义nn.Module或forward函数会合并为aten::add、aten::mm等底层算子,难以对应到网络结构。解决办法是手动插入命名作用域:
with torch.profiler.record_function("layer1_forward"):
x = self.layer1(x)
with torch.profiler.record_function("attention_block"):
x = self.attn(x)
这样在火焰图或key_averages()里就能看到清晰的模块级耗时,而不是淹没在上百行aten::算子中。
profiler.trace_handler生成的chrome trace文件打不开?
常见原因有两个:一是路径含中文或空格,Chrome无法解析;二是未正确调用prof.export_chrome_trace()。实操要点:
- trace路径必须是绝对路径,且不含空格(例如
/tmp/prof_trace.json,不能是./trace.json) - 确保
trace_handler函数被传入profile,且在__exit__阶段自动触发导出 - Chrome中打开方式:地址栏输入
chrome://tracing→ 点“Load” → 选择该JSON文件
为什么profiler显示GPU利用率低但nvidia-smi显示显存占满?
这是典型的CPU-GPU同步瓶颈:Profiler只统计实际kernel运行时间,而nvidia-smi反映的是显存驻留状态。常见诱因包括:
- 数据加载阻塞:
DataLoader未设pin_memory=True或num_workers>0,GPU空等CPU搬运数据 - 频繁host-device拷贝:比如在循环中反复调用
.cpu()、.item()或print(tensor.sum()) - 梯度同步等待:DistributedDataParallel中
backward()后隐式同步,若batch size小,通信开销占比高
这类问题在Profiler的cudaMemcpyAsync或cudaStreamSynchronize事件中会高频出现,但容易被忽略——它们不占kernel时间,却严重拖慢整体吞吐。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











