torch.cuda.is_available()返回false的主因是pytorch与cuda版本不匹配或nvidia_uvm模块未加载;需依次验证nvidia-smi输出、torch.version.cuda、/dev/nvidia*设备及nvidia_uvm内核模块状态。

检查 torch.cuda.is_available() 返回 False 的真实原因
这不一定是驱动没装好,更常见的是 PyTorch 与 CUDA 版本不匹配。PyTorch 官网下载页面提供的预编译包默认绑定特定 CUDA 版本(比如 cu118 表示 CUDA 11.8),而系统里装的 NVIDIA 驱动可能只支持到 CUDA 11.7 或 12.1 —— 这时 torch.cuda.is_available() 就会静默返回 False,不报错也不提示。
- 先运行
nvidia-smi,看右上角显示的 “CUDA Version”(注意:这是驱动能支持的最高 CUDA 版本,不是当前系统安装的 CUDA 工具包版本) - 再运行
nvcc --version(如果报 command not found,说明没装 CUDA Toolkit,但 PyTorch 不依赖它;只依赖驱动 + 兼容的libcudart) - 最后查你安装的 PyTorch 版本对应 CUDA 版本:
python -c "import torch; print(torch.__version__); print(torch.version.cuda)"
确认 NVIDIA 驱动是否真被识别
nvidia-smi 能正常输出 GPU 列表,只说明驱动加载成功;但 PyTorch 还需要访问 /dev/nvidia* 设备节点和加载 nvidia_uvm 内核模块。常见漏掉的是后者。
- 运行
ls /dev/nvidia*,应看到/dev/nvidia0、/dev/nvidiactl、/dev/nvidia-uvm(或/dev/nvidia-uvm-tools)等设备文件 - 运行
lsmod | grep nvidia_uvm,若无输出,说明nvidia_uvm模块未加载 —— 可手动执行sudo modprobe nvidia_uvm,并加入开机加载(如写入/etc/modules) - 某些 Linux 发行版(如 Ubuntu 22.04+)启用了 Secure Boot,会导致
nvidia_uvm模块被拒绝加载,此时需禁用 Secure Boot 或手动签名模块
验证 PyTorch 是否真的调用了 GPU 设备
torch.cuda.is_available() 返回 True 只是第一步,还需确认 tensor 能否真正迁移并计算。很多用户卡在“能检测到 GPU 却跑不动模型”,本质是默认设备没设对或 tensor 没显式移动。
- 检查可用设备数:
print(torch.cuda.device_count()),应大于 0 - 查看当前默认设备:
print(torch.cuda.current_device()),再用print(torch.cuda.get_device_name(0))确认型号 - 手动创建 GPU tensor 测试:
x = torch.randn(3, 3).cuda()或x = torch.randn(3, 3, device='cuda');若报RuntimeError: CUDA error: no kernel image is available for execution on the device,大概率是架构不匹配(比如在 RTX 4090 上用了只编译了 sm_75 的 PyTorch 包)
conda 与 pip 混装导致的 CUDA 库冲突
尤其在 conda 环境中混用 pip install 的 PyTorch,容易让 libcudart.so 被 conda 自带的 cudatoolkit 或系统路径下的旧版本覆盖,造成运行时符号缺失或版本错位。
- 用
ldd $(python -c "import torch; print(torch.__file__)") | grep cuda查 PyTorch 加载的 CUDA 动态库路径 - 对比
readelf -d $(python -c "import torch; print(torch.__file__.replace('__init__.py', 'lib/libcudart.so'))" 2>/dev/null || echo 'not found')(路径可能因安装方式不同而异) - 最稳妥做法:彻底卸载后,只用官方推荐命令重装,例如
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118(严格匹配nvidia-smi显示的支持上限)
PyTorch 找不到 GPU 的多数情况,问题不在驱动本身,而在「驱动支持的 CUDA 版本」、「PyTorch 编译时绑定的 CUDA 版本」、「运行时实际加载的 libcudart 版本」三者之间存在隐性错位。最容易被忽略的是 nvidia_uvm 模块未加载,以及 tensor 创建时没指定 device='cuda' —— 这两个点不报错,但会让整个流程静默退化到 CPU。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











