根本原因是docker构建不继承宿主机dns/代理,导致conda无法解析默认channel;需显式设dns、精简channels、避免conda/pip混用;gpu需-nvidia/cuda:-devel镜像、匹配cuda的pytorch、--gpus all启动;权限问题应指定uid而非chmod 777;cuda驱动版本须满足最低要求。

为什么 conda install 在 Docker 里总卡住或报错 CondaHTTPError
根本原因不是网络问题,而是 Docker 构建时默认不继承宿主机的 DNS 或代理设置,conda 的默认 channel(如 https://repo.anaconda.com/pkgs/main)无法解析或连接。尤其在企业内网或 CI 环境中更明显。
- 构建前显式指定 DNS:用
docker build --dns 8.8.8.8 -t ml-env .,避免依赖 /etc/resolv.conf 继承 - Dockerfile 中禁用默认 channel 并只用离线友好的源:
RUN conda config --remove-key channels && conda config --add channels conda-forge && conda config --set channel_priority strict - 不要在
RUN pip install前混用conda install—— conda 会重写 pip 的 site-packages 路径,导致后续 pip 包 import 失败
如何让 JupyterLab 在容器里真正支持 GPU 加速(而非只“看到”GPU)
装了 nvidia-cuda-toolkit 或 cuda-toolkit 不等于能跑训练。关键在于 runtime 和 device 插入时机 —— 容器启动时必须由 nvidia-container-runtime 接管,且 PyTorch/TensorFlow 需加载对应 CUDA 版本的 wheel。
Python 3.14.2是Python编程语言在2025年12月5日发布的稳定版本,属于3.14系列的第二个维护更新。该版本包含了18项修复,重点解决了多进程、数据类及正则表达式等模块的回归问题,并修复了CVE-2025-12084等安全漏洞。此版本标志着自由线程模式(移除GIL)正式获得官方支持,是Python发展的重要里程碑。
- 基础镜像必须用
nvidia/cuda:12.1.1-devel-ubuntu22.04这类-devel后缀镜像(含编译工具链),不能用-runtime - Dockerfile 中安装 PyTorch 必须匹配 CUDA 版本:
RUN pip3 install torch torchvision --index-url https://download.pytorch.org/whl/cu121 - 运行容器时必须加
--gpus all,且宿主机已装好 NVIDIA driver(nvidia-smi可见);仅--device /dev/nvidia0不足以支持 CUDA API 调用
requirements.txt 和 environment.yml 到底该用哪个?
二者定位不同:environment.yml 是 conda 的完整环境快照(含 Python 版本、channel、非 PyPI 包),适合复现科研环境;requirements.txt 是 pip 的纯 Python 包清单,轻量但无法约束底层依赖(如 numpy 的 OpenBLAS vs Intel MKL 后端)。
- 机器学习服务部署优先用
environment.yml:它能锁死python=3.9、pytorch=2.1.2、libcudnn=8.9.2这类关键组合 - 若必须用
requirements.txt,需手动补全底层库:例如在 Dockerfile 中先apt-get install libopenblas-dev liblapack-dev,再pip install numpy pandas scikit-learn - 不要混合导出:用
conda env export > environment.yml会包含大量 build hash,CI 构建易失败;应手工精简为最小必要依赖
容器启动后 JupyterLab 打不开,日志只显示 PermissionError: [Errno 13] Permission denied: '/home/jovyan/.jupyter'
这是镜像用户权限和挂载卷权限冲突的典型表现。Jupyter 官方镜像默认以 UID 1000 用户 jovyan 运行,但若宿主机挂载的目录属主是 root 或其他 UID,容器内就无法写入配置。
- 启动时强制指定用户 UID:
docker run -u $(id -u):$(id -g) -v $(pwd)/notebooks:/home/jovyan/work -p 8888:8888 ml-env - 或在 Dockerfile 中重建用户:
RUN usermod -u 1001 jovyan && chown -R jovyan:jovyan /home/jovyan(需配合USER jovyan) - 绝对不要用
chmod 777临时修复 —— 容器退出后挂载卷权限不变,下次启动仍失败,且存在安全风险
nvidia-smi 显示的驱动版本必须 ≥ 容器镜像中 CUDA Toolkit 要求的最低驱动版本(查 https://docs.nvidia.com/cuda/cuda-toolkit-release-notes/index.html),差一个小版本都可能触发 torch.cuda.is_available() 返回 False。Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










