
在 Windows 系统的 Jupyter(Notebook 或 Lab)中使用 multiprocessing 时,若主模块内直接定义目标函数(如 squares),子进程无法安全导入该函数,导致程序挂起;必须将函数定义在独立 .py 模块中并显式导入。
在 windows 系统的 jupyter(notebook 或 lab)中使用 `multiprocessing` 时,若主模块内直接定义目标函数(如 `squares`),子进程无法安全导入该函数,导致程序挂起;必须将函数定义在独立 `.py` 模块中并显式导入。
当你在 Windows 上的 Jupyter 环境中运行如下代码时:
from multiprocessing import Pool
def squares(number):
return number * number
with Pool() as pool:
print('Starting...')
results = pool.map(squares, range(10))
print('It worked!!')
print(results)
程序会卡在 'Starting...' 后不再推进——这不是代码逻辑错误,而是 Windows + Jupyter + multiprocessing 的经典兼容性问题。
根本原因在于:
Windows 下 multiprocessing 默认使用 spawn 启动方式(而非 Unix 的 fork),这意味着每个子进程都会重新导入主模块。而在 Jupyter 中,当前 notebook 并非一个标准 .py 文件,其命名空间(如 __main__)不可被子进程可靠重建。当子进程尝试导入 squares 时,因找不到可执行的、可序列化的函数定义而阻塞或静默失败。
✅ 正确做法:将目标函数移至独立的 .py 模块中,并通过标准 import 引入:
1. 创建模块文件 utils.py(保存在工作目录下):
# utils.py
def squares(number):
return number * number
2. 在 Jupyter 单元格中调用:
from multiprocessing import Pool
from utils import squares # ✅ 显式从模块导入
if __name__ == '__main__': # 虽在 Jupyter 中非必需,但属最佳实践
with Pool() as pool:
print('Starting...')
results = pool.map(squares, range(10))
print('It worked!!')
print(results)
? 补充说明:你观察到
requests.get或pandas.read_parquet能正常工作,是因为这些是内置/第三方可序列化函数,它们已存在于 Python 标准库或安装包中,子进程可直接导入;而内联定义的squares是“动态生成”的本地对象,无法跨进程传递。
⚠️ 注意事项:
- 不要在 notebook 单元格中使用
if __name__ == '__main__':包裹Pool调用(Jupyter 中__name__恒为'__main__',但无实际保护作用); - 确保
.py模块文件位于 Python 模块搜索路径中(推荐与 notebook 同目录); - 使用
conda或pip安装的 Jupyter 环境需保证子进程能访问相同环境依赖; - 若仍失败,可临时启用调试:设置
multiprocessing.set_start_method('spawn', force=True)并捕获RuntimeError。
总结:Jupyter + Windows + multiprocessing 的黄金法则——所有传入 pool.map/apply_async 的函数,必须定义在独立、可导入的 .py 文件中。 这一约束并非缺陷,而是跨平台进程安全性的必要设计。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











