必须显式调用ray.init()并按需声明资源参数,否则gpu无法调度;num_gpus需在ray.init()和@ray.remote中双重申领,支持浮点数切分;rollout_fragment_length与train_batch_size设置不当易引发oom,须结合nvidia-smi监控显存。

ray.init() 必须显式调用,且资源参数不设默认值时容易卡死或无法调度 GPU —— 这是绝大多数初学者第一次跑不通 PPO 的根本原因。
ray.init() 资源参数必须按需显式声明
Ray 默认只申请 1 个 CPU,即使你机器有 8 张 GPU,ray.init() 也不会自动识别它们。训练时若未声明 num_gpus,所有 actor 都会挤在 CPU 上,GPU 完全闲置。
正确做法是根据实际硬件显式传参:
-
ray.init(num_cpus=16, num_gpus=4):本地单机多卡场景 -
ray.init(address="auto", _redis_password="yourpwd"):集群模式下连接已有 head node - 若使用
RLlib,还需额外设置ignore_reinit_error=True避免 notebook 多次运行报错
注意:num_gpus 是每个 actor 可用的 GPU 数量,不是总卡数。比如你有 4 张卡、想启动 8 个 rollout worker,就得设 num_gpus=0.5(每个 worker 分半张卡),否则调度失败。
@ray.remote 类必须带 GPU 资源标注才能真正用上显卡
仅在 ray.init() 里声明了 num_gpus 不够 —— 每个远程 actor 还要自己申领资源,否则 Ray 仍把它当 CPU 任务调度。
典型错误写法:
@ray.remote
class RolloutWorker:
def rollout(self): ...
正确写法(显式绑定 GPU):
Python 3.14.2是Python编程语言在2025年12月5日发布的稳定版本,属于3.14系列的第二个维护更新。该版本包含了18项修复,重点解决了多进程、数据类及正则表达式等模块的回归问题,并修复了CVE-2025-12084等安全漏洞。此版本标志着自由线程模式(移除GIL)正式获得官方支持,是Python发展的重要里程碑。
@ray.remote(num_gpus=0.5)
class RolloutWorker:
def rollout(self): ...
关键点:
-
num_gpus支持浮点数,允许细粒度切分(如0.25、0.5),但总和不能超过ray.init()声明的总数 - 如果 actor 内部用
torch.cuda.device_count()查到 0,一定是没申领或申领失败 - PyTorch 初始化必须放在
__init__里,不能放rollout方法中——否则每次调用都新建 CUDA 上下文,显存泄漏
RLlib 配置中 rollout_fragment_length 和 train_batch_size 易引发 OOM
这两个参数表面看是“数据量控制”,实际决定显存峰值。很多用户设 rollout_fragment_length=200 + train_batch_size=4000,结果单个 learner 显存爆掉。
真实约束来自三方面:
- 每个 rollout worker 输出的 batch 大小 =
rollout_fragment_length × num_envs_per_worker - learner 合并所有 worker 数据后,按
train_batch_size切分训练 mini-batch - 但中间 buffer(尤其是 PPO 的 advantage 计算)会缓存完整 rollout 数据,显存占用 ≈
rollout_fragment_length × num_workers × obs_shape × 4 bytes
建议起始值:
- 单卡:设
rollout_fragment_length=128,train_batch_size=2048 - 四卡:先保持
rollout_fragment_length=128,把train_batch_size提到8192,再观察 GPU memory usage - 务必用
nvidia-smi实时盯住显存,而不是只看 loss 是否下降
异步更新时权重同步延迟导致 off-policy 问题
当你用多个 @ray.remote worker 并行 rollout,主 learner 异步 pull 权重、push 新权重,不同 worker 拿到的模型版本可能差好几轮 —— 这就是 off-policy drift。
这不是 bug,是异步架构固有缺陷。缓解手段有限但有效:
- 启用
worker_side_prioritization=True(RLlib 2.9+),让 worker 主动拒绝过期策略 - 在 rollout 开头加时间戳校验:
if self.last_update_step - 最稳妥的是改用同步模式:
multiagent: False+num_rollout_workers=0+num_gpus=1先跑通 baseline
真正的大规模训练不是堆 worker 数量,而是控制 policy age 差距 —— 这点文档几乎从不提,但线上 debug 时 70% 的 reward collapse 都源于此。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










