真是出人意料。
PPO(近端策略优化)这一如今在 RLHF 和大模型训练中被高频采用的经典算法,竟曾于 NIPS 2017 遭到拒稿。
此事近日由 PPO 主要作者 John Schulman 本人公开提及。他仅用一句话轻描淡写地回顾了这段经历:PPO,当年被 NIPS 2017 拒了。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

这篇最早发布于 2017 年 7 月的论文,在当时看来不过是一个更简洁、更便于工程落地的策略优化方案。其核心意图,是在继承 TRPO 算法高稳定性优势的前提下,大幅简化实现逻辑,使强化学习训练更易调试、更具实用性。

然而几年之后,真正将 PPO 推向主流舞台的,并非 Atari 游戏或机器人控制等传统强化学习场景,而是大语言模型领域。
从 RLHF 到当前兴起的 RLVR,PPO 已成为大模型后训练流程中不可或缺的基础组件之一。据 Schulman 所言,PPO 在 LLM 时代的再度爆发,其影响广度与深度,甚至远超原始论文最初设定的技术边界。

这并非 Schulman 对拒稿经历的牢骚,而更像一种温和的回望:一项技术的真实价值,常常以开发者始料未及的方式延展与沉淀。
看到这里,不少人自然会追问:PPO 究竟为何当年未能通过评审?
Schulman 后来坦言,当时的审稿意见普遍认为该工作创新性不足,相较于已有方法(如 TRPO、A2C 等),实验提升幅度也并不显著。

有读者评论道:“这背后折射的,其实是学术评价体系与真实产业需求之间的一种错位——学界往往更强调概念新颖性,以及在小规模、理想化实验中对基线的超越;而工业界更关注方法能否规模化部署、能否在复杂系统中长期稳定运行、能否真正‘跑通’。”

对此,Schulman 表现出十足的坦然。他表示,那已是多年以前的事,也希望经过这些年的发展,学术共同体已逐步接纳并珍视那种“简单却可扩展”的技术美学。
真正令他感到惊讶的是,这篇论文及其提出的目标函数,竟能持续发挥如此长久的影响。一个算法改进,到底是转瞬即逝的临时补丁,还是能扎根系统底层、历久弥坚的核心模块,往往在诞生之初根本无从判断。
PPO 的发展历程,正是对此最有力的印证。

其实,又何止是 PPO?AI 发展史上诸多最终产生深远影响的工作,初投稿时都曾遭遇顶会拒稿。
LSTM:1996 年被 NIPS 拒收,理由是结构过于复杂、缺乏神经科学依据;但后来成为语音识别、机器翻译等序列建模任务的基石。
SIFT:曾接连被 ICCV 1997 和 CVPR 1998 拒绝,批评其步骤繁杂、数学美感欠缺;却在此后十余年主导了深度学习前时代的计算机视觉实践。
Dropout:2012 年被 NIPS 拒稿,被认为只是经验性工程技巧、理论根基薄弱;最终却成长为深度网络最关键的正则化手段之一,并荣膺 NeurIPS 时间检验奖。
有时,唯有时间,才是最严苛、也最公正的审稿人。
本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注RL的,36氪经授权发布。











