谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练-人工智能-PHP中文网

首页

科技周边

人工智能

谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练

PHPz

Feb 15, 2024 pm 07:00 PM

rlhf工程卡内基梅隆大学spo

效果更稳定，实现更简单。

大型语言模型（LLM）的成功离不开「基于人类反馈的强化学习（RLHF）」。RLHF 可以大致可以分为两个阶段，首先，给定一对偏好和不偏好的行为，训练一个奖励模型，通过分类目标为前者分配更高的分数。然后通过某种强化学习算法优化这个奖励函数。然而，奖励模型的关键要素可能会产生一些不良影响。

来自卡内基梅隆大学（CMU）和 Google Research 的研究者联合提出了一种简单的、理论上严格的、实验上有效的 RLHF 新方法 —— 自我博弈偏好优化（Self-Play Preference Optimization，SPO）。该方法消除了奖励模型，并且不需要对抗性训练。

谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练

论文：A Minimaximalist Approach to Reinforcement Learning from Human Feedback

论文地址：https://arxiv.org/abs/2401.04056

方法简介

SPO 方法主要包括两个方面。首先，该研究通过将 RLHF 构建为两者零和博弈（zero-sum game），真正消除了奖励模型，从而更有能力处理实践中经常出现的噪声、非马尔可夫偏好。其次，通过利用博弈的对称性，该研究证明可以简单地以自我博弈的方式训练单个智能体，从而消除了不稳定对抗训练的需要。

实际上，这相当于从智能体中采样多个轨迹，要求评估者或偏好模型比较每对轨迹，并将奖励设置为轨迹的获胜率。

SPO 避免了奖励建模、复合 error 和对抗性训练。通过从社会选择理论（social choice theory）中建立最小最大获胜者的概念，该研究将 RLHF 构建为两者零和博弈，并利用该博弈支付矩阵的对称性来证明可以简单地训练单个智能体来对抗其自身。

谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练

该研究还分析了 SPO 的收敛特性，并证明在潜在奖励函数确实存在的情况下，SPO 能以与标准方法相媲美的快速速度收敛到最优策略。

实验

该研究在一系列具有现实偏好函数的连续控制任务上，证明了 SPO 比基于奖励模型的方法性能更好。SPO 在各种偏好设置中能够比基于奖励模型的方法更有效地学习样本，如下图 2 所示。

谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练

该研究从多个维度将 SPO 与迭代奖励建模 (RM) 方法进行比较，旨在回答 4 个问题：

当面 intransitive 偏好时，SPO 能否计算 MW？
在具有独特 Copeland Winners / 最优策略的问题上，SPO 能否匹配或超过 RM 样本效率？
SPO 对随机偏好的稳健性如何？
SPO 可以处理非马尔可夫偏好吗？

谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练

在最大奖励偏好、噪声偏好、非马尔可夫偏好方面，该研究的实验结果分别如下图 6、7、8 所示：

谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练

感兴趣的读者可以阅读论文原文，了解更多研究内容。

以上是谷歌提出全新RLHF方法：消除奖励模型，且无需对抗性训练的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文转载于：机器之心。如有侵权，请联系admin@php.cn删除

微软工作趋势指数2025显示工作场所容量应变Apr 24, 2025 am 11:19 AM

由于AI的快速整合而加剧了工作场所的迅速危机危机，要求战略转变以外的增量调整。 WTI的调查结果强调了这一点：68％的员工在工作量上挣扎，导致BUR

AI可以理解吗？中国房间的论点说不，但是对吗？Apr 24, 2025 am 11:18 AM

约翰·塞尔（John Searle）的中国房间论点：对AI理解的挑战 Searle的思想实验直接质疑人工智能是否可以真正理解语言或具有真正意识。想象一个人，对下巴一无所知

中国的'智能” AI助手回应微软召回的隐私缺陷Apr 24, 2025 am 11:17 AM

与西方同行相比，中国的科技巨头在AI开发方面的课程不同。他们不专注于技术基准和API集成，而是优先考虑“屏幕感知” AI助手 - AI T

Docker将熟悉的容器工作流程带到AI型号和MCP工具Apr 24, 2025 am 11:16 AM

MCP：赋能AI系统访问外部工具模型上下文协议（MCP）让AI应用能够通过标准化接口与外部工具和数据源交互。由Anthropic开发并得到主要AI提供商的支持，MCP允许语言模型和智能体发现可用工具并使用合适的参数调用它们。然而，实施MCP服务器存在一些挑战，包括环境冲突、安全漏洞以及跨平台行为不一致。 Forbes文章《Anthropic的模型上下文协议是AI智能体发展的一大步》作者：Janakiram MSVDocker通过容器化解决了这些问题。基于Docker Hub基础设施构建的Doc