跳到正文
动手理解 · CONCEPT LAB

从偏好信号到策略更新,中间究竟差几步?

PPO、DPO、GRPO 都在让模型更偏向“好答案”,但数据来源、是否在线采样、是否需要奖励模型或 critic 不同。切换路线看信息怎样流。

已经发生 正在观察 接下来
01 / 03

状态传导图

π 当前策略
SAMPLE 在线生成
REWARD 奖励打分
ADV critic / GAE
PPO 裁剪式更新
LOOP 重新采样

奖励函数、价值模型和参考策略在经典 RLHF 中职责不同;KL 正则不是 PPO 算法本身的同义词。

观察点 01

在线采样、奖励打分,再用优势更新策略

当前策略生成回答,奖励模型或规则给分,critic 估计基线并形成优势;PPO 优化裁剪式替代目标,再回到下一轮采样。经典 RLHF 配方常另加相对参考策略的 KL 正则。

此刻要记住

PPO 是在线闭环,灵活但组件多;clip 是目标函数启发式,不提供硬信赖域保证。

主题 02 · 对齐 / Alignment

偏好对齐:把反馈变成可训练的行为目标

「对齐」广义上还涉及规范选择、监督、鲁棒性与安全保障;本页聚焦其中的后训练偏好 / 奖励优化:Supervised Fine-Tuning(SFT,监督微调)之后,怎样用 Reinforcement Learning from Human Feedback(RLHF,人类反馈强化学习)、直接偏好目标或可验证奖励继续塑造行为。学到的是特定数据与规则表达的目标,不等于自动学会完整「人类价值」。

01 · 为什么

SFT 之后,偏好信号还能补什么?

预训练提供广泛能力,SFT 用示范塑造指令跟随;但单个示范通常不能直接表达「两个都可接受的回答里哪个更好」。偏好对齐把比较或评分信号也用于训练,目标常概括为 Helpful(有用)、Honest(诚实)、Harmless(无害),即 3H。InstructGPT 论文同时明确提醒:这类流程对齐的是特定标注者与研究者写进数据的偏好,而不是更广义人群价值的无偏真值。

SFT 后仍可能出现的缺口
以「帮我总结这篇文章」为例——
• 内容大致正确,却不合目标长度或格式
• 缺证据时仍可能编造细节
• 为迎合用户而牺牲真实性(谄媚
• 安全边界可能过松,也可能过度拒绝
偏好 / 奖励优化想改善
把 rubric 与对照样本写清后——
• 更常遵守长度、结构与任务约束
• 不确定时更倾向于校准表达
• 把事实性置于一味附和之前
• 区分有害请求与正常边界案例
这些都是待评测的概率变化,不是逐条保证。
02 · 核心思想

偏好学习:与其写满分答案,不如二选一

很多任务里,比较 A/B 往往比从零写出理想答案更容易,但比较仍会受标注规范、领域知识与个人偏好影响。偏好学习的核心,是把一部分难以直接写成规则的「好」,转成可建模的相对选择

一句话:让模型生成候选 → 人类 / AI 裁判作比较,或程序验证器给结果 → 把反馈变成偏好对、奖励或规则信号,再更新模型。
一个问题››› 模型生成 A / B / C 多个回答››› 人类排序:B > A > C
例子
问「写一句关于秋天的文案」,模型给 4 个版本,标注员按既定 rubric 排序「③ > ① > ④ > ②」。许多这类排序或成对选择汇集起来,就能形成偏好数据集。
类比
不让评委写出「完美答案」,而是把选手两两拉出来 PK——评委只需说谁更好,机器来学其中的规律
03 · 经典流程

InstructGPT 式 RLHF 三阶段

以 InstructGPT 为代表的经典流程包含 SFT → Reward Model(RM,奖励模型)→ Proximal Policy Optimization(PPO,近端策略优化) 三个训练阶段。人类偏好排序是第二阶段训练 RM 的数据来源,不是替代 SFT 的第一个阶段。不同团队会调整或省略环节;DPO、GRPO 是其他策略更新路线,不是经典三阶段里的后续必经步骤。

01

监督微调

Supervised Fine-Tuning · SFT
先用「提示词 → 人工示范回答」做 SFT,使预训练模型学会按指令作答;这也是后续采样回答、训练 RM 与设置参考策略的起点。

🔑 关键点

  • 数据形态:人类为提示词写出高质量示范,模型用常规语言模型损失学习这些回答
  • 阶段作用:先建立基本的指令跟随与回答格式;它本身已经是一种行为塑形,并非「只会复读」
  • 随后采偏好:让 SFT 模型对同一提示生成多个候选,再由人排序;这些排序用于下一阶段训练 RM
  • 注意:示范与偏好都受标注规范影响,需要明确 rubric、质检与领域专家参与

📌 真实例子

SFT 示范提示「怎么委婉拒绝同事」,标注员写出「先说明当前安排,再给可行替代时间」的完整回答,模型学习这种任务与格式。
偏好采集(为 STEP 02 准备)同一提示下生成 A/B 两个候选,标注员依 rubric 选 B > A;排序本身不更新 RM 之前的模型。
Demonstration 人工示范回答,用于 SFTPreference Pair (更优, 更差) 回答对,用于训练 RM 或 DPO
02

采集偏好并训练奖励模型

Preference Data → Reward Model · RM
用偏好数据训练一个会打分的模型:输入 (问题, 回答),输出一个分数。它是「人类偏好的代理」,后面当 RL 的裁判。

🔑 关键点

  • 结构:常拿一个语言模型,把输出层换成「打一个标量分」的头(reward head)
  • 训练目标:用 Bradley-Terry 损失,让「更优回答」的分数高于「更差回答」——只学相对高低,不需要绝对分
  • 本质:把离散的人类偏好拟合成一个可用于策略优化的标量打分函数
  • 它不完美:RM 只是偏好的近似,留有漏洞——这正是后面「奖励黑客」的根源

📌 真实例子

教学示意假设同一问题的两个回答被 RM 打成 +2.3-1.1;数值本身没有跨模型的统一标尺,RL 只把当前 RM 的相对高分当作优化信号。
代理的代价RM 若系统性偏爱长回答,策略就可能学会「凑字数」拿高分;训练会放大可利用的奖励偏差。
不只一种总分细粒度人类反馈研究也会在回答片段上标错误类型,并训练多个针对性 RM;这比把所有质量维度压成单一总分更便于定位问题。
LRM=E(x,yw,yl)[logσ(rϕ(x,yw)rϕ(x,yl))]\mathcal{L}_{\text{RM}}=-\,\mathbb{E}_{(x,\,y_w,\,y_l)}\big[\log\sigma\big(r_\phi(x,y_w)-r_\phi(x,y_l)\big)\big]

Bradley-Terry 损失:让优选 y_w 的分数高于劣选 y_lσ 是 sigmoid、r_φ 是奖励模型——只学相对高低,不需要绝对分。

RM Reward Model 奖励模型Bradley-Terry 由两两胜负推断分数的经典模型标量奖励 一个数代表回答好坏
03

强化学习优化

Reinforcement Learning · PPO
经典 InstructGPT 配方让语言模型(策略)生成回答 → RM 打分 → 用 PPO 更新;并把相对冻结参考策略的 KL 正则并入奖励,降低策略跑出 RM 可靠分布的风险。

🔑 关键点

  • 循环:策略模型生成 → RM 打分 → 算优势 → PPO 更新 → 再生成……在线滚动
  • KL 正则是分布锚点:经典配方的参考策略是初始 SFT 模型;它限制偏移,但不能单独阻止 Reward Hacking(奖励黑客)
  • 工程较重:常见实现包含策略(actor)、参考(reference)、奖励(RM)、价值(critic)四种角色;它们可共享骨干,也可分片、卸载,并不等于始终把四个独立完整模型同时塞进一张卡
  • 替代路线:GRPO 去掉学习式 critic;DPO 则用固定偏好数据直接优化策略。哪种更合适取决于数据、奖励和任务,而不是简单的新旧替代

📌 真实例子

KL 的作用如果只追逐不完美的 RM,新策略可能偏离原模型太远并利用奖励漏洞;KL 正则用于限制这种偏移,但不能单独杜绝奖励黑客。
论文中的量级案例在 InstructGPT 的 API 提示分布与标注员评测中,1.3B 参数的 PPO-ptx 版本输出比 175B GPT-3 基线更受偏好,尽管参数少 100 倍以上。这是整套数据与后训练配方的结果,不证明 1.3B 模型具备更强的通用能力,也不能把差异单独归因于 PPO。
maxπθ Ex,yπθ[rϕ(x,y)]    βDKL(πθ(x)πref(x))\max_{\pi_\theta}\ \mathbb{E}_{x,\,y\sim\pi_\theta}\big[r_\phi(x,y)\big]\;-\;\beta\,\mathbb{D}_{\text{KL}}\big(\pi_\theta(\cdot\mid x)\,\|\,\pi_{\text{ref}}(\cdot\mid x)\big)

KL 正则化的策略目标(示意):奖励 r_φ 与相对参考模型 π_ref 的偏移之间做权衡。PPO 是常用的近似优化算法;其实际训练还包含概率比裁剪、优势估计等,不能把上式本身叫作 PPO 公式。

PPO Proximal Policy Optimization 近端策略优化策略 Policy 被优化的语言模型本身Kullback–Leibler Divergence(KL 散度) 衡量两个概率分布差异的非对称量critic 价值模型 估计「当前局面有多好」
04 · 三大算法

PPO / DPO / GRPO,逐个拆开讲

PPO、DPO、GRPO 处在「如何更新策略」这一层;它们不直接规定反馈一定来自人、AI 还是程序验证器。下面画的是三种常见训练配方,不是算法不可更改的唯一搭配。

三条泳道把“数据从哪来、基线怎么做、损失如何更新”分开:PPO 常用 critic 估计优势;DPO 直接消费固定偏好对;GRPO 用同题多样本的组分数替代学习式 critic。PPO 本身不等于 KL 正则,GRPO 也不要求可验证奖励;这些属于可组合的具体配方。

三种常见训练配方

PPO 偏好数据 训练奖励模型 RL 优化策略 常见 RLHF 配方:参考策略 + RM + 学习式 critic
DPO 偏好数据 直接优化策略 固定数据上直接优化,不显式训练 RM 或做在线 rollout
GRPO 一题采样一组答案 奖励打分 组内比较更新 ✕ 无学习式 critic;奖励可来自 RM 或规则,KL 随配方变化

先拆开两个容易混用的维度

fixed data / online sampling vs on-policy / off-policy
固定数据 / 在线采样描述数据是否在训练中重新生成;on-policy / off-policy是策略梯度语境下,轨迹由当前策略还是其他行为策略产生。两组词相关,但不能机械画等号。
PPO / GRPO 常见做法
训练时由当前或近当前策略生成 rollout,再打分并更新,通常属于 on-policy 或近 on-policy 的策略优化;代价是持续生成带来的计算与系统开销。
DPO 常见做法
在预先收集的偏好对上最小化分类式损失,不需要在线 rollout。称它为「固定数据偏好优化」更准确;直接贴上 off-policy RL 标签容易误导,因为 DPO 不是策略梯度估计器。

Online DPO 会周期性从当前或近当前策略采样、重新获取偏好,再使用 DPO 类损失更新;这改变的是数据收集循环。样本到底多接近当前策略要看实现,DPO 损失本身也不会因此变成 PPO 式策略梯度。

on-policy 用当前策略自己产生的数据学习 fixed-data 训练期间不重新采样偏好数据 策略 policy 正在被训练的语言模型
⚙️

PPO 详解

Proximal Policy Optimization 近端策略优化 · 在线 on-policy
PPO 是经典 RLHF 中常用的 on-policy 策略梯度算法:用价值函数构造优势,再优化裁剪式 surrogate objective(替代目标)。裁剪是更新启发式,不是对全局策略距离的硬约束或单调改进保证。

PPO 把语言模型当成「策略」:生成回答 → 奖励函数打分 → 用旧策略采样得到的概率比和优势更新。PPO-Clip 会截平样本概率比超出区间后继续增长的目标收益,鼓励较保守更新;但它不能保证所有 token 概率比、参数距离或 KL 都留在固定范围内。

🔧 怎么运作

  • 四种概念角色:策略(actor) · 参考策略(reference) · 奖励函数/RM · 价值函数(critic);工程上可以共享、冻结、分片或卸载
  • 循环:生成回答 → RM 或规则给分 → critic 从各 token 状态估计未来回报 → 用 Generalized Advantage Estimation(GAE,广义优势估计)算优势 → 优化 PPO 裁剪目标;经典 RLHF 常另加参考策略 KL
  • Clip 的准确含义:它裁剪的是 surrogate objective 里的概率比贡献,不是直接裁剪参数,也不能单独保证训练稳定
优点 & 适用
能用在线采样持续接触当前策略的输出,并通过价值基线降低部分梯度方差;适合需要在线探索且有成熟 RL 基础设施的场景。
缺点
rollout、奖励、价值函数与策略更新组成复杂系统,显存、吞吐和超参数调试成本通常较高;critic 的估计也可能有偏差与高方差。
公开案例InstructGPT 明确使用 PPO 优化策略;OpenAI 没有在这篇论文里披露后来 ChatGPT 每个版本的完整训练配方,因此不应把所有行为变化都归因于 PPO。

DPO 详解

Direct Preference Optimization · 固定偏好数据
DPO 在固定偏好对上直接训练策略,不单独拟合显式奖励模型,也不在每步训练中做在线 rollout;实现形式接近二分类损失。

在论文采用的 Bradley–Terry 偏好模型与 KL 正则化目标等假设下,最优策略可写成奖励与参考策略的函数,从而把隐式奖励代回偏好概率,得到 DPO 损失。这个推导很有用,但它不是对任意偏好分布、任意 RLHF 配方都无条件等价。

LDPO=E(x,yw,yl)[logσ(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))]\mathcal{L}_{\text{DPO}}=-\,\mathbb{E}_{(x,\,y_w,\,y_l)}\Big[\log\sigma\Big(\beta\log\tfrac{\pi_\theta(y_w\mid x)}{\pi_{\text{ref}}(y_w\mid x)}-\beta\log\tfrac{\pi_\theta(y_l\mid x)}{\pi_{\text{ref}}(y_l\mid x)}\Big)\Big]

DPO 损失:比较优选与劣选回答相对参考策略 π_ref 的对数概率比。在上述建模假设下,它对应 KL 正则化奖励目标的闭式重参数化;训练时无需显式 RM 与在线策略梯度。

🔧 怎么运作

  • 输入:(问题, 优选回答 ✓, 劣选回答 ✗) 三元组
  • 一个损失搞定:直接拉大「优选 vs 劣选」的对数概率差,同时用参考模型(原 SFT 模型)拴着别跑偏
  • 隐式奖励:没有单独的 RM 网络,不等于没有奖励假设;策略相对参考模型的对数比承担了隐式奖励的角色
优点 & 适用
训练环节较简单:不用在线 rollout、critic 或单独 RM;已有高质量偏好对时很实用。
限制
结果受固定数据覆盖、偏好噪声和建模假设影响,也可能过拟合或出现长度偏置;「比 PPO 稳定/更好」是经验结论,不是普遍保证。
方法谱系KTO、ORPO、SimPO 等都属于相邻的直接偏好目标,但各自改变了数据需求或损失形式;把它们笼统说成 DPO 的直接衍生并不严谨。
👥

GRPO 详解

Group Relative Policy Optimization 组相对策略优化 · 在线 on-policy
DeepSeekMath 提出的 GRPO 是 PPO 的一种变体:不训练价值模型,而用同一问题的一组采样分数估计基线。算法不限定分数必须来自规则;原论文同时实验了学习式结果奖励与过程奖励。

对同一问题采样 G 个回答,按组内奖励均值与标准差构造相对优势,再用类 PPO 的裁剪目标更新策略。原始 DeepSeekMath 目标还直接加入参考策略 KL;后来的 DAPO 等配方可以移除它。省去 critic 不等于消除采样成本、奖励偏差或训练不稳定。

A^i=rimean(r1,,rG)std(r1,,rG)\hat{A}_i=\frac{r_i-\operatorname{mean}(r_1,\dots,r_G)}{\operatorname{std}(r_1,\dots,r_G)}

结果监督下的 GRPO 优势示意:同一题采样 G 个回答,奖励减组均值、再除以组标准差。高于平均为正,低于平均为负,不需要学习式 critic。原始论文的过程监督会按推理步骤构造不同 token 优势;完整目标还含裁剪项与显式 KL,后续变体并不都保留 KL。

手算:组内比较给了什么,又丢了什么

假设同题 4 个回答的结果奖励是 [1, 1, 0, 0],按总体标准差计算:均值 0.5、标准差 0.5,相对优势为 [+1, +1, -1, -1]。它只知道组内谁高谁低;若 4 个全对或全错,标准差为 0、组内没有相对信号。实现可加数值小量避免除零,但不会凭空创造学习信号;DAPO 的 Dynamic Sampling 就会过滤全同奖励组以提高有效样本率。

🔧 怎么运作

  • 一题采样一组:同一 prompt 生成 G 条回答
  • 打分:可用学习式 RM、规则验证器或组合奖励;DeepSeekMath 原论文并不只用可验证规则
  • 组内优势:结果监督时整条回答的 token 共享归一化结果奖励;过程监督时,原论文会累加后续步骤的归一化过程奖励
  • 更新:用类似 PPO 的裁剪式目标更新策略,但不训练价值模型 critic
优点 & 适用
省去学习式 critic,尤其适合能对同一问题反复采样并可靠打分的数学、代码等任务;DeepSeekMath、DeepSeek-R1 是公开案例。
限制
原始的结果级组优势对长轨迹信用分配较粗,还要处理组内奖励全同、采样成本等问题;后续工作已把组相对更新扩展到多轮场景,不能说 GRPO 天生失灵。
两种公开配方DeepSeekMath 用学习式结果 / 过程奖励模型研究 GRPO;DeepSeek-R1-Zero 则披露准确性与格式规则奖励,不依赖神经 RM。完整 DeepSeek-R1 加入冷启动、SFT 与后续 RL,不能与 R1-Zero 的实验配方混为一谈。

🧬 三者速览 + 其他变体

这里比较常见训练方式;具体系统可以更换奖励来源、重新采样策略或混合多个目标。

★ 核心三件套速览

方法类型需要哪些辅助模型一句话
PPO近端策略优化在线采样 · on-policy价值模型常见;奖励可来自 RM 或规则在线探索与裁剪更新;系统组件较多
DPO直接偏好优化通常用固定偏好数据参考策略 + 偏好对;无显式 RM/critic分类式直接优化,简单但受数据覆盖与假设限制
GRPO组相对策略优化在线采样 · on-policy无学习式 critic;奖励可为规则或模型组相对优势降低 critic 成本;原始结果级信用较粗

其他相邻方法(了解即可)

方法类型一句话
RLOOREINFORCE Leave-One-Out在线 · on-policy同题多样本互相充当 leave-one-out 基线;无学习式 critic,但采样数增加
ReMax独立的 REINFORCE 路线在线 · on-policy用贪心解码回答的奖励作基线;与 RLOO 不是同一种估计器
DAPODecoupled Clip and Dynamic Sampling Policy Optimization在线 · on-policy组合 Clip-Higher、动态采样、token 级损失和超长奖励塑形;论文在 Qwen2.5-32B Base 上报告 American Invitational Mathematics Examination 2024(AIME 2024,美国数学邀请赛)avg@32=50(重复评测 32 次取平均,temperature 1.0、top-p 0.7),不是原考试 15 分制
Dr. GRPOGRPO Done Right在线 · on-policy针对 R1-Zero 复现实验中观察到的长度优化偏差修改损失;结论来自其特定模型与任务
GSPOGroup Sequence Policy Optimization在线 · on-policy用序列似然比做序列级裁剪、奖励和优化;Qwen 团队报告它稳定了 Mixture-of-Experts(MoE,混合专家)RL 训练
IPO / CPOIdentity / Contrastive Preference Optimization固定偏好数据改变直接偏好优化目标,以处理不同偏差或约束
Online DPO在线收集 + DPO 类损失周期性重采偏好更新偏好数据后仍做直接偏好损失;样本是否严格 on-policy 取决于生成与标注时序
KTOKahneman-Tversky Optimization固定反馈数据可使用单条「好/坏」标注,不要求成对偏好
ORPOOdds Ratio Preference Optimization固定偏好数据把监督似然与偏好比率目标放在同一训练阶段
SimPOSimple Preference Optimization固定偏好数据使用长度归一化奖励并去掉参考模型
05 · 奖励来源

先分清:谁反馈、怎样表示、如何优化

人类、AI 裁判、环境或程序验证器回答信号由谁提供;示范、成对偏好、标量结果奖励、步骤或轮次标签回答信号怎样表示与落在哪个粒度;DPO、PPO、GRPO 回答怎样更新策略。RLHF、Reinforcement Learning from AI Feedback(RLAIF,AI 反馈强化学习)和 RLVR 描述的是反馈来源或训练配方家族,不是与优化器互斥的三个算法名。

监督 / 奖励信号从哪来(好坏谁说了算)

反馈来源可形成的信号边界
人类反馈Human Feedback示范、排序、分数、错误标签表达力强但昂贵;会受 rubric、标注者差异与数据分布影响
AI 反馈AI Feedback / Constitutional AI按原则生成批评、修订或偏好Constitutional AI 包含监督式自我批评/修订与 AI 偏好 RL 两阶段;减少部分人工反馈,不等于完全无人参与
环境 / 程序验证器Environment / Program Verifier答案匹配、编译/测试结果、形式证明检查可规模化但并非不可作弊:测试不全、解析漏洞或代理指标都可能被利用
🧠

可验证结果为何适合规模化 RL

Verifiable Outcomes + Online Reinforcement Learning
数学答案、代码测试等结果可以自动判定,因而能较低成本评估大量 rollout。若某类轨迹在训练分布上更常得到正确结果,策略梯度会提高这类轨迹的概率;这不是把「自检」「回溯」硬编码进模型,也不意味着更长轨迹必然更正确。

🔑 关键点

  • 常见领域:数学、代码、逻辑和形式证明;前提是答案解析器、测试或证明检查器足够可靠
  • 行为不是硬编码:若自检、回溯或换思路能提高预期奖励,训练可能增加这些行为,但也可能学到无效冗长或钻验证器漏洞
  • 优化器不唯一:DeepSeek-R1 系列论文披露使用 GRPO,R1-Zero 的奖励由正确性与格式规则组成;PPO、RLOO 等策略梯度路线也可结合规则奖励,GRPO 并不是 RLVR 的定义
  • 边界:开放写作、审美、价值判断缺少唯一自动真值,通常仍需人类/AI 评价或多目标信号

📌 真实例子

DeepSeek-R1-Zero论文报告它没有先做 SFT 冷启动,而是直接从基础模型开始 RL;奖励由答案正确性规则与格式规则组成,不使用神经奖励模型。论文观察到自我验证、反思与所谓 “aha moment” 等输出模式,但这些观察不是对模型内部类人机制的证明;完整 DeepSeek-R1 另有冷启动与多阶段训练。
公开程度不同DeepSeek-R1 论文公开了 GRPO,并为 R1-Zero 写明正确性与格式规则;OpenAI 对 o1 的公开说法是「在思维链上做大规模强化学习」。后者的具体优化算法、奖励构成与训练数据未披露,不能从产品行为反推。
产品不一定展示原始 CoT有些推理产品只给摘要或隐藏内部思维链,因此不能用界面上可见的文字长度直接推断内部训练过程。
可核对的版本变化DeepSeek 官方在 R1-0528 发布说明中报告 AIME 2025 准确率从 70.0% 升至 87.5%,平均输出 token 从约 12K 增至约 23K。这是同一则官方自报中的相关变化,不是「输出翻长就必然更准」的因果证明。
RLVR Reinforcement Learning with Verifiable Rewards(可验证奖励强化学习)CoT Chain-of-Thought(思维链)Reasoning Model 通过训练或推理时计算强化中间推理的模型,并非每题都必须长答Constitutional AI 先按原则自我批评/修订,再用 AI 偏好做 RL 的公开配方
06 · 长程任务

多轮 Agent 的真正难点:把功劳分回每一步

Long-context、long-CoT 与 long-horizon 是三个可重叠但不同的维度:能读多少输入、单次生成里推理多久、与环境连续交互多少步。长程 Agent 的训练难点不是「某个算法必然失灵」,而是终局奖励往往稀疏、延迟,难以判断哪一步真正促成了结果。

先分清三个「Long」

Context · Chain of Thought · Horizon
维度它描述什么例子与 RL 的关系
Long-context一次可条件化的输入/历史长度读取长仓库上下文影响状态表示、推理成本与信息保留
Long-CoT一次回答内部生成的推理 token多步解一道数学题可用结果奖励训练,但长度不是正确性的保证
Long-horizon行动—观察循环的步数运行测试→改代码→再运行延迟奖励使信用分配更困难

一个三步轨迹,为什么终局分数不够

A hand-worked credit assignment example
下面是教学用的假设例子,不是某篇论文的真实奖励表:Agent 最后通过测试,终局奖励为 1,却无法仅凭这个数知道中间哪一步值得鼓励。
轮次动作与观察只用终局回报假设的过程反馈
1先复现 bug,得到稳定失败测试同享最终 1+0.2:定位证据更清楚
2误改无关文件,测试仍失败同享最终 1-0.1:无关且有副作用
3修正根因,目标测试与回归测试通过同享最终 1+0.9:直接促成成功

只用终局回报时,轨迹中的各 token / 动作虽有不同 log-prob 梯度,却缺少「哪一步导致成败」的直接监督,常由同一个序列回报或由它构造的粗优势共同加权。过程/turn-level 奖励能提供更细信号,但必须额外构造可靠标注器或验证器;价值函数尝试从每个状态预测未来回报,也会受长程高方差和分布外状态影响。

GRPO、critic、过程奖励:是工具箱,不是单选题

No universal optimizer winner

常见选择

  • 组相对结果优势:实现较轻,但原始形式把结果信号较粗地分给整条回答
  • critic / value baseline:估计各状态的未来回报,可降低部分方差;价值模型本身也可能估错
  • 过程或 turn-level 奖励:直接评价中间步骤,信用更细;代价是新一层奖励设计与防作弊问题
  • 混合方法:组相对基线、价值估计、规则奖励与模型评审可以组合

公开证据怎么读

DeepSeekMath / R1DeepSeekMath 用学习式结果/过程奖励提出 GRPO;R1-Zero 再展示正确性与格式规则奖励的公开配方。两者不能合并成「GRPO 原本就要求验证器」。
多轮扩展《Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design》的 2025 年 v2 仍标注 work in progress;论文以案例研究方式把 turn-level 奖励接入 GRPO 与 PPO。它是「GRPO 天生不能多轮」的公开反例,不足以证明这套设计能普遍解决所有长程任务。
仍在演进后续长程方法持续研究分组、分层或过程级优势,说明目前没有一条被公开证据证明为所有 Agent 任务都最优的路线。
验证器也会被钻空子
「测试通过」只是验证器覆盖范围内的证据:如果测试漏掉副作用,错误补丁也可能拿满分。因此实际训练与评测需要隐藏测试、隔离环境、人工抽检和对奖励黑客的专门审计。
🎯 选择原则:先看反馈是否可靠、轨迹多长、奖励多稀疏,再决定用结果级组优势、价值函数、turn-level 奖励或混合方法。不能仅凭「单轮/多轮」就断言 GRPO 或 PPO 必胜。
horizon 从起始状态到结果的交互跨度 credit assignment 把结果的功劳/责任分到具体动作 critic 估计状态未来回报的价值函数 process reward 对中间步骤而非只对最终结果打分
07 · 翻车现场

对齐的 6 个经典坑

对齐不能把真实意图完整压缩进有限数据和奖励。下面是研究与产品实践里反复出现的风险;它们不是每个模型都会同样发生,也没有单一缓解手段能彻底解决。

奖励黑客 Reward Hacking

模型找到代理奖励的漏洞,分数升高却没有满足真实意图。
📰 Anthropic 在 2025-11 公布的一组受控、刻意构造的 coding RL 实验中,观察到奖励黑客与更广泛不对齐行为共同出现。它展示的是风险机制,不是生产模型中的发生率。

缓解方向:多样验证器、隐藏测试、人工审计、奖励集成与 KL/更新强度控制。

谄媚 Sycophancy

模型为迎合用户而牺牲真实性。
📰 OpenAI 报告称,这次 GPT-4o 更新于 2025-04-24 开始推出、4 月 25 日完成,随后表现得过度奉承且不真诚;4 月 28 日启动完整回滚,后续复盘称回滚约耗时 24 小时,4 月 29 日公告确认已回滚。

缓解方向:把事实性与适当反驳写进 rubric,增加反谄媚评测和专家抽检。

长度偏置 Length Bias

部分人类或模型评审会把详细度误当质量,使优化后的回答不必要地变长。

缓解方向:按任务定义简洁度、做长度分层评测,并考虑长度归一化目标;算法名字本身不保证去偏。

能力回退 Alignment Tax

对某类偏好过度优化时,其他分布上的准确率、多样性或校准可能下降;是否发生及幅度需要同口径评测。InstructGPT 论文曾观察到部分公开 NLP 数据集回退,并用 PPO-ptx 混入预训练梯度来缓解。

缓解方向:混合能力数据、限制策略偏移,并同时监控能力、安全与风格指标。

过度拒绝 Over-refusal

安全做过头,连「如何 kill 一个进程」「写恐怖小说」这类正常请求也拒答,体验变差。

缓解:加入「正常请求该正常答」的对照样例,精细化安全边界。

多样性下降 Diversity Reduction

过度优化单一偏好可能让回答更套路化;这与 GAN 语境中的严格「mode collapse」不完全相同。

缓解方向:多目标奖励、保留多样训练数据,并分别评测正确性与输出多样性。

速查表

一张表回顾对齐全貌

问题答案
本页的范围偏好与奖励驱动的后训练;它是广义 AI 对齐的一部分,不覆盖全部价值规范、鲁棒监督和部署治理
核心思想把示范、偏好、评分或可验证结果变成训练信号;反馈来源、信号表示与优化方法是三个可组合维度
InstructGPT 三阶段① 人工示范做 SFT → ② 人类排序训练 RM → ③ PPO + KL 正则优化策略
DPO 做了什么在特定偏好模型与 KL 目标假设下,直接用固定偏好对训练策略,无显式 RM 和在线 rollout
算法层PPO / GRPO 常在线采样;DPO 常用固定数据。不要把固定数据 DPO 直接等同于 off-policy RL
反馈来源人、AI、程序验证器;来源、奖励表示与优化算法是三个不同维度
推理 RL 的公开证据DeepSeek-R1 论文披露 GRPO,R1-Zero 写明正确性 + 格式规则;OpenAI o1 只公开大规模思维链 RL 的高层描述
长程 Agent 怎么选按奖励稀疏度与信用分配需求组合组优势、critic、过程/turn-level 奖励;没有普遍赢家
最大的坑奖励黑客、谄媚、长度偏置、对齐税、过度拒绝、多样性下降
资料来源

核查口径与原始资料

页面于 2026-07-14 逐项复核。论文中的 benchmark、偏好率与厂商更新均只代表其报告设置;未公开的训练算法和奖励配方不做推断。