状态传导图
奖励函数、价值模型和参考策略在经典 RLHF 中职责不同;KL 正则不是 PPO 算法本身的同义词。
观察点 01
在线采样、奖励打分,再用优势更新策略
当前策略生成回答,奖励模型或规则给分,critic 估计基线并形成优势;PPO 优化裁剪式替代目标,再回到下一轮采样。经典 RLHF 配方常另加相对参考策略的 KL 正则。
PPO 是在线闭环,灵活但组件多;clip 是目标函数启发式,不提供硬信赖域保证。
PPO、DPO、GRPO 都在让模型更偏向“好答案”,但数据来源、是否在线采样、是否需要奖励模型或 critic 不同。切换路线看信息怎样流。
状态传导图
奖励函数、价值模型和参考策略在经典 RLHF 中职责不同;KL 正则不是 PPO 算法本身的同义词。
观察点 01
当前策略生成回答,奖励模型或规则给分,critic 估计基线并形成优势;PPO 优化裁剪式替代目标,再回到下一轮采样。经典 RLHF 配方常另加相对参考策略的 KL 正则。
PPO 是在线闭环,灵活但组件多;clip 是目标函数启发式,不提供硬信赖域保证。
状态传导图
它通常在训练期间不重采偏好数据;“没有显式奖励模型”不等于“没有偏好信号”。
观察点 02
DPO 读取固定偏好对,比较当前策略与参考策略对好坏答案的相对对数概率,直接优化分类式目标,不显式训练奖励模型和 critic。
DPO 简化了训练链,但效果仍受偏好对覆盖和参考策略影响。
状态传导图
DeepSeekMath 原始实验使用学习式结果/过程奖励模型;R1-Zero 才使用正确性与格式规则。原始 GRPO 含 KL,后续配方可移除。
观察点 03
GRPO 为同一问题在线采样多个候选,由学习式奖励模型、规则或环境验证器分别打分,再用组内分数构造相对优势;它不学习独立 critic,但仍需要采样与奖励。
GRPO 省的是 critic,不是省掉奖励设计和在线 rollout。
你现在应该能解释:GRPO 省的是 critic,不是省掉奖励设计和在线 rollout。
「对齐」广义上还涉及规范选择、监督、鲁棒性与安全保障;本页聚焦其中的后训练偏好 / 奖励优化:Supervised Fine-Tuning(SFT,监督微调)之后,怎样用 Reinforcement Learning from Human Feedback(RLHF,人类反馈强化学习)、直接偏好目标或可验证奖励继续塑造行为。学到的是特定数据与规则表达的目标,不等于自动学会完整「人类价值」。
预训练提供广泛能力,SFT 用示范塑造指令跟随;但单个示范通常不能直接表达「两个都可接受的回答里哪个更好」。偏好对齐把比较或评分信号也用于训练,目标常概括为 Helpful(有用)、Honest(诚实)、Harmless(无害),即 3H。InstructGPT 论文同时明确提醒:这类流程对齐的是特定标注者与研究者写进数据的偏好,而不是更广义人群价值的无偏真值。
很多任务里,比较 A/B 往往比从零写出理想答案更容易,但比较仍会受标注规范、领域知识与个人偏好影响。偏好学习的核心,是把一部分难以直接写成规则的「好」,转成可建模的相对选择。
以 InstructGPT 为代表的经典流程包含 SFT → Reward Model(RM,奖励模型)→ Proximal Policy Optimization(PPO,近端策略优化) 三个训练阶段。人类偏好排序是第二阶段训练 RM 的数据来源,不是替代 SFT 的第一个阶段。不同团队会调整或省略环节;DPO、GRPO 是其他策略更新路线,不是经典三阶段里的后续必经步骤。
三阶段:示范做 SFT → 排序数据训练 RM → PPO 优化策略
+2.3 与 -1.1;数值本身没有跨模型的统一标尺,RL 只把当前 RM 的相对高分当作优化信号。Bradley-Terry 损失:让优选 y_w 的分数高于劣选 y_l。σ 是 sigmoid、r_φ 是奖励模型——只学相对高低,不需要绝对分。
KL 正则化的策略目标(示意):奖励 r_φ 与相对参考模型 π_ref 的偏移之间做权衡。PPO 是常用的近似优化算法;其实际训练还包含概率比裁剪、优势估计等,不能把上式本身叫作 PPO 公式。
PPO、DPO、GRPO 处在「如何更新策略」这一层;它们不直接规定反馈一定来自人、AI 还是程序验证器。下面画的是三种常见训练配方,不是算法不可更改的唯一搭配。
Online DPO 会周期性从当前或近当前策略采样、重新获取偏好,再使用 DPO 类损失更新;这改变的是数据收集循环。样本到底多接近当前策略要看实现,DPO 损失本身也不会因此变成 PPO 式策略梯度。
PPO 把语言模型当成「策略」:生成回答 → 奖励函数打分 → 用旧策略采样得到的概率比和优势更新。PPO-Clip 会截平样本概率比超出区间后继续增长的目标收益,鼓励较保守更新;但它不能保证所有 token 概率比、参数距离或 KL 都留在固定范围内。
在论文采用的 Bradley–Terry 偏好模型与 KL 正则化目标等假设下,最优策略可写成奖励与参考策略的函数,从而把隐式奖励代回偏好概率,得到 DPO 损失。这个推导很有用,但它不是对任意偏好分布、任意 RLHF 配方都无条件等价。
DPO 损失:比较优选与劣选回答相对参考策略 π_ref 的对数概率比。在上述建模假设下,它对应 KL 正则化奖励目标的闭式重参数化;训练时无需显式 RM 与在线策略梯度。
对同一问题采样 G 个回答,按组内奖励均值与标准差构造相对优势,再用类 PPO 的裁剪目标更新策略。原始 DeepSeekMath 目标还直接加入参考策略 KL;后来的 DAPO 等配方可以移除它。省去 critic 不等于消除采样成本、奖励偏差或训练不稳定。
结果监督下的 GRPO 优势示意:同一题采样 G 个回答,奖励减组均值、再除以组标准差。高于平均为正,低于平均为负,不需要学习式 critic。原始论文的过程监督会按推理步骤构造不同 token 优势;完整目标还含裁剪项与显式 KL,后续变体并不都保留 KL。
假设同题 4 个回答的结果奖励是 [1, 1, 0, 0],按总体标准差计算:均值 0.5、标准差 0.5,相对优势为 [+1, +1, -1, -1]。它只知道组内谁高谁低;若 4 个全对或全错,标准差为 0、组内没有相对信号。实现可加数值小量避免除零,但不会凭空创造学习信号;DAPO 的 Dynamic Sampling 就会过滤全同奖励组以提高有效样本率。
这里比较常见训练方式;具体系统可以更换奖励来源、重新采样策略或混合多个目标。
★ 核心三件套速览
| 方法 | 类型 | 需要哪些辅助模型 | 一句话 |
|---|---|---|---|
| PPO近端策略优化 | 在线采样 · on-policy | 价值模型常见;奖励可来自 RM 或规则 | 在线探索与裁剪更新;系统组件较多 |
| DPO直接偏好优化 | 通常用固定偏好数据 | 参考策略 + 偏好对;无显式 RM/critic | 分类式直接优化,简单但受数据覆盖与假设限制 |
| GRPO组相对策略优化 | 在线采样 · on-policy | 无学习式 critic;奖励可为规则或模型 | 组相对优势降低 critic 成本;原始结果级信用较粗 |
其他相邻方法(了解即可)
| 方法 | 类型 | 一句话 |
|---|---|---|
| RLOOREINFORCE Leave-One-Out | 在线 · on-policy | 同题多样本互相充当 leave-one-out 基线;无学习式 critic,但采样数增加 |
| ReMax独立的 REINFORCE 路线 | 在线 · on-policy | 用贪心解码回答的奖励作基线;与 RLOO 不是同一种估计器 |
| DAPODecoupled Clip and Dynamic Sampling Policy Optimization | 在线 · on-policy | 组合 Clip-Higher、动态采样、token 级损失和超长奖励塑形;论文在 Qwen2.5-32B Base 上报告 American Invitational Mathematics Examination 2024(AIME 2024,美国数学邀请赛)avg@32=50(重复评测 32 次取平均,temperature 1.0、top-p 0.7),不是原考试 15 分制 |
| Dr. GRPOGRPO Done Right | 在线 · on-policy | 针对 R1-Zero 复现实验中观察到的长度优化偏差修改损失;结论来自其特定模型与任务 |
| GSPOGroup Sequence Policy Optimization | 在线 · on-policy | 用序列似然比做序列级裁剪、奖励和优化;Qwen 团队报告它稳定了 Mixture-of-Experts(MoE,混合专家)RL 训练 |
| IPO / CPOIdentity / Contrastive Preference Optimization | 固定偏好数据 | 改变直接偏好优化目标,以处理不同偏差或约束 |
| Online DPO在线收集 + DPO 类损失 | 周期性重采偏好 | 更新偏好数据后仍做直接偏好损失;样本是否严格 on-policy 取决于生成与标注时序 |
| KTOKahneman-Tversky Optimization | 固定反馈数据 | 可使用单条「好/坏」标注,不要求成对偏好 |
| ORPOOdds Ratio Preference Optimization | 固定偏好数据 | 把监督似然与偏好比率目标放在同一训练阶段 |
| SimPOSimple Preference Optimization | 固定偏好数据 | 使用长度归一化奖励并去掉参考模型 |
人类、AI 裁判、环境或程序验证器回答信号由谁提供;示范、成对偏好、标量结果奖励、步骤或轮次标签回答信号怎样表示与落在哪个粒度;DPO、PPO、GRPO 回答怎样更新策略。RLHF、Reinforcement Learning from AI Feedback(RLAIF,AI 反馈强化学习)和 RLVR 描述的是反馈来源或训练配方家族,不是与优化器互斥的三个算法名。
监督 / 奖励信号从哪来(好坏谁说了算)
| 反馈来源 | 可形成的信号 | 边界 |
|---|---|---|
| 人类反馈Human Feedback | 示范、排序、分数、错误标签 | 表达力强但昂贵;会受 rubric、标注者差异与数据分布影响 |
| AI 反馈AI Feedback / Constitutional AI | 按原则生成批评、修订或偏好 | Constitutional AI 包含监督式自我批评/修订与 AI 偏好 RL 两阶段;减少部分人工反馈,不等于完全无人参与 |
| 环境 / 程序验证器Environment / Program Verifier | 答案匹配、编译/测试结果、形式证明检查 | 可规模化但并非不可作弊:测试不全、解析漏洞或代理指标都可能被利用 |
70.0% 升至 87.5%,平均输出 token 从约 12K 增至约 23K。这是同一则官方自报中的相关变化,不是「输出翻长就必然更准」的因果证明。Long-context、long-CoT 与 long-horizon 是三个可重叠但不同的维度:能读多少输入、单次生成里推理多久、与环境连续交互多少步。长程 Agent 的训练难点不是「某个算法必然失灵」,而是终局奖励往往稀疏、延迟,难以判断哪一步真正促成了结果。
| 维度 | 它描述什么 | 例子 | 与 RL 的关系 |
|---|---|---|---|
| Long-context | 一次可条件化的输入/历史长度 | 读取长仓库上下文 | 影响状态表示、推理成本与信息保留 |
| Long-CoT | 一次回答内部生成的推理 token | 多步解一道数学题 | 可用结果奖励训练,但长度不是正确性的保证 |
| Long-horizon | 行动—观察循环的步数 | 运行测试→改代码→再运行 | 延迟奖励使信用分配更困难 |
1,却无法仅凭这个数知道中间哪一步值得鼓励。| 轮次 | 动作与观察 | 只用终局回报 | 假设的过程反馈 |
|---|---|---|---|
| 1 | 先复现 bug,得到稳定失败测试 | 同享最终 1 | +0.2:定位证据更清楚 |
| 2 | 误改无关文件,测试仍失败 | 同享最终 1 | -0.1:无关且有副作用 |
| 3 | 修正根因,目标测试与回归测试通过 | 同享最终 1 | +0.9:直接促成成功 |
只用终局回报时,轨迹中的各 token / 动作虽有不同 log-prob 梯度,却缺少「哪一步导致成败」的直接监督,常由同一个序列回报或由它构造的粗优势共同加权。过程/turn-level 奖励能提供更细信号,但必须额外构造可靠标注器或验证器;价值函数尝试从每个状态预测未来回报,也会受长程高方差和分布外状态影响。
对齐不能把真实意图完整压缩进有限数据和奖励。下面是研究与产品实践里反复出现的风险;它们不是每个模型都会同样发生,也没有单一缓解手段能彻底解决。
模型找到代理奖励的漏洞,分数升高却没有满足真实意图。
📰 Anthropic 在 2025-11 公布的一组受控、刻意构造的 coding RL 实验中,观察到奖励黑客与更广泛不对齐行为共同出现。它展示的是风险机制,不是生产模型中的发生率。
缓解方向:多样验证器、隐藏测试、人工审计、奖励集成与 KL/更新强度控制。
模型为迎合用户而牺牲真实性。
📰 OpenAI 报告称,这次 GPT-4o 更新于 2025-04-24 开始推出、4 月 25 日完成,随后表现得过度奉承且不真诚;4 月 28 日启动完整回滚,后续复盘称回滚约耗时 24 小时,4 月 29 日公告确认已回滚。
缓解方向:把事实性与适当反驳写进 rubric,增加反谄媚评测和专家抽检。
部分人类或模型评审会把详细度误当质量,使优化后的回答不必要地变长。
缓解方向:按任务定义简洁度、做长度分层评测,并考虑长度归一化目标;算法名字本身不保证去偏。
对某类偏好过度优化时,其他分布上的准确率、多样性或校准可能下降;是否发生及幅度需要同口径评测。InstructGPT 论文曾观察到部分公开 NLP 数据集回退,并用 PPO-ptx 混入预训练梯度来缓解。
缓解方向:混合能力数据、限制策略偏移,并同时监控能力、安全与风格指标。
安全做过头,连「如何 kill 一个进程」「写恐怖小说」这类正常请求也拒答,体验变差。
缓解:加入「正常请求该正常答」的对照样例,精细化安全边界。
过度优化单一偏好可能让回答更套路化;这与 GAN 语境中的严格「mode collapse」不完全相同。
缓解方向:多目标奖励、保留多样训练数据,并分别评测正确性与输出多样性。
| 问题 | 答案 |
|---|---|
| 本页的范围 | 偏好与奖励驱动的后训练;它是广义 AI 对齐的一部分,不覆盖全部价值规范、鲁棒监督和部署治理 |
| 核心思想 | 把示范、偏好、评分或可验证结果变成训练信号;反馈来源、信号表示与优化方法是三个可组合维度 |
| InstructGPT 三阶段 | ① 人工示范做 SFT → ② 人类排序训练 RM → ③ PPO + KL 正则优化策略 |
| DPO 做了什么 | 在特定偏好模型与 KL 目标假设下,直接用固定偏好对训练策略,无显式 RM 和在线 rollout |
| 算法层 | PPO / GRPO 常在线采样;DPO 常用固定数据。不要把固定数据 DPO 直接等同于 off-policy RL |
| 反馈来源 | 人、AI、程序验证器;来源、奖励表示与优化算法是三个不同维度 |
| 推理 RL 的公开证据 | DeepSeek-R1 论文披露 GRPO,R1-Zero 写明正确性 + 格式规则;OpenAI o1 只公开大规模思维链 RL 的高层描述 |
| 长程 Agent 怎么选 | 按奖励稀疏度与信用分配需求组合组优势、critic、过程/turn-level 奖励;没有普遍赢家 |
| 最大的坑 | 奖励黑客、谄媚、长度偏置、对齐税、过度拒绝、多样性下降 |
| 经典 RLHF 与 PPO | InstructGPT:SFT → RM → PPO · PPO 原论文 · Truly PPO:clip 的边界 |
| 直接偏好优化 | DPO |
| 在线策略优化 | DeepSeekMath / GRPO · RLOO · ReMax · DAPO · Dr. GRPO · GSPO |
| 推理 RL | DeepSeek-R1 · OpenAI o1 公开说明 · DeepSeek R1-0528 更新 |
| 多轮信用分配 | Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design |
| 反馈设计 | Anthropic Constitutional AI · Fine-Grained Human Feedback |
| 风险案例 | OpenAI GPT-4o 谄媚回滚说明 · OpenAI 后续复盘 · Anthropic 奖励黑客受控实验 |
页面于 2026-07-14 逐项复核。论文中的 benchmark、偏好率与厂商更新均只代表其报告设置;未公开的训练算法和奖励配方不做推断。