跳到正文
DECISION GUIDE · POST-TRAINING

后训练不是方法大乱斗,而是把一种反馈翻译成梯度

SFT 给模型看“正确示范”,DPO 一类方法告诉它“A 比 B 好”,RL 则让它自己行动再按结果打分。选错入口,最常见的结果不是训练失败,而是模型很认真地把错误目标优化得更彻底。

基础语言模型进入三条后训练轨道:完整示范、偏好反馈与沙盒奖励;三条轨道在能力和安全评测闸门汇合后才进入发布检查点
直觉总览:SFT、偏好优化和在线 RL 是三种反馈到梯度的路线,不是能力排行榜;它们最终必须回到同一套独立评测、停止条件与灰度闸门。精确判断条件见下方 SVG。 查看原图 ↗
01 · 先找优化对象

预训练让模型会续写,后训练让它在一个交互制度里行动

预训练看到的是海量文本中的“下一个 token”。但产品想要的是另一套行为:听指令、按 JSON 返回、会调用工具、遇到危险请求能拒绝、不会为了显得聪明而编引用。后训练就是把这些行为标准转成可学习信号。

DEMONSTRATION

完整示范

给输入和理想输出,模型在目标 token 上做交叉熵。你付出的是高质量答案的编写成本,得到的是直接、稳定的行为模仿。

PREFERENCE

偏好反馈

常见数据是在同一输入下判断 A 与 B 谁更好;若只有单条回答的“好 / 坏”标签,KTO 一类目标也能使用非成对反馈。两者都不能自动发现偏好集没覆盖的长尾。R04

REWARD

结果奖励

模型先采样完整轨迹,再由测试、环境或奖励模型给分。它能探索示范之外的策略,同时也最容易钻评分器的空子。

白话类比

SFT 像老师做一道标准例题;DPO 像老师比较两份答案并圈出更好的一份;RL 像学生自己做实验,仪器最后给出成功或失败。三者不是互斥阵营,常见顺序是先用 SFT 把模型带进任务分布,再用偏好或奖励精修。

02 · 决策树

先问“反馈长什么样”,再问“哪个缩写流行”

决策树不是保证质量的配方,而是把不合适的候选先排除。例如没有可信评分器时,直接上 RL 只是把标注歧义放大;有明确标准答案时,却没必要先训练昂贵的通用奖励模型。当前 TRL 稳定版也把 SFT / DPO / KTO 归入离线方法,把 GRPO / RLOO 等归入在线方法;这是数据流分类,不是质量承诺。R09

后训练决策树:能写高质量示范时先做 SFT;有成对或排序偏好时可评估 DPO,只有单条好坏标签时可评估 KTO;结果可由程序或奖励模型评分时评估 RL、GRPO 或 PPO;不可验证时先补标注规范和评测,最终都要经过能力、安全、校准、延迟和灰度闸门。
先定义行为与反馈,再选择梯度路径。图中的 SFT、偏好优化和 RL 可以串联,但每加一段都必须有独立评测证明它带来净收益。 查看原图 ↗
03 · 贯穿案例

把“退款助手要更好”拆成三种完全不同的训练记录

假设电商助手要判断能否退款、查订单工具,并用简洁语气解释。业务目标看起来只有一句话,真正落到训练集却至少有三种数据结构。

输入 · 用户消息 + 订单状态

“耳机拆封后有杂音,买了 5 天,怎么退?”

业务约束:先调用 get_order;确认品类、签收日和售后政策;不虚构退款承诺;若信息不足,只问一个最必要的问题。这个规格同时决定训练样本与评测断言。

SFT 记录:直接给出完整理想轨迹

目标输出包含正确的工具调用 JSON、工具返回后的判断,以及面向用户的说明。训练时通常屏蔽 system / user token 的 loss,只在助手目标 token 上学习。它能快速学会协议,但若示范永远很短,模型也可能学到“没查清就立刻回答”。

DPO 记录:保留同一输入下的 chosen 与 rejected

chosen 会先查订单、说明条件并给下一步;rejected 直接承诺“已为你退款”。标注者只需稳定判断前者更好。DPO 提高两者的相对对数概率差,同时用参考模型约束偏移,不需要先单独训练奖励模型再在线采样 PPO。

RL 轨迹:让模型实际调用沙盒工具

一次 rollout 可能包含选工具、参数、等待结果、再次判断和最终回答。奖励可以由“工具名正确 + 参数合法 + 政策判断正确 + 无虚假承诺”组合。若只奖励最终是否出现“可退款”三个字,模型就可能跳过查单,这正是 reward hacking。

+1.0

政策结论正确

来自固定版本的规则引擎;必须记录政策版本,避免规则变更后旧样本继续当真。

+0.4

工具协议正确

可由 schema 验证,但“JSON 合法”不等于“业务参数正确”,还要检查订单归属和必要字段。

−1.0

无依据承诺

惩罚能降低幻觉,却也可能把模型推向全面拒答;因此要同时监控正常请求完成率。

04 · 三类梯度

它们真正不同的,是“哪段概率被往上推”

不用先背完整推导,也能从概率方向理解三类目标。下面用同一 prompt 的候选回答 y 来看:SFT 只见好答案,DPO 同时见好坏,RL 则见模型自己采样的轨迹和最后奖励。

SFT:提高示范 token 的似然

L = −Σ log πθ(yₜ | x, y<t)。每一步都把标注答案的下一个 token 概率往上推。优点是梯度密、实现简单;边界是它不会知道“另一种回答只差一点”还是“危险到不可接受”,也不会自动覆盖模型部署时会犯的错。

DPO:提高 chosen 相对 rejected 的优势

可把核心看成比较策略模型与参考模型上的对数概率差:chosen 的相对优势应大于 rejected。超参数 β 调节偏好压力与离参考策略的约束尺度。它省掉显式奖励模型与在线 RL 环,但仍继承偏好数据噪声、长度偏差和覆盖不足。

PPO / GRPO:提高获得高优势轨迹的概率

模型先生成回答,再根据 reward 或组内相对 reward 形成 advantage。PPO 通常配 critic 估计价值;GRPO 用同一问题的一组采样做相对基线,减少独立价值模型需求。两者都需要采样、奖励与 KL / clipping 等稳定约束,系统链路明显更长。DAPO 的公开实验还要处理组内全对 / 全错造成的零梯度、熵塌缩、token 级归一化和超长回答惩罚,说明“选 GRPO”只是系统设计的起点。R08

蒸馏:反馈的来源可以是更强模型

教师能生成示范、偏好理由或推理轨迹,但“老师说的”仍只是数据来源,不是第四种神秘优化器。学生会继承教师的事实错误、格式癖好和盲区;需要用可验证答案、人工抽检和独立保留集把错误挡在训练外。

一个容易混淆的点

“RLHF”描述的是使用人类反馈做强化学习的一类系统;“偏好优化”可以直接优化偏好对而不跑在线 PPO;“RLAIF”把部分反馈者换成模型。不要把数据来源、训练目标和优化算法混成一个维度。

05 · 证据闭环

平均分上涨不是终点,失败必须能回到某个数据桶

一个健康的后训练系统会保留“模型为何被判好 / 坏”的证据。上线失败若只变成一条总分,团队就不知道应该改示范、偏好标注、奖励函数,还是业务规格本身。

后训练证据闭环:行为规格依次进入数据构造、训练更新、离线评测和灰度流量,线上失败进入错误分析器并回到规格;保留集、挑战集和哨兵指标持续监督,底部给出收益、安全和分布漂移的停止条件。
评测集既是上线闸门,也是数据路由器:不同失败桶应回流到不同训练信号。保留集永不参与训练,防止把评测答案变成奖励提示。 查看原图 ↗
最小实验记录

每次后训练至少绑定 7 个版本号

base checkpoint、训练数据快照、chat template、tokenizer、奖励 / judge、训练代码与离线评测集。在线 RL 还应记录 rollout 引擎与采样参数、环境 / 工具镜像、每条轨迹的 reward 分解和截断原因;否则当输出突然变长或拒答率上升时,很难区分是算法变化、模板变化还是评测漂移。

06 · 失败与边界

后训练最危险的错觉,是“训练曲线正常,所以目标正确”

奖励过优化:代理分数继续升,真实质量反而降

奖励模型只是人类目标的近似。模型在训练分布上找到捷径后,可能生成更长、更自信、模板化的回答来讨好 judge。直接偏好优化也不自动免疫:NeurIPS 2024 的特定 DPO / IPO / SLiC 实验在更大 KL 预算下同样出现先升后降,有些设置在一轮数据尚未跑完时就越过峰值。解决思路不是只换 PPO 参数,而是增加独立人评、holdout judge、输出长度与风格哨兵,并按保留集选择 checkpoint。R07R10

过度拒答:安全样本把正常需求一起推走

只统计危险请求拒答率,会奖励“一律不答”。必须成对报告危险请求的安全率与正常近邻请求的完成率,并专门构造“看起来敏感但合法”的边界集。

能力回归:对齐后更礼貌,却不会做原来的题

窄 SFT 数据会改变输出分布,强偏好压力也可能压掉多样性。保留基础能力回归集、控制更新强度、混入 replay 数据,并把回滚 checkpoint 当作发布资产。

偏好不一致:标注者并没有共同标准

如果“简洁”和“完整”没有优先级,同一回答会被不同标注者相反评价。先测标注一致性、展示冲突样本并改 rubric;算法无法凭空恢复一个不存在的共同偏好。

评测泄漏:模型学会了题,而不是能力

训练数据、合成数据和评测题要做相似度与来源追踪。可验证题尤其容易被大规模生成后混回保留集。看到异常跃升时,先查污染,再谈涌现。

RESEARCH LEDGER

一手来源与证据边界

优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

R01
Training Language Models to Follow Instructions with Human FeedbackOuyang et al. · 2022

示范微调、奖励模型与 PPO 三阶段 RLHF 管线,以及人类偏好数据的原始实验。

R02
Direct Preference Optimization: Your Language Model is Secretly a Reward ModelRafailov et al. · 2023

DPO 把受 KL 约束的偏好优化改写为直接分类目标的推导与实验。

R03
Constitutional AI: Harmlessness from AI FeedbackBai et al. · 2022

用原则、模型自我批评与 AI 反馈构造监督和偏好信号的路线。

R04
KTO: Model Alignment as Prospect Theoretic OptimizationEthayarajh et al. · 2024

当反馈是“好 / 坏”而非严格成对偏好时的一类直接偏好目标。

R05
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsShao et al. · 2024

Group Relative Policy Optimization(GRPO)及可验证数学奖励的公开方法描述。

R06
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement LearningDeepSeek-AI · 2025

冷启动 SFT、多阶段 RL 与可验证推理奖励组合的真实模型案例。

R07
Scaling Laws for Reward Model OveroptimizationGao et al. · 2023

对代理奖励持续优化后,真实目标可能先升后降的实验性证据。

R08
DAPO: An Open-Source LLM Reinforcement Learning System at ScaleYu et al. · NeurIPS 2025

从朴素 GRPO 到 DAPO 的四项系统改造、AIME 2024 特定实验结果,以及熵、长度和有效样本监控。

R09
TRL — Transformers Reinforcement LearningHugging Face · stable v1.8.0 · 核查于 2026-07-17

当前稳定版对 SFT、DPO、KTO、GRPO、PPO、Reward / PRM 与蒸馏 Trainer 的分类及实验状态。

R10
Scaling Laws for Reward Model Overoptimization in Direct Alignment AlgorithmsRafailov et al. · NeurIPS 2024

DPO、IPO 与 SLiC 在更大 KL 预算或训练进度下同样可能出现先升后降,直接偏好优化不自动免疫过优化。