状态传导图
这条路线常被称为 response / sequence distillation;训练形式与普通 SFT 相近,但目标文本必须含教师信号才属于蒸馏。
观察点 01
老师给出一份答案,学生像做 SFT 一样模仿
教师生成文本序列,学生只看到每个位置的目标 token。数据容易保存和复用,但看不到老师对其他候选词的相对判断。
硬目标蒸馏传“老师选了谁”,不传“其他候选差多少”。
蒸馏可以只交教师响应文本,也可以交概率分布、隐藏特征,或在学生自己走到的前缀上即时提供教师分布。不同路线的监督对象、状态覆盖与系统成本不同。
状态传导图
这条路线常被称为 response / sequence distillation;训练形式与普通 SFT 相近,但目标文本必须含教师信号才属于蒸馏。
观察点 01
教师生成文本序列,学生只看到每个位置的目标 token。数据容易保存和复用,但看不到老师对其他候选词的相对判断。
硬目标蒸馏传“老师选了谁”,不传“其他候选差多少”。
状态传导图
保存完整 logits 可能很昂贵,工程上可用 top-k、在线计算或压缩;逐 token 对齐还要求两边输出空间兼容。
观察点 02
在相同前缀上,教师输出全词表或 top-k 概率,温度可把分布拉平。学生最小化 KL 或其他散度,学习候选之间的细粒度相对关系。
软标签的价值在相对概率,而不是把答案变得更“软”。
状态传导图
它直接覆盖当前学生访问的状态,但需反复生成轨迹并查询教师;相对成本取决于缓存、并行和实现方式。
观察点 03
当前学生 rollout 生成前缀,冻结教师在这些前缀上给出下一 token 分布。学生更新后会访问新的轨迹,再重复分布匹配;教师信号也可能包含错误。
On-policy 描述“前缀从谁来”,与选择正向 KL、反向 KL 是两个维度。
你现在应该能解释:On-policy 描述“前缀从谁来”,与选择正向 KL、反向 KL 是两个维度。
知识蒸馏(Knowledge Distillation)用教师模型的文本、输出分布或中间表示监督学生模型。学生常更小,但也可以与教师同规模、从更早的 checkpoint(训练检查点)继续训练,或汇总多个领域专家。On-Policy Distillation(OPD,使用学生当前策略采样的蒸馏)让学生在自己的 rollout(采样轨迹)上接受教师的 token(词元)分布监督,可用于压缩、行为恢复或多专家整合;效果与成本取决于教师在目标任务上的可靠性、散度、采样和系统实现。
在分类示意里,硬标签只说「这是猫」;教师软目标可能是「猫 85%、狗 12%、狐狸 3%」。后者还表达教师对备选类别的相对判断,这类信息通常被称为 dark knowledge(暗知识,即类别间相对关系);Hinton 等人的论文具体强调了错误类别之间的相对概率。在语言模型里,对应的是每个前缀下的下一 token 分布,它不是教师隐藏思维链的直接拷贝,也可能包含教师自己的错误与偏差。
Hinton、Vinyals、Dean 在 2015 年论文中系统推广了用温度化 soft target(软目标)压缩集成模型的做法。T 越大会让同一组 logits 的 softmax(归一化指数函数)更平滑;经典配方把软目标损失与真实标签损失加权组合,并常用 T² 补偿温度造成的梯度缩放。现代语言模型蒸馏不一定同时拥有真实硬标签,也不一定使用温度。
带温度的 softmax:同一组 logits 除以更大的 T 后差距变小,分布更平。它暴露的是教师的相对偏好,不保证这些偏好正确。
设三个类别的 logits 为 [2, 1, 0]。
T=1:exp([2,1,0])=[7.389,2.718,1],归一化约为 [0.665,0.245,0.090]。
T=2:先除以 2 得 [1,0.5,0],指数为 [2.718,1.649,1],归一化约为 [0.506,0.307,0.186]。第一名仍是同一类,但后二名得到更可见的概率质量。
下面是常用分类框架,不是穷尽式家谱:实际方法还会对齐隐藏层、注意力、特征关系,或与 RL/监督目标混合。
| 维度 | 两端 | 区别 |
|---|---|---|
| 教师访问权限 | 生成文本 / log probabilities(对数概率) / 完整内部量 | 只拿教师文本时可做序列级蒸馏;有 top-k 或全词表 logits 时可对齐分布;拿到隐藏层/注意力时还能做表示蒸馏。是否称“白盒”取决于论文口径,不必要求能修改教师权重 |
| 训练前缀来自谁 | 固定数据 vs 学生 rollout | 固定前缀可以来自教师、人工提示或历史策略;on-policy 蒸馏则在训练中由当前/近当前学生生成轨迹。这里讨论的是分布监督所处的前缀,不是把人工答案自动算作教师信号 |
| 匹配目标 | 序列 / token 分布 / 隐藏表示 | “蒸馏”不只等于完整 logits;目标不同,所需教师访问权限和成本也不同 |
| 散度方向 | 正向 KL / 反向 KL / JSD 等 | 方向是损失选择,不由 on/off-policy 自动决定;Generalized Knowledge Distillation(GKD,广义知识蒸馏)研究了正向、反向 KL 与 Jensen–Shannon Divergence(JSD,詹森—香农散度),较优选择会随任务与解码方式改变 |
i 个 logit 没有语义;但序列级蒸馏只需让学生重新切分教师文本,因此 DeepSeek-R1-Distill 可以把固定响应训进 Qwen 与 Llama 系学生。OPD 的定义性特征是训练轨迹由当前/近当前学生生成。在每个学生前缀上,教师评估下一 token,再用选定散度训练学生:可取全词表 logits 直接计算逐位置分布差异,也可只查询学生已采样 token 的 log probability(对数概率)来做随机估计,后者通常方差更高。教师并不是直接判断“这一步在现实中对不对”;它只表达自己在该前缀下会怎样继续,因此教师出错或遇到陌生前缀时,监督也可能不可靠。
一种常见的 OPD 目标:轨迹 y 从学生 π_θ 采样,在这些前缀上最小化学生到教师的反向 KL。sg 表示 stop-gradient(停止梯度):常见 GKD 做法不沿离散采样路径反传,而通过每个已采样前缀上的分布损失更新参数;参数更新后,下一批 rollout 的分布自然会变化。这里的 on-policy 来自外层学生采样,散度也可换成正向 KL 或 JSD,具体估计器以实现为准。
设教师对三个候选 token 的分布为 q=[0.7,0.2,0.1],学生为 p=[0.5,0.3,0.2]。
正向 KL D(q||p) = 0.7 ln(0.7/0.5)+0.2 ln(0.2/0.3)+0.1 ln(0.1/0.2) ≈ 0.085 nat。
反向 KL D(p||q) = 0.5 ln(0.5/0.7)+0.3 ln(0.3/0.2)+0.2 ln(0.2/0.1) ≈ 0.092 nat。nat 是自然对数下的信息单位;两种 KL 都在分布相同时为 0,但对漏覆盖和多余概率质量的惩罚权重不同。
| 方法 | AIME'24 pass@1 | 训练成本口径(GPU 小时) |
|---|---|---|
| Off-Policy 蒸馏(起点) | 55.0% | — |
| + RL | 67.6% | 17,920 GPU 小时 |
| + On-Policy 蒸馏 | 74.4% | 1,800 GPU 小时 |
Qwen 团队报告在该设置下,OPD 为 74.4、1,800 GPU 小时,RL 为 67.6、17,920 GPU 小时;17,920 ÷ 1,800 ≈ 9.96,所以“约 1/10 GPU 小时”是这张表内的比值。Thinking Machines 的 9–30× 是其 OPD 相对“外推到 200 万样本的 SFT”在不同成本核算下的估算;另一个 7–10× 更少梯度步才是把 RL 策略蒸回同一基座初始化的不同实验。三者不能混成通用的“比 RL 省 9–30×”。
| GRPO | On-Policy 蒸馏 (OPD) | |
|---|---|---|
| 类型 | 强化学习(RL) | 蒸馏(Distillation) |
| 学习信号来自 | 奖励(奖励模型 / 可验证答案) | 老师的分布 |
| 信号密度 | 典型结果奖励或 Reinforcement Learning with Verifiable Rewards(RLVR,可验证奖励强化学习)任务常按整条回答给标量;也可用 process reward(过程奖励)逐步打分 | 许多生成位置都可得到分布匹配信号;散度可为正向 KL、反向 KL 或 JSD |
| 怎么算优势 | 经典 GRPO 同题采 G 个、组内标准化(减均值 / 除标准差);后续变体可能改口径 | 标准分布匹配不需要外部奖励或组内优势;具体实现也可把 KL 估计写进策略损失 |
| 前提 | 要有某种奖励:奖励模型 / 规则·verifier(验证器)/ 测试用例 | 要有可查询、在目标行为或领域上可靠的教师模型;它不必整体更大或全局更强 |
把 OPD 类比为“教师提供稠密奖励”有助于理解代码复用,但更准确的数学描述是:在学生前缀上做分布匹配。DeepSeek-V4 报告称,采样 token 的策略梯度式 KL 估计方差较大,因而在其多教师 OPD 阶段采用全词表反向 KL;这是 V4 的具体实现选择,不代表所有 OPD 都必须如此。
| 模型 | 蒸馏类型 | 用来干什么 |
|---|---|---|
| DeepSeek-R1-Distill | 固定文本 · 混合 SFT 配方 | 学习可见目标文本:约 60 万条推理样本来自 R1 推理 RL checkpoint 的拒绝采样;约 20 万条非推理样本沿用 DeepSeek-V3 数据管线并复用部分 V3 SFT 数据。DeepSeek 用这约 80 万条混合样本直接 SFT 多个 Qwen / Llama 开放 checkpoint,蒸馏学生未再做 RL。其表中 Qwen-32B 的 AIME 2024 pass@1 为 72.6%,o1-mini 为 63.6%;这组结果支持固定文本训练可以迁移行为,但不证明教师的隐藏推理机制被逐字复制 |
| GLM-5 | on-policy · 跨阶段蒸馏 | 缓解阶段间回退:官方报告的主流程为 SFT → Reasoning RL(推理强化学习)→ Agentic RL(智能体强化学习)→ General RL(通用强化学习),最后取此前训练阶段的最终 checkpoints 作教师;训练 prompts(提示)从各对应教师的 RL 训练集采样并按比例混合。这是恢复性 refinement(精修),不保证完全消除遗忘 |
| DeepSeek-V4 系列 | on-policy · 多教师 OPD | 合并专家:官方报告称先以 SFT + GRPO 训练领域专家,再用全词表反向 KL 将 10+ 个教师蒸进统一模型;其流水线把上一代的 mixed-RL(混合强化学习)阶段完全替换为 OPD。这是 V4 的具体配方,不是 OPD 的通用定义 |
三个案例分别展示论文作者报告的混合固定文本训练(R1-Distill)、跨阶段能力恢复(GLM-5)与多专家整合(DeepSeek-V4)。它们说明蒸馏用途已超出传统压缩,但不能据三份团队报告推断 OPD 已普遍取代其他后训练方法。
| 方法 | 数据来自谁 | 学什么 | 什么时候用 |
|---|---|---|---|
| SFT | 固定示范数据集 | 模仿给定目标 token | 已有目标答案,要适配任务、格式、风格或行为 |
| RL(PPO / GRPO) | 常由学生在线采样 | 最大化奖励 | 奖励可靠,且需要探索当前策略输出;PPO 是 Proximal Policy Optimization(近端策略优化) |
| 固定数据蒸馏 | 教师生成的固定响应;或固定前缀 + 教师分布 | 模仿教师序列;能访问 logits 时也可匹配分布 | 教师信号可离线准备、状态覆盖足够,想压缩或快速起步 |
| On-Policy 蒸馏 | 当前/近当前学生 rollout | 在学生前缀上匹配老师 | 能查询可靠老师,且状态覆盖问题重要 |
数据是不是当前模型自己产的 → 对齐·on/off-policy
大模型变小钢炮 → 推理·省显存
蒸馏数据怎么造 → SFT·数据
| 经典蒸馏 | Hinton et al.:Distilling the Knowledge in a Neural Network · DistilBERT |
| 序列与 On-Policy 蒸馏 | Sequence-Level Knowledge Distillation · GKD / On-Policy Distillation |
| OPD 复现实验 | Thinking Machines Lab:On-Policy Distillation · Tinker 可复现实验说明 |
| Qwen3 消融 | Qwen3 Technical Report(文中 GPU 小时与 AIME 数字均为团队报告口径) |
| R1-Distill 固定文本训练 | DeepSeek-R1 与 R1-Distill |
| 跨阶段 OPD | GLM-5 Technical Report |
| 多教师 OPD | DeepSeek-V4 官方技术报告 |
页面于 2026-07-14 逐项复核。表中模型结果来自各团队公开报告,仅在其模型版本、评测脚本和成本定义内成立;“mass-covering / mode-seeking”是容量受限分布逼近中的常见倾向,不是所有离散语言模型训练的绝对行为。