跳到正文
动手理解 · CONCEPT LAB

老师到底把什么交给学生?

蒸馏可以只交教师响应文本,也可以交概率分布、隐藏特征,或在学生自己走到的前缀上即时提供教师分布。不同路线的监督对象、状态覆盖与系统成本不同。

已经发生 正在观察 接下来
01 / 03

状态传导图

TEACH 教师生成
TEXT 固定答案文本
TOK 目标 Token
SFT 学生交叉熵
STU 学生模型

这条路线常被称为 response / sequence distillation;训练形式与普通 SFT 相近,但目标文本必须含教师信号才属于蒸馏。

观察点 01

老师给出一份答案,学生像做 SFT 一样模仿

教师生成文本序列,学生只看到每个位置的目标 token。数据容易保存和复用,但看不到老师对其他候选词的相对判断。

此刻要记住

硬目标蒸馏传“老师选了谁”,不传“其他候选差多少”。

概念专题 · 训练全链路 / 知识蒸馏

知识蒸馏:让学生模仿老师的输出行为与分布

知识蒸馏(Knowledge Distillation)用教师模型的文本、输出分布或中间表示监督学生模型。学生常更小,但也可以与教师同规模、从更早的 checkpoint(训练检查点)继续训练,或汇总多个领域专家。On-Policy Distillation(OPD,使用学生当前策略采样的蒸馏)让学生在自己的 rollout(采样轨迹)上接受教师的 token(词元)分布监督,可用于压缩、行为恢复或多专家整合;效果与成本取决于教师在目标任务上的可靠性、散度、采样和系统实现。

soft target(软目标) + 温度:学输出分布 文本 / logits(softmax 前分数) / 隐藏表示 Kullback–Leibler(KL)散度:正向或反向 OPD:学生轨迹 + 老师 token 分布 成本数字只在同论文、同设置内比较 案例:R1-Distill · GLM-5 · V4-Pro
先分清监督对象和轨迹来源:教师生成的固定序列只给目标 token,固定前缀分布还给概率结构,OPD 则把“前缀从哪里来”改成当前学生,并形成持续更新的回路;若固定答案完全不含教师信号,那只是 SFT 基线,不是蒸馏。
01 · 一句话讲清

硬标签只给一个目标,软目标还给相对概率

在分类示意里,硬标签只说「这是猫」;教师软目标可能是「猫 85%、狗 12%、狐狸 3%」。后者还表达教师对备选类别的相对判断,这类信息通常被称为 dark knowledge(暗知识,即类别间相对关系);Hinton 等人的论文具体强调了错误类别之间的相对概率。在语言模型里,对应的是每个前缀下的下一 token 分布,它不是教师隐藏思维链的直接拷贝,也可能包含教师自己的错误与偏差。

一个监督基线 + 两类教师信号(不代表固定强弱顺序)
① 硬目标 / SFT 基线:Supervised Fine-Tuning(SFT,监督微调)学习固定目标 token;若目标与教师无关,它本身不是知识蒸馏。
② 教师响应或分布蒸馏:用教师生成文本,或对齐教师的 token 概率 / logits / 隐藏表示。
③ On-Policy 蒸馏:学生自己生成前缀,教师在这些前缀上给下一 token 分布;它缓解一部分训练—推理状态不匹配,但不保证总是优于固定数据。
为什么蒸馏值得单独讲
它既可用于模型压缩推理&部署),也可作为后训练中的行为迁移、checkpoint 能力恢复和多专家整合手段。它与 Reinforcement Learning(RL,强化学习)可以前后衔接或联合优化,不是简单的替代关系。
02 · 经典蒸馏

Hinton 的起点:soft target + 温度

Hinton、Vinyals、Dean 在 2015 年论文中系统推广了用温度化 soft target(软目标)压缩集成模型的做法。T 越大会让同一组 logits 的 softmax(归一化指数函数)更平滑;经典配方把软目标损失与真实标签损失加权组合,并常用 补偿温度造成的梯度缩放。现代语言模型蒸馏不一定同时拥有真实硬标签,也不一定使用温度。

pi=exp(zi/T)jexp(zj/T)(T>1 把分布「软化」)p_i=\dfrac{\exp(z_i/T)}{\sum_j \exp(z_j/T)}\qquad(T>1\ \text{把分布「软化」})

带温度的 softmax:同一组 logits 除以更大的 T 后差距变小,分布更平。它暴露的是教师的相对偏好,不保证这些偏好正确。

手算:温度怎样把分布拉平

设三个类别的 logits 为 [2, 1, 0]
T=1exp([2,1,0])=[7.389,2.718,1],归一化约为 [0.665,0.245,0.090]
T=2:先除以 2 得 [1,0.5,0],指数为 [2.718,1.649,1],归一化约为 [0.506,0.307,0.186]。第一名仍是同一类,但后二名得到更可见的概率质量。

经典压缩案例:DistilBERT
DistilBERT 论文报告:相对 BERT-base(BERT 即 Bidirectional Encoder Representations from Transformers,来自 Transformer 的双向编码器表示),参数量减少约 40%、在其语言理解评测汇总上保留约 97%,并在作者设置中快约 60%。这些是特定模型与测试环境的结果,不是所有蒸馏都能复现的固定比例。
03 · 全家谱

蒸馏家族:用几个维度给方法定位

下面是常用分类框架,不是穷尽式家谱:实际方法还会对齐隐藏层、注意力、特征关系,或与 RL/监督目标混合。

维度两端区别
教师访问权限生成文本 / log probabilities(对数概率) / 完整内部量只拿教师文本时可做序列级蒸馏;有 top-k 或全词表 logits 时可对齐分布;拿到隐藏层/注意力时还能做表示蒸馏。是否称“白盒”取决于论文口径,不必要求能修改教师权重
训练前缀来自谁固定数据 vs 学生 rollout固定前缀可以来自教师、人工提示或历史策略;on-policy 蒸馏则在训练中由当前/近当前学生生成轨迹。这里讨论的是分布监督所处的前缀,不是把人工答案自动算作教师信号
匹配目标序列 / token 分布 / 隐藏表示“蒸馏”不只等于完整 logits;目标不同,所需教师访问权限和成本也不同
散度方向正向 KL / 反向 KL / JSD 等方向是损失选择,不由 on/off-policy 自动决定;Generalized Knowledge Distillation(GKD,广义知识蒸馏)研究了正向、反向 KL 与 Jensen–Shannon Divergence(JSD,詹森—香农散度),较优选择会随任务与解码方式改变
Logit 蒸馏的工程硬约束:输出空间要能对齐
逐 token 比较教师与学生分布,要求两边的概率对应同一组候选事件;工程上通常共享 tokenizer(分词器)与词表,或另做明确的跨词表映射。若教师与学生 tokenizer 不同,直接比较第 i 个 logit 没有语义;但序列级蒸馏只需让学生重新切分教师文本,因此 DeepSeek-R1-Distill 可以把固定响应训进 Qwen 与 Llama 系学生。
正向 KL(常呈 mass-covering,多模式覆盖倾向)
正向 KL: DKL ⁣(pteacherpstudent)(常呈 mass-covering 倾向)\text{正向 KL}:\ D_{\mathrm{KL}}\!\left(p_{\text{teacher}}\,\Vert\,p_{\text{student}}\right)\quad\text{(常呈 mass-covering 倾向)}
在容量受限的理想化多峰例子里,它倾向覆盖教师赋予概率的模式。对教师样本做最大似然,在对教师采样取期望且样本充分时对应正向 KL;有限序列数据并不等于拿到了完整 token 分布。
反向 KL(常呈 mode-seeking,高概率模式集中倾向)
反向 KL: DKL ⁣(pstudentpteacher)(常呈 mode-seeking 倾向)\text{反向 KL}:\ D_{\mathrm{KL}}\!\left(p_{\text{student}}\,\Vert\,p_{\text{teacher}}\right)\quad\text{(常呈 mode-seeking 倾向)}
在同类理想化例子里,它更倾向集中于教师高概率模式,可能降低多样性。许多 OPD 实现使用反向 KL,但 on-policy 只规定轨迹由学生产生;GKD 也研究了正向 KL 与 JSD。
训练—推理状态不匹配
若固定数据主要覆盖教师常到达的前缀,学生推理时自己的早期误差可能把后续带到训练较少覆盖的状态,形成 exposure bias(暴露偏差)与 compounding error(累积误差)。GKD 把学生生成序列纳入训练以缓解这一问题;论文也指出这一风险的严重程度依任务而异,on-policy 采样不是无条件解药。
04 · 主角

On-Policy Distillation:在学生实际到达的前缀上匹配老师

OPD 的定义性特征是训练轨迹由当前/近当前学生生成。在每个学生前缀上,教师评估下一 token,再用选定散度训练学生:可取全词表 logits 直接计算逐位置分布差异,也可只查询学生已采样 token 的 log probability(对数概率)来做随机估计,后者通常方差更高。教师并不是直接判断“这一步在现实中对不对”;它只表达自己在该前缀下会怎样继续,因此教师出错或遇到陌生前缀时,监督也可能不可靠。

Lrev-OPD=Eysg[πθ]  tDKL ⁣(πθ(y<t)πteacher(y<t))\mathcal{L}_{\text{rev-OPD}}=\mathbb{E}_{y\sim \operatorname{sg}[\pi_\theta]}\;\sum_{t} D_{\mathrm{KL}}\!\left(\pi_\theta(\cdot\mid y_{<t})\,\Vert\,\pi_{\text{teacher}}(\cdot\mid y_{<t})\right)

一种常见的 OPD 目标:轨迹 y 从学生 π_θ 采样,在这些前缀上最小化学生到教师的反向 KL。sg 表示 stop-gradient(停止梯度):常见 GKD 做法不沿离散采样路径反传,而通过每个已采样前缀上的分布损失更新参数;参数更新后,下一批 rollout 的分布自然会变化。这里的 on-policy 来自外层学生采样,散度也可换成正向 KL 或 JSD,具体估计器以实现为准。

固定数据蒸馏与 OPD 的关键分界在外层轨迹:前者反复消费冻结数据,后者随学生更新而重新采样。散度方向是独立选择,不能用“反向 KL”直接定义 on-policy。
on-policy 训练数据来自「当前正在被训的学生」自己 散度 可选反向 KL、正向 KL、JSD 等 密集监督 每个生成位置都可有分布匹配信号
与 RL 的关系:共享 rollout 骨架,监督信号不同
结果级 RL 常在一条轨迹末尾得到少量标量奖励;token 分布蒸馏则可在许多位置提供教师—学生差异。Thinking Machines 用 O(1) vs O(N) bit(比特)作为直觉类比,不是严格适用于所有连续奖励和所有蒸馏实现的信息量定理。OPD 在学生前缀上训练,可缓解固定教师轨迹造成的状态不匹配,但教师在陌生前缀上也可能给出低质量监督。它通常也不是从随机学生冷启动:GKD 实验从已做 SFT、能生成基本合格序列的学生开始;Thinking Machines 也提示,当教师策略不在学生已有分布的有效覆盖范围内时,需要显著更大的 batch(批量)等补偿。该团队的 Tinker 实现能复用其 RL 管线并替换 KL 参照模型;“一行改动”是该代码库的工程描述,不是普遍实现成本。

手算:同一前缀下,两个 KL 方向并不相同

设教师对三个候选 token 的分布为 q=[0.7,0.2,0.1],学生为 p=[0.5,0.3,0.2]
正向 KL D(q||p) = 0.7 ln(0.7/0.5)+0.2 ln(0.2/0.3)+0.1 ln(0.1/0.2)0.085 nat。
反向 KL D(p||q) = 0.5 ln(0.5/0.7)+0.3 ln(0.3/0.2)+0.2 ln(0.2/0.1)0.092 nat。nat 是自然对数下的信息单位;两种 KL 都在分布相同时为 0,但对漏覆盖和多余概率质量的惩罚权重不同。

厂商消融案例(Qwen3 技术报告 Table 21 · Qwen3-8B 学生 · American Invitational Mathematics Examination 2024,AIME'24,美国数学邀请赛 · pass@1 单次采样通过率 · GPU 即 Graphics Processing Unit,图形处理器)

方法AIME'24 pass@1训练成本口径(GPU 小时)
Off-Policy 蒸馏(起点)55.0%
+ RL67.6%17,920 GPU 小时
+ On-Policy 蒸馏74.4%1,800 GPU 小时

Qwen 团队报告在该设置下,OPD 为 74.41,800 GPU 小时,RL 为 67.617,920 GPU 小时;17,920 ÷ 1,800 ≈ 9.96,所以“约 1/10 GPU 小时”是这张表内的比值。Thinking Machines 的 9–30× 是其 OPD 相对“外推到 200 万样本的 SFT”在不同成本核算下的估算;另一个 7–10× 更少梯度步才是把 RL 策略蒸回同一基座初始化的不同实验。三者不能混成通用的“比 RL 省 9–30×”。

行为恢复案例:持续学习线索,不是“零遗忘”保证
Thinking Machines 的 Qwen3-8B 内部实验分成两段:先用 70% 内部文档 + 30% 对话做 mid-training(中期训练),内部 Question Answering(QA,问答)从 18%升至 36%,但 IF-Eval(Instruction-Following Evaluation,指令遵循评测)从 85%降至 79%;再用中期训练前的 Qwen3-8B 作教师、在 Tulu3 prompts(提示集)上做 OPD,指标到 41% / 83%。第二段明确只为恢复指令遵循,不负责学习内部文档;这组公司内部评测说明“学新知识 → 蒸馏找回行为”的交替方案有潜力,但不能外推成普遍无遗忘定理。
⚖️

常见混淆:GRPO 与 OPD 是什么关系?

不同目标,可以共用管线或组合
Group Relative Policy Optimization(GRPO,组相对策略优化)用奖励构造组相对优势;OPD用教师分布构造模仿损失。两者常都需要学生 rollout,工程管线可以复用;也可以把蒸馏正则与奖励目标联合起来,因此既不是包含关系,也不必强制二选一。
GRPOOn-Policy 蒸馏 (OPD)
类型强化学习(RL)蒸馏(Distillation)
学习信号来自奖励(奖励模型 / 可验证答案)老师的分布
信号密度典型结果奖励或 Reinforcement Learning with Verifiable Rewards(RLVR,可验证奖励强化学习)任务常按整条回答给标量;也可用 process reward(过程奖励)逐步打分许多生成位置都可得到分布匹配信号;散度可为正向 KL、反向 KL 或 JSD
怎么算优势经典 GRPO 同题采 G 个、组内标准化(减均值 / 除标准差);后续变体可能改口径标准分布匹配不需要外部奖励或组内优势;具体实现也可把 KL 估计写进策略损失
前提要有某种奖励:奖励模型 / 规则·verifier(验证器)/ 测试用例要有可查询、在目标行为或领域上可靠的教师模型;它不必整体更大或全局更强

把 OPD 类比为“教师提供稠密奖励”有助于理解代码复用,但更准确的数学描述是:在学生前缀上做分布匹配。DeepSeek-V4 报告称,采样 token 的策略梯度式 KL 估计方差较大,因而在其多教师 OPD 阶段采用全词表反向 KL;这是 V4 的具体实现选择,不代表所有 OPD 都必须如此。

在 DeepSeek-V4-Pro 里:先后两段,不是嵌套
两个词都出现在 V4 后训练里,但它们是流水线的两段——
① 专家训练(用 GRPO) 数学专家 代码专家 Agent 专家 … 10+ 个 各自 SFT + GRPO 练强 → 它们就是「老师」 当老师 ② 合并阶段(用 OPD) 多老师 OPD全词表反向 KL 一个统一模型兼具各专家本事
GRPO 训出来的专家,正是 OPD 要蒸的「老师」——GRPO 在 OPD 之前、之外,给它喂老师,而不是待在它内部。
05 · 真实案例

三个真实模型,三种蒸馏用法

模型蒸馏类型用来干什么
DeepSeek-R1-Distill固定文本 · 混合 SFT 配方学习可见目标文本:约 60 万条推理样本来自 R1 推理 RL checkpoint 的拒绝采样;约 20 万条非推理样本沿用 DeepSeek-V3 数据管线并复用部分 V3 SFT 数据。DeepSeek 用这约 80 万条混合样本直接 SFT 多个 Qwen / Llama 开放 checkpoint,蒸馏学生未再做 RL。其表中 Qwen-32B 的 AIME 2024 pass@1 为 72.6%,o1-mini 为 63.6%;这组结果支持固定文本训练可以迁移行为,但不证明教师的隐藏推理机制被逐字复制
GLM-5on-policy · 跨阶段蒸馏缓解阶段间回退:官方报告的主流程为 SFT → Reasoning RL(推理强化学习)→ Agentic RL(智能体强化学习)→ General RL(通用强化学习),最后取此前训练阶段的最终 checkpoints 作教师;训练 prompts(提示)从各对应教师的 RL 训练集采样并按比例混合。这是恢复性 refinement(精修),不保证完全消除遗忘
DeepSeek-V4 系列on-policy · 多教师 OPD合并专家:官方报告称先以 SFT + GRPO 训练领域专家,再用全词表反向 KL 将 10+ 个教师蒸进统一模型;其流水线把上一代的 mixed-RL(混合强化学习)阶段完全替换为 OPD。这是 V4 的具体配方,不是 OPD 的通用定义

三个案例分别展示论文作者报告的混合固定文本训练(R1-Distill)、跨阶段能力恢复(GLM-5)与多专家整合(DeepSeek-V4)。它们说明蒸馏用途已超出传统压缩,但不能据三份团队报告推断 OPD 已普遍取代其他后训练方法。

06 · 怎么选 & 串起来

💡 蒸馏 / SFT / RL,到底怎么选

放进后训练全景里:SFT 学给定目标 token;RL 优化奖励;蒸馏模仿教师样本、分布或中间表示。OPD 需要可查询的可靠老师,并额外支付学生 rollout 与教师前向计算;它是否比 RL 或固定数据更划算,必须在同任务、同指标与完整成本口径下比较。
方法数据来自谁学什么什么时候用
SFT固定示范数据集模仿给定目标 token已有目标答案,要适配任务、格式、风格或行为
RL(PPO / GRPO)常由学生在线采样最大化奖励奖励可靠,且需要探索当前策略输出;PPO 是 Proximal Policy Optimization(近端策略优化)
固定数据蒸馏教师生成的固定响应;或固定前缀 + 教师分布模仿教师序列;能访问 logits 时也可匹配分布教师信号可离线准备、状态覆盖足够,想压缩或快速起步
On-Policy 蒸馏当前/近当前学生 rollout在学生前缀上匹配老师能查询可靠老师,且状态覆盖问题重要
on/off-policy 的本质

数据是不是当前模型自己产的 → 对齐·on/off-policy

蒸馏作为压缩

大模型变小钢炮 → 推理·省显存

蒸馏 vs SFT 的坑

蒸馏数据怎么造 → SFT·数据

资料来源

核查口径与原始资料

页面于 2026-07-14 逐项复核。表中模型结果来自各团队公开报告,仅在其模型版本、评测脚本和成本定义内成立;“mass-covering / mode-seeking”是容量受限分布逼近中的常见倾向,不是所有离散语言模型训练的绝对行为。