跳到正文
动手理解 · CONCEPT LAB

把训练生命周期当成一张依赖与回流地图

从数据到上线不是七个固定、互斥的工位。阶段名会因团队而异,中期训练可以并入预训练,SFT、偏好优化和评测也可能交替;真正稳定的是输入、训练信号、产物与反馈依赖。

已经发生 正在观察 接下来
01 / 03

状态传导图

DATA 版本化数据
TOK 冻结编码接口
PRE 基础预训练
MID? 可选继续训练
POST SFT / 偏好 / RL
GATE 评测发布门
SERVE 服务与监控

安全、多模态和评测证据会横跨多环,不能只挂在最后一个节点。

观察点 01

先看依赖,不把阶段名误当强制流程

版本化语料先由固定 Tokenizer 编码,再用自监督目标训练基座。部分团队随后单列长上下文或领域继续训练;后训练、发布门和服务依赖前一环产物,但真实项目可以回退、跳过或多轮交替。

此刻要记住

主线表达常见依赖;“中期训练”是可选边界,不是所有模型必经目标。

主题 01 · 训练 / Training

一个大模型,是怎么被训练出来的

把一个现代生成式语言模型从数据变成线上服务,可以拆成7 个教学环节 + 3 条跨链路支线。它是依赖与反馈地图,不是所有公司的固定流水线:中期训练可并入预训练,SFT、偏好优化和评测也可能多轮交替。

把整条链路类比成「培养一个人才」——第二行就是对应类比。点任意环节跳到详解。

箭头表示常见依赖,不表示唯一配方。Tokenizer 是模型权重绑定的编码接口;多模态可在联合预训练或后接适配时进入;安全从数据治理一直延伸到上线护栏。离线评测和线上监控都要把失败归因后送回对应上游。

← 左右滑动查看全部环节 · 点击跳转详情 →

00

数据工程

Data Engineering

把网页、代码、书籍和领域资料变成去重、过滤、配比明确且可追溯的训练 Token。

原始数据训练数据分片
进入对应专题
01

预训练

Pre-training

用因果语言建模等自监督目标,从海量序列中学习语言、知识与可迁移表示。

Token 数据基座模型
进入对应专题
02

中期训练(可选)

Mid-training

部分团队把长上下文、领域继续训练或末期数据配方单列;也可并入预训练。

基座或中间检查点专项增强基座
进入对应专题
03

监督微调 SFT

Supervised Fine-tuning

用理想示范与损失掩码,把会续写的基座训练成能遵循指令的助手。

指令与示范指令模型
进入对应专题
04

偏好与强化优化

Preference Optimization / RL

使用偏好对、标量奖励或可验证结果,改善回答选择与任务策略;安全仍需独立发布证据。

候选策略与反馈待评测策略
进入对应专题
05

评测与发布门

Evaluation & Release Gate

把能力、可靠性、安全、成本和线上 SLO 放进可复现测试与发布门。

候选模型与测试集证据与发布决策
进入对应专题
06

推理服务与监控

Serving & Monitoring

通过量化、缓存、调度和监控,把模型变成满足 SLO 且能回滚的服务。

通过发布门的模型线上服务与反馈
进入对应专题
资料来源

核查口径与原始资料

页面于 2026-07-14 逐项复核。这 7+3 张卡片是教学抽象,不是某一厂商完整配方;厂商数字保留发布日期、模型版本、评测设置与“自报”属性,论文倍率不外推为生产保证。法律案例按核查日状态描述,不构成法律意见。

速查表

一张表记住整条链路