跳到正文
动手理解 · CONCEPT LAB

把一个 AI 项目拆回共同学习闭环

以学习模型为核心的分类器、聚类、生成模型和 Agent 看起来很不同,但都能先问五件事:数据是什么、目标怎样计分、参数或状态怎样表示规律、怎样优化、上线时怎样使用。

已经发生 正在观察 接下来
01 / 04

状态传导图

X 输入样本
MODEL 模型预测
LOSS 与外部目标比较
GRAD 计算梯度
OPT 更新参数
PRED 常规上线预测

外部目标不应作为待预测样本的输入流进模型。垃圾邮件分类只是可微模型示例;决策树、k-NN(k-Nearest Neighbors,k 近邻)等监督方法的训练机制不同。下方刻度只表示本例机制。

观察点 01

可微分类器:外部目标只进入比较环节

这里以神经网络分类器为例:输入先产生预测,损失再把预测与外部目标比较,并沿梯度更新参数。目标可以来自人工标注、传感器或业务记录;常规上线预测不自动改参数。

外部目标依赖核心依赖
上线时更新参数本例不更新
此刻要记住

监督学习的“监督”来自外部目标,不等于必须由人逐条标注或必须使用梯度算法。

数学最小底座 · 01 / 04

AI 到底在学什么

先别急着背 Transformer、MoE(Mixture of Experts,混合专家)和 Agent(智能体)。对今天主流的深度学习系统,最常见的训练闭环可以浓缩成一句话:把输入表示成数字,用带参数的模型计算输出,再根据目标或反馈信号更新参数。这篇先把整张地图铺开,也说明这套闭环的适用边界。

01 · ORIENTATION

先把名词放回正确的层级

AI(Artificial Intelligence,人工智能)是大伞,机器学习是其中一条实现路线,深度学习又是机器学习的一部分。今天主流的大语言模型、扩散生成模型和视觉基础模型通常由深度网络实现;在工程语境里,RAG(Retrieval-Augmented Generation,检索增强生成)与 Agent 通常还会把模型同检索、工具、状态和控制逻辑组合成系统,而不只是一次模型前向。

AILearn 现代深度学习路线图:从输入与表示,经模型与计算、训练与评估、架构与生成机制,到系统与应用;下方给出零基础、模型工程和 AI Infra 三条重点阅读线
这是本站面向现代深度学习与生成式 AI 的阅读主线,不是所有 AI 方法的唯一前置顺序。三条路线表示重点和阅读顺序,不代表可以永久跳过未标出的知识。 查看原图 ↗

三个概念,别再混成一团

机器学习(Machine Learning)关注的是:不给出所有规则,能否从数据中学出预测或决策函数?线性回归、决策树、神经网络都是机器学习方法;搜索、规划和专家规则等 AI 路线则不一定属于机器学习。

深度学习(Deep Learning)把多个可学习变换组合成更深的计算或表示层级;“多深才算深”没有统一层数阈值。它的优势不是“像大脑”,而是能从大量数据中学习多层表示,并适合在 GPU(Graphics Processing Unit,图形处理器)上用张量运算高效训练。

生成式 AI(Generative AI)学习数据中的分布规律,以便按条件或无条件产生新样本。许多自回归语言模型预测下一个 Token(文本切分后的符号单元);扩散模型学习逆转加噪过程,常见预测目标包括噪声 ε、干净样本 x₀、score(带噪样本对数密度关于样本的梯度)或 v-parameterization(由信号与噪声组合的速度参数化)。这些都是训练目标,不等于模型拥有人的经历或理解。

白话先懂传统程序像“人写菜谱,机器照做”;机器学习像“给很多成品和评分,让机器把旋钮调出一份做法”;生成式 AI 则是学完后还能按你的条件做出一份新菜。它会组合规律,不等于拥有人的经历和理解。
02 · THE LOOP

训练与常规推理,关键差一条反馈回路

两者都能从输入计算输出。区别是:训练阶段有可计算的目标或反馈信号,并据此更新参数;常规部署推理只使用当前参数计算,不会自动更新权重。测试时自适应、在线学习等做法会另设更新流程,属于这里暂不展开的例外。

深度学习数据流和训练反馈图:原始数据变成数字表示,经带参数模型得到任务输出;训练时还根据目标或反馈构造损失,经反向传播和优化器更新模型
蓝色链路回答“当前参数怎样计算”,紫色回路回答“参数下一次怎样调整”。这是梯度训练的简化图;强化学习还要先把环境交互与奖励转成优化目标。 查看原图 ↗
先分清两种“循环”自回归生成会把新 Token 放回上下文,RAG 会检索证据,Agent 会执行工具并更新任务状态;这些都是推理或系统状态循环,不等于模型参数已经学习。判断是否发生参数学习,要看系统是否构造优化目标、计算更新并把新值写回参数。

四种常见信号来源,不是互斥又穷尽的分类

监督/无监督通常按是否有外部目标区分;自监督强调目标怎样从数据本身构造,常被放在广义无监督表示学习之下;强化学习强调环境交互与回报。同一个基础模型可以先自监督预训练,再用监督数据微调,最后用强化学习继续优化;半监督、模仿学习和在线学习还会组合这些轴。

监督学习 Supervised Learning
目标由数据集在输入之外提供,例如类别、成交价格、医学检测结果。标签可以由人标注,也可以由传感器、业务记录或规则生成。
无监督学习 Unsupervised Learning
没有逐样本外部目标,算法从输入分布中寻找结构,例如聚类、降维或密度建模。它仍然需要目标函数或统计假设;聚出的组也不保证对应人的语义类别。
自监督学习 Self-Supervised Learning
目标从原始数据本身构造,例如遮住一段再恢复、预测下一个 Token、给图像加噪再学习还原;省去的是逐条人工标注,不是数据治理。
强化学习 Reinforcement Learning
智能体与环境交互获得奖励,并优化一段时间内的期望回报(Return);它不一定有逐步固定答案,延迟奖励还需要做信用分配。
数据 Data
模型见过的例子。质量、覆盖面、重复和偏差都会进入模型;数据不是中性的燃料
参数 Parameters
训练要调的数字旋钮。在深度网络里,权重通常不是一条条可读规则,而是分布在多层计算中的数值;上下文、KV Cache(Key–Value Cache,键值缓存)或 Agent 状态则不等同于权重。
目标 Objective
告诉系统什么叫“更好”。自回归语言模型常用下一个 Token 的交叉熵;对齐阶段还会加入偏好或奖励信号。
泛化 Generalization
关注模型对未见样本的表现;它可能与训练数据记忆同时存在。验证集用于选择模型与调参,独立测试集用于在开发决策完成后估计表现;低训练损失本身不能证明泛化。
03 · HAND CALC

手算一遍:一条输入怎样推动一个参数

用只有一个参数的“迷你模型”预测外卖到达时间。它显然不够真实,但能把训练的骨架完整暴露出来。

模型:预测分钟数 ŷ = w × 距离

ONE PARAMETER · ONE SAMPLE
  1. 已知距离 x=3 公里,真实时间 y=12 分钟;先把参数设为 w=2
  2. 前向预测:ŷ = 2×3 = 6。模型低估了到达时间。
  3. 用平方误差 L=(ŷ−y)²,得到 (6−12)²=36
  4. 损失对参数的梯度是 2(ŷ−y)x = 2×(−6)×3 = −36。负号表示增加 w 能降低损失。
  5. 若学习率 η=0.01,更新为 w ← 2−0.01×(−36)=2.36。下一次预测为 7.08,损失降到 (7.08−12)²=24.2064
这个例子真正想说什么“学会”不是把正确答案塞进模型,而是把目标差距变成局部方向信号,推动参数移动。本例的步长确实让损失下降;梯度只描述当前位置的局部变化,学习率过大仍可能越过最优点。大型基础模型只要采用梯度训练,骨架仍是前向 → 目标 → 反向 → 更新。
04 · REAL MODELS

同一张地图,在真实模型里怎样落地

不要把数学底座理解成课堂前置题。下面三个代表性的深度模型都能用“数据表示—参数化计算—训练目标—优化”来解释,但具体运算与监督信号并不相同。

05 · MISCONCEPTIONS

四个最容易带偏后续学习的误区

“模型大,就一定更聪明”

规模会影响容量,但能力还取决于数据、训练预算、架构、后训练和评测口径。参数量不能单独代表质量。

“训练就是把资料存进去”

参数会吸收统计规律,也可能记住片段;但模型不是可精确检索的数据库。需要可追溯事实时,应使用能返回来源的搜索或 RAG,并核对引用是否真的支撑结论。

“推理时模型还在学习”

常规部署推理不会更新权重。上下文学习与工具结果会改变当前激活、上下文或任务状态,不等于做了一次参数训练;测试时训练或在线学习需要显式增加更新流程。

“训练损失低就成功了”

训练集上低损失可能与过拟合或记忆并存。还要看开发时的独立验证、最终测试、真实任务、安全、成本与延迟。

06 · SOURCES

一手资料与继续学习

  1. Deep Learning · Introduction(Goodfellow, Bengio, Courville) — AI、机器学习、表示学习与深度学习的层级及边界。
  2. Deep Learning · Machine Learning Basics — 监督/无监督学习、训练目标、泛化与训练/测试划分。
  3. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding — 从未标注文本构造掩码预测目标的自监督案例。
  4. Reinforcement Learning: An Introduction(Sutton & Barto,第二版) — 智能体、环境、奖励与回报的基础定义。
  5. Denoising Diffusion Probabilistic Models — 去噪扩散模型的训练与采样基础。
  6. Score-Based Generative Modeling through Stochastic Differential Equations — score 模型与扩散过程的统一视角。
  7. Progressive Distillation for Fast Sampling of Diffusion Models — 扩散模型 velocity 参数化与少步采样。
  8. Test-Time Training with Self-Supervision for Generalization under Distribution Shifts — 测试阶段显式更新参数这一例外机制。
  9. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — 参数记忆、非参数检索与可追溯知识边界。
  10. ReAct: Synergizing Reasoning and Acting in Language Models — 模型调用外部环境并更新任务轨迹的代表性 Agent 配方。
  11. Extracting Training Data from Large Language Models — 泛化与训练样本记忆可以并存的实证边界。
  12. Attention Is All You Need — Transformer 原始论文与架构来源。
  13. Language Models are Few-Shot Learners — GPT-3 的 175B 自回归模型,以及不更新梯度的文本内 few-shot(少样本)设置。
  14. Highly accurate protein structure prediction with AlphaFold — AlphaFold2 原始论文。

核查日期:2026-07-15。本文中的手算数值为教学构造;“四种信号来源”是教学坐标而非穷尽 taxonomy(分类法),真实模型事实均链接到原始论文或官方资料。