跳到正文
动手理解 · CONCEPT LAB

亲手走完一次参数更新闭环

在这个基础监督学习抽象中,训练先用当前参数做前向,再让同一次预测的目标在损失处汇入;反向传播用局部导数计算目标对参数的梯度,优化器最后才写回新参数。梯度是局部敏感度,不是因果责任。

已经发生 正在观察 接下来
01 / 03

一次 mini-batch 的训练循环

x 输入批次
当前参数前向
ŷ 产生预测
L(ŷ,t) 目标 t 汇入
θ 参数尚未改变

箭头表示这个基础监督抽象的教学顺序;t 绕过 fθ,在损失处才与 ŷ 汇合。底层算子可以并行,默认推理通常到前向/解码就结束。

观察点 01

在基础监督抽象中,t 不泄漏给同一次预测

模型 fθ 用当前参数把输入 x 变成预测 ŷ;现代网络的层还可能包含注意力、归一化与残差,并非每层都只是一个标量神经元。在这张基础监督学习图里,目标 t 在 L(ŷ,t,…) 处参与目标计算,不作为同一次预测的答案输入。自监督语言模型可从同一序列构造移位输入与目标,但仍要避免把待预测 Token 直接泄漏给对应位置。

模型输出已产生有预测
参数发生变化还没有
此刻要记住

前向只读取当前参数并产生输出,不会自动把参数变好。

基础 · 神经网络 / Neural Network

神经网络:把简单变换组合成可训练函数

今天主流的大语言模型(Large Language Model,LLM)通常是以 Transformer 为骨架的神经网络(Neural Network)。它不是一堆生物神经元的复制品,而是把可学习的张量变换、非线性与无参数操作组成程序,再用数据和目标调整其中的参数。这篇从一个标量单元走到现代网络、训练闭环和规模证据。

01 · 是什么

不是免写程序,而是把部分规则交给数据与目标

神经网络本身仍是程序:人会规定输入表示、网络连接、训练数据、目标函数与优化流程;训练算法则从这些约束中调出参数。规则系统与学习模块也可以共存,不是非此即彼。下方「图片→是不是猫」是易懂的监督学习例子;大语言模型预训练通常从文本自身构造「预测下一个 Token(词元)」等自监督学习目标,而不是由人逐条写答案。人工神经网络受神经科学启发,但不是大脑仿真。

手写规则分类器
可以写「尖耳朵 + 胡须 + 四条腿…」这样的判定规则;规则透明,但很难穷举姿态、遮挡、光照与相似动物。它只是程序的一种,不代表所有非神经网络方法。
训练出的分类器
用「图 + 标签」优化参数,让网络从训练集拟合可复用模式;再用未参与训练或调参、且来自目标分布的数据检验泛化。数据偏差不会因为使用神经网络而自动消失。
📰 它有多厉害
2024 年诺贝尔奖给出了两个直接案例:物理学奖授予 John Hopfield 与 Geoffrey Hinton,表彰「使人工神经网络机器学习成为可能的奠基性发现和发明」;化学奖的一半授予 Demis Hassabis 与 John Jumper,表彰蛋白质结构预测(另一半授予 David Baker,表彰计算蛋白质设计)。诺奖官方资料称,AlphaFold2 当时已预测几乎全部约 2 亿种已知蛋白质的结构;截至 2024 年 10 月,有来自 190 个国家的 200 多万人使用。这里的口径是计算预测,不代表约 2 亿个结构都已逐一获得实验确认。
02 · 最小单元

一个神经元在算什么

在最基础的 Multilayer Perceptron(MLP,多层感知机)里,一层可以看成许多标量单元并行:输入按权重求和,加偏置,再经过非线性。这是理解矩阵层的入口,不是所有现代网络组件的逐字架构说明。

x₁ x₂ x₃ ×w₁ ×w₂ ×w₃ Σ+b 激活 fReLU… y
从左到右读:每个输入先乘自己的权重,随后求和、加偏置,再经过激活函数得到输出。这是 MLP 标量单元的教学抽象,不代表现代网络的每一层都由同一种「神经元」机械堆叠。
y=f ⁣(iwixi+b)y=f\!\left(\sum_{i} w_i x_i + b\right)

x_i 是输入、w_i 是训练学到的有符号权重b偏置f激活函数。在其他输入不变时,w_i x_i该单元、该次前向的激活前加权和中的一项;经过非线性和后续层后,单个权重的正负或大小不自动等于跨层、跨样本的全局重要性,更不是因果效应。

h(+1)=ϕ ⁣(W()h()+b())\mathbf h^{(\ell+1)}=\phi\!\left(W^{(\ell)}\mathbf h^{(\ell)}+\mathbf b^{(\ell)}\right)

把许多标量单元并行,就得到向量层:若输入维度为 d_in、输出维度为 d_out,则权重矩阵 W 的形状为 [d_out, d_in],偏置 b 的形状为 [d_out];批处理还会增加 Batch 轴。现代网络还包含卷积、注意力、归一化、残差连接、路由与池化等操作,并非每个组件都适合叫作一个「神经元」。
📰 原始 Kimi K2 在 2025 年官方报告中按整数口径披露 1 万亿总参数 / 每 Token 激活 320 亿。Meta 在 2025 年 4 月只预览了 Llama 4 Behemoth 的近 2 万亿 / 2880 亿口径;截至 2026-07-15,Meta 官方仓库列出的 Llama 4 可下载项仍只有 Scout 与 Maverick,因此这里不把 Behemoth 写成已公开权重。

算一个具体神经元
假设风控教学模型只看两个归一化输入:x₁=0.8(收入稳定度)、x₂=0.5(逾期风险),权重分别是 1.2−1.5,偏置 −0.1。加权和为 1.2×0.8−1.5×0.5−0.1=0.11,过 ReLU(Rectified Linear Unit,修正线性单元)后仍是 0.11。在这个人为设定且其他输入固定的算式里,正项推高分数、负项拉低分数;真实风控不能只靠两个变量,也不能把系数符号直接解释成因果关系。
Weight 权重 训练学到的有符号系数,形成激活前输入项 wᵢxᵢ Bias 偏置 一个可学习的基准偏移 Activation Function 激活函数 常用于引入非线性(见第 04 节)
03 · 怎么学

网络是怎么「学」的:前向 → 损失 → 反向 → 更新

「学」不是什么玄乎的事——就是用数据反复调整可训练参数,让选定的训练目标总体下降。常见的可微神经网络训练有四个职责:前向得到输出 → 聚合通常为标量的目标 → 反向传播算参数梯度 → 优化器更新参数。监督目标可来自人工标签,自监督目标可从数据本身构造;梯度累积或分布式训练会把多次/多卡贡献合并后再更新,不必严格「一批一改」。

🏔️ 先建直觉:蒙着眼下山
把每个可训练标量看成一个坐标,损失看成地形高度。对最基础的梯度下降,当前位置的负梯度是欧氏距离下的局部最陡下降方向,学习率控制更新尺度。这个类比只描述局部一阶信息:有限步不保证到全局最低点,Adam(Adaptive Moment Estimation,自适应矩估计)使用梯度的一阶矩和逐元素平方的未中心化二阶原始矩做动量与自适应缩放,并没有使用 Hessian;AdamW(带解耦权重衰减的 Adam)还另行衰减参数,所以实际更新不必与当前负梯度平行。

训练循环:基础监督学习抽象 (蓝色=前向数据;紫色=反向梯度;橙色=参数更新与下一批)

三条链路分开看:在这个基础监督学习抽象中,同一次预测的目标 t 不作为答案输入模型;Backprop 用局部导数/VJP 计算训练目标对参数的梯度,Optimizer 结合内部状态改参数,Next batch 控制下一次迭代。自监督语言模型可从同一序列构造移位输入与目标,但因果掩码会阻止每个位置直接看到待预测 Token。图中还按「一批一更新」简化;梯度累积会先合并多个 micro-batch(微批次)的贡献,再执行一次 optimizer step(优化器更新)。

三个关键词

  • Loss Function(损失函数):把预测、目标以及可选的正则项/辅助项汇总成要最小化的标量;它不总等于「与人工标准答案的差」
  • Backpropagation(反向传播):沿计算图使用局部导数/VJP 与链式法则,得到训练目标对参数的梯度——只负责「算」,优化器才负责「改」。Reverse-Mode Automatic Differentiation(反向模式自动微分)在 1970 年已有一般描述;Rumelhart、Hinton 与 Williams 1986 年的 Nature 论文推动了多层神经网络训练方法的普及
  • Optimizer(优化器):把梯度和内部状态变成参数更新。Gradient Descent(梯度下降)是最基础规则;现代大模型常用 Adam/AdamW,并按 mini-batch(小批量)估计梯度
θ    θ    ηθL\theta \;\leftarrow\; \theta \;-\; \eta\,\nabla_\theta \mathcal{L}

θ 是模型参数、∇L 是当前位置的梯度、η 是学习率。公式是基础梯度下降,不是 Adam/AdamW 的完整更新式;后者会结合历史梯度和逐坐标缩放。
DeepSeek-V3 报告的训练账为 278.8 万 H800 GPU(Graphics Processing Unit,图形处理器)小时:预训练 266.4 万 + 上下文扩展 11.9 万 + 后训练 0.5 万 = 278.8 万。它只统计报告所列训练阶段,不含全部研究、消融、数据处理与基础设施投入。

跟着一个例子走一遍(网络判断「这张图是不是猫」)

① 前向:先得到模型分数给网络一张猫图,假定末层 Sigmoid(S 形函数)输出 p=0.7。它是模型给「猫」的预测概率;除非另做 Calibration(概率校准)验证,不能把它直接读成「模型有 70% 把握且长期恰好 70% 正确」。训练目标为 y=1
② 损失:同一输出可对应不同目标若教学例子用平方误差,L=(1−0.7)²=0.09,且 ∂L/∂p=−0.6;若用更常见的二元交叉熵,则 L=−ln(0.7)≈0.357,对 Sigmoid 前 logit 的梯度为 p−y=−0.3。损失值、求导变量和梯度不能跨配方混用。
③ 反向:算局部敏感度反向传播给每个权重求 ∂L/∂w:权重发生很小变化时,损失在当前位置怎样变化。梯度是局部敏感度,不是因果意义上的「谁背锅」;优化器再决定怎样把这些梯度变成更新。
④ 更新:按规则走一步基础梯度下降用 −η∇L 更新;在目标足够光滑、步长足够小时,一阶近似预示这个 mini-batch 的目标会下降。但真实训练使用有限步、随机批次和带状态优化器,不保证每一步都让这张猫图从 0.7 变成更接近 1,关注的是多次更新后的总体目标与验证集表现。

把这四步放进大量 mini-batch 中,经过许多优化器更新,权重就被一点点调成能完成任务的数值。关键:人仍会设计架构、数据、损失与训练流程,但不会逐条手写「看到什么像素就判成猫」的规则。

Loss Function 损失函数 定义要最小化的训练目标 Backpropagation 反向传播 算梯度的算法 Optimizer 优化器 用梯度与状态产生参数更新 Learning Rate 学习率 η 更新尺度;过大或过小都可能妨碍训练
训练不等于推理
默认推理只做前向计算,并在生成任务中维护解码状态;没有训练目标、反向传播或优化器写回。测试时训练、在线学习等方法是需要显式设计的例外。框架里的 model.eval() 也只切换部分模块行为,不自动关闭 Autograd;完整边界见 梯度与自动微分专题
04 · 关键概念

几个绕不开的概念

激活函数与非线性 Activation

如果各层都只有仿射变换、没有任何非线性运算,多层复合仍可合并成一次仿射变换。ReLU(Rectified Linear Unit,修正线性单元)GELU(Gaussian Error Linear Unit,高斯误差线性单元)是逐元素非线性;SwiGLU(Swish-Gated Linear Unit,Swish 门控线性单元)则是带两条输入投影和逐元素乘法的门控前馈结构,不应缩写成一个标量激活。

为什么要「深」 Depth

多层能反复组合变换,常可更高效地表示层级结构;视觉卷积网络中,早期层响应边缘/纹理、后续层组合更复杂模式是经典观察,但不是每个单元都有稳定可命名概念。更深也更难优化,Residual Connection(残差连接)等设计能改善梯度与优化路径;增加层数本身不保证效果。

过拟合 vs 欠拟合 Overfitting / Underfitting

Overfitting(过拟合)常表现为训练目标继续改善,而来自同一目标分布的验证表现变差;它可能包含记忆,但不能简单等同于「死记」。Underfitting(欠拟合)则连训练数据中的可学模式都没拟合好。验证集若被反复调参也会被间接拟合,因此最终结论还需要未参与选择的测试集或线上回放。

缓解风险:更有代表性的数据、合适的 Regularization(正则化)、Dropout(随机丢弃)、Early Stopping(早停)等;没有哪一项单独保证泛化。

参数 vs 超参数 Params vs Hyperparams

Parameter(参数)是模型状态中参与计算的数值;其中可训练参数由当前优化器更新,冻结参数则不更新。Hyperparameter(超参数)控制架构或训练配方,例如学习率、层数和批大小,不由当前内层训练循环直接更新;它仍可由搜索、外层优化或实验自动选择。两者角色取决于所讨论的优化层级。

04.5 · 架构与生成机制

不止一种:怎样组织计算,怎样定义生成

多层感知机、卷积神经网络、循环神经网络、Transformer、图神经网络主要描述网络怎样组织连接与信息流;Diffusion(扩散)主要描述一种生成/训练机制,内部骨干还可以是 U-Net、Transformer 等。把两层分类混在一起,会误以为「扩散」和「Transformer」只能二选一。

家族 / 机制核心结构或过程常见场景 · 代表
MLPMultilayer Perceptron,多层感知机相邻层通常全连接,逐层做仿射变换与非线性表格/向量数据,以及其他架构中的前馈子网络
CNNConvolutional Neural Network,卷积神经网络共享卷积核在局部窗口上计算图像、音频:AlexNet、ResNet
RNN / LSTMRecurrent Neural Network / Long Short-Term Memory按序递推隐藏状态,LSTM 用门控缓解长期依赖问题流式、时序与部分序列任务;前沿大语言模型目前以 Transformer 为主,但循环/状态模型并未消失
Transformer以自注意力在掩码允许的位置间聚合信息,并配合逐位置前馈、残差与归一化;因果解码器不能读取未来 Token语言、视觉与多模态:BERT、GPT、ViT
扩散模型Diffusion Model,生成机制以 DDPM 为例,定义逐步加噪的前向过程并学习反向去噪/score;骨干可用 U-Net 或 Diffusion Transformer(扩散 Transformer,DiT)图像、视频、音频等生成:DDPM、Stable Diffusion、DiT;它是生成与训练框架,不是唯一网络连接方式
GNNGraph Neural Network,图神经网络常见 Message Passing Neural Network(MPNN,消息传递神经网络)沿节点与边聚合消息;GNN 范围比 MPNN 更广分子、知识图谱、推荐与关系数据
为什么 Transformer 成为大规模语言模型主流
① 训练时,同一层里各序列位置可并行计算,而 RNN 隐藏状态有逐步依赖;但自回归生成新 Token仍有跨步依赖。② 在全注意力且掩码允许时,两位置间路径很短;因果模型不能看未来,滑窗/稀疏注意力也会限制范围。③ 大量矩阵乘法适配现有加速器与软件栈。标准稠密注意力的 score/加权求和计算随长度 T 约为 O(T²d);实现可用分块减少显存读写,但不会把这项算术自动变成线性。Mamba / SSM(State Space Model,状态空间模型)探索线性序列扩展;原始 Mamba 论文报告的约 推理吞吐只属于其模型、基线与硬件设置。另一条正交路线是 MoE 混合专家:它稀疏激活前馈专家,相对同总参数的稠密层减少部分每 Token 计算,却不会自动消除注意力的二次项
04.6 · 规模法则

规模法则:能预测什么,不能预测什么

Scaling Laws(规模法则)是在特定模型族、数据分布和训练配方范围内观察到的经验关系:验证集交叉熵等指标常随参数、数据或算力近似按幂律改善。它能帮助估算资源与 loss,不能证明「参数更大就一定在每项能力上更强」,也不能仅凭 loss 精确预言产品表现。

Kaplan 2020 局部经验规律

论文在其 Transformer 语言模型实验范围内观察到:交叉熵 loss 随非嵌入参数量、数据量与训练计算量呈平滑幂律,部分趋势跨越七个数量级,前提是其他因素没有成为瓶颈。它不是对所有架构、数据和下游能力的定理。

Chinchilla 2022 固定算力怎样分

DeepMind 训练了 400 多个模型,覆盖 70M–16B 参数、5B–500B Token;其拟合表明在给定算力下,参数量和训练 Token 数应近似同比增长。70B Chinchilla 用约 1.4T Token,即 1.4T÷70B=20 Token/参数,并在与 280B Gopher 相同的训练算力下使用约 数据取得更好结果;「20」是该配方的概括,不是通用常数。

推理时计算 2024+ 另一条尺度轴

Test-time Scaling(推理时扩展)把更多计算放到答题阶段。OpenAI 在 2024 年 9 月的 o1 报告中给出的 AIME(American Invitational Mathematics Examination,美国数学邀请赛)2024 口径是:GPT-4o 单样本平均约 12%,o1 单样本约 74%;每题 64 个样本共识约 83%,用学习到的评分函数对 1000 个样本重排序约 93%。这是一组历史厂商评测,不是 2026 年当前榜单;采样与筛选预算不同,数字不能当成同成本能力。

📰 2024–2025 预测:不是一道统一的「数据墙」
Epoch AI 2024 年研究估计,经过质量与重复训练调整的公开人类文本有效存量约 300 万亿 Token,90% 区间为 100 万亿–1000 万亿;在其趋势模型中,充分利用这部分存量的时间有 80% 落在 2026–2032 年。其 2025 年 9 月《AI in 2030》报告进一步称,公开人类文本至少可支撑扩展到 2027,合成数据在推理训练中的有效性证据也比过去更强,但仍不能完全排除数据瓶颈。后者由 Google DeepMind 委托、结论属于作者;两份材料都是带假设的预测,不是对全球数据的精确盘点,也不证明数据无限或 scaling 永远有效。
现实路线会同时优化数据质量/配比、模型与系统效率、后训练和推理时计算;每条路线都有成本、任务范围与证据边界。
资料来源

核查口径与原始资料

核查日期:2026-07-15。神经元、两种损失梯度、DeepSeek 训练小时加总与 Chinchilla Token/参数比均已独立复算;模型规模绑定到原始报告、预览或当前官方仓库,历史厂商评测不代表当前榜单。Epoch 2025 报告由 Google DeepMind 委托,页面只引用作者带条件的预测,不把它当确定事实。

速查表

一张表回顾 神经网络

问题答案
核心思想人定义数据、架构与训练目标,优化算法据此学习参数,而不是逐条手写判定规则
标量神经元与向量层标量单元是 y=f(Σ wᵢxᵢ+b);一层用矩阵并行计算,现代网络还含注意力、归一化、残差等操作
权重是什么训练学到的有符号系数,参与局部加权和;不自动等于全局特征重要性或因果效应
怎么学前向得到预测 → 损失汇总训练目标 → 反向传播算梯度 → 优化器更新参数
反向传播/优化器反向传播用局部导数算目标对参数的梯度;优化器才结合梯度、状态和超参数生成更新
训练 vs 推理训练通常有目标、反向与参数写回;默认推理只做前向/解码,测试时学习属于显式例外
激活函数为何重要非线性或门控让多层不坍缩为一次仿射变换;ReLU/GELU 是逐元素激活,SwiGLU 是门控前馈结构
过拟合训练表现好而验证泛化明显变差;正则化、代表性数据与早停等只能降低风险
架构与生成机制Transformer/CNN 等描述信息流;Diffusion 描述生成机制,可用 U-Net 或 Transformer 作骨干
和大模型关系主流 LLM 通常是以 Transformer 为骨架的大规模神经网络;能力不由参数量单独决定
规模法则是特定模型族、数据和配方下的经验拟合,用来估算 Loss/资源,不是每项能力随规模必涨的定理