001 模型在训练中学到并长期保存的数字;推理时主要读取它们,不再自动改变。
002 决定一条输入信号影响有多大的可学习参数。
003 在线性变换结果上额外加的可学习常数,让输出不必经过原点。
004 带形状的多维数字容器;标量、向量和矩阵都可以看成张量。
005 一串有顺序的数字,常用来表示一个 token、句子或特征。
006 按行列排布的二维数字表,也是神经网络大多数计算和参数的基本形态。
007 向量包含多少个数;也常指张量某一条轴的长度。
008 矩阵乘法
Matrix MultiplicationMatMul
让一批输入按权重重新组合,是神经网络最主要的计算。
009 模型送入 Softmax 前给每个候选项的原始分数,不是概率。
010 把一组任意实数变成总和为 1 的概率;先减最大 logit 可避免指数溢出且不改变结果。
p_i = exp(z_i - max(z)) / Σ_j exp(z_j - max(z)) 边界:它只归一化相对分数,不会自动让概率校准或事实正确。
011 概率分布
Probability Distribution
描述多个可能结果各自有多大概率,所有概率加起来为 1。
012 把预测和目标的差距压成一个可优化数字;越小通常表示当前目标上做得越好。
013 用目标分布给模型分布打分;分类目标为 one-hot 时,就是正确类别负对数概率。
H(q,p) = -Σ_i q_i log p_i 边界:不同 Token 数、mask 和归约方式会改变 loss 口径,不能只比较一个裸数。
014 KL 散度
Kullback–Leibler DivergenceKL
衡量两个概率分布差多远;对齐训练常用它限制新模型别偏离参考模型太多。
015 告诉优化器每个参数往哪个方向改变,损失在局部下降得最快。
016 反向传播
BackpropagationBackprop
从损失出发沿计算图倒着应用链式法则,为每个参数算梯度。
017 自动微分
Automatic DifferentiationAutodiff
框架记录计算关系后自动算梯度,避免人工推导每一层。
018 模型处理当前输入时临时产生的中间数据,不等于激活函数。
019 给线性计算加入非线性,否则很多层叠起来仍等价于一次线性变换。
020 控制每次参数更新迈多大一步;太大可能震荡,太小则学得慢。
021 一次并行送进模型的一组样本;更大批次通常更稳,但占用更多显存。
022 让训练过程完整看过一遍训练集;大模型预训练更常用 token 数衡量进度。
023 模型把训练样本记得太细,训练集表现好但新数据表现变差。
024 模型把学到的规律迁移到没见过的数据和任务上的能力。
025 模型处理文字的基本离散单位,可能是字、子词、标点或字节片段。
026 按固定规则把文字切成 token ID,也负责把 ID 解码回文字。
027 模型认识的全部 token 及其编号集合。
028 字节对编码
Byte Pair EncodingBPE
从小单位出发,反复合并常见相邻片段来学习子词词表。
029 用一个连续向量表示离散对象,使模型能用矩阵计算处理它。
030 某个 token 穿过模型当前层后形成的上下文化向量。
031 用注意力做跨位置取信息、用 FFN 做位置内加工的主流神经网络骨架。
032 用 Query 与 Key 的相似度决定从各 Value 读取多少信息。
Attention(Q,K,V) = softmax(QKᵀ / √d_k)V 边界:Mask、位置机制、KV 共享和稀疏范围都会改变可见性与系统成本。
033 Q、K、V 都来自同一序列的注意力,负责序列内部的信息交换。
034 Q 来自一组表示,K/V 来自另一组表示,常用于跨模态或编码器—解码器连接。
035 表达当前位置“想找什么”的向量。
036 表达一个位置“能被怎样找到”的向量,和 Query 比较得到相关性。
037 注意力真正按权重汇总回来的内容向量。
038 在较小子空间里独立计算一次注意力,多头可并行寻找不同关系。
039 多头注意力
Multi-Head AttentionMHA
每个查询头都有自己的 K/V 头,表达力强但 KV Cache 较大。
040 多查询注意力
Multi-Query AttentionMQA
多个 Query 头共享一组 K/V,大幅缩小缓存但共享更激进。
041 分组查询注意力
Grouped-Query AttentionGQA
若干 Query 头共享一组 K/V,在质量和 KV Cache 大小之间折中。
042 多头潜在注意力
Multi-head Latent AttentionMLA
先把 K/V 压到低维潜变量保存,使用时再恢复所需信息,以减少缓存。
043 阻止当前位置看到未来 token,保证自回归模型不能偷看答案。
044 前馈网络
Feed-Forward NetworkFFN
在每个 token 位置独立做通道扩张、非线性门控和压缩。
045 把子层输出加回原输入,为信息和梯度提供直接通道。
046 层归一化
Layer NormalizationLayerNorm
按单个样本的特征维做归一化,帮助深层网络稳定训练。
047 均方根归一化
Root Mean Square NormalizationRMSNorm
省去均值中心化、按均方根缩放的轻量归一化。
048 旋转位置编码
Rotary Position EmbeddingRoPE
按位置旋转 Q/K,让它们的内积自然携带相对距离信息。
049 模型一次请求能接收并处理的 token 总范围,通常包含输入和输出。
050 让模型处理更长序列的整套能力,不只取决于位置编码,还涉及训练与评测。
051 混合专家
Mixture of ExpertsMoE
每个 token 只激活部分专家网络,用较小计算量调用更大的总参数容量。
052 为每个 token 计算专家分数并选择要激活哪些专家。
053 MoE 中可被路由选择的 FFN 子网络;专家不一定对应人能命名的领域。
054 模型总参数很多,但一次前向只使用其中一小部分。
055 避免太多 token 挤到少数专家,造成容量溢出和设备等待。
056 状态空间模型
State Space ModelSSM
把历史递推压进固定形状状态,避免保留每个位置的完整 K/V。
057 通过核分解、递推状态等方式避免显式构造完整的 N×N 注意力矩阵。
058 在同一模型交错使用全注意力、线性注意力或 SSM,让不同机制分工。
059 自回归生成
Autoregressive GenerationAR
每次根据已有序列预测下一个 token,再把新 token 追加回去继续。
060 用海量通用数据先学习预测目标,获得语言、知识和基础能力。
061 训练中定期保存的模型权重、优化器状态和进度快照,可用于恢复或发布。
062 监督微调
Supervised Fine-TuningSFT
用成对的指令和理想回答继续训练,让模型学会任务格式与行为。
063 用多任务指令数据训练模型理解并遵循自然语言要求,通常属于 SFT。
064 低秩适配
Low-Rank AdaptationLoRA
冻结原权重,只训练低秩增量矩阵,让较少可训练参数改变线性层行为。
W′ = W + (α/r)BA 边界:它主要节省梯度和优化器状态;基座权重、激活与 KV 仍占资源。
065 量化低秩适配
Quantized LoRAQLoRA
把冻结的基座权重量化,再训练 LoRA 适配器,进一步降低微调显存。
066 人类反馈强化学习
Reinforcement Learning from Human FeedbackRLHF
用人类偏好训练奖励信号,再通过强化学习优化模型行为。
067 根据偏好数据学习给回答打分,为 RLHF 提供可优化的奖励。
068 同一问题下对多个回答的选择、排序或评分,用来学习人类更喜欢什么。
069 直接偏好优化
Direct Preference OptimizationDPO
直接用偏好对让 chosen 相对 reference 更可能、rejected 更不可能,不显式训练独立奖励模型。
边界:仍依赖偏好数据、参考策略与超参数;离线目标不能替代线上安全和回归评测。
070 近端策略优化
Proximal Policy OptimizationPPO
限制每次策略更新幅度的在线强化学习算法,经典 RLHF 常用。
071 组相对策略优化
Group Relative Policy OptimizationGRPO
对同一问题采样一组回答,用组内相对奖励构造优势,常省去价值模型。
072 强化学习中根据当前状态选择下一个动作的规则;语言模型策略就是下一个 token 分布。
073 智能体从开始到结束的一连串观察、思考、动作和环境反馈。
074 最终成败出现后,判断长轨迹中哪些早期动作应负多少责任。
075 知识蒸馏
Knowledge Distillation
让学生模型模仿教师模型的分布、回答或推理过程来迁移能力。
076 读取梯度与历史状态,决定参数实际更新方向和步长的算法。
077 AdamW 优化器
Adam with Decoupled Weight DecayAdamW
使用梯度一阶与二阶动量,并把权重衰减与梯度更新解耦。
078 当梯度过大时限制其范数,降低一步更新把训练推崩的风险。
079 每张卡放完整模型、处理不同样本,再同步梯度。
080 张量并行
Tensor ParallelismTP
把同一层的大矩阵切到多张卡共同计算,需要频繁集体通信。
081 流水线并行
Pipeline ParallelismPP
把不同层放到不同设备,微批次像流水线一样依次通过。
082 专家并行
Expert ParallelismEP
把 MoE 专家分布到不同设备,token 经 All-to-All 发往被选专家。
083 零冗余优化器
Zero Redundancy OptimizerZeRO
在数据并行设备间分片优化器状态、梯度和参数,减少重复显存。
084 全分片数据并行
Fully Sharded Data ParallelFSDP
按需聚合和释放参数分片,让每张卡不必长期保存完整模型状态。
085 让所有设备聚合一组张量并各自拿到结果,常用于同步梯度。
086 每个设备都向其他设备发送不同数据,专家并行路由最常见。
087 高带宽显存
High Bandwidth MemoryHBM
GPU 旁容量较大、带宽很高的主显存,用来存权重、缓存和激活。
088 片上静态存储
Static Random-Access MemorySRAM
GPU 芯片上容量小但速度更快的缓存或共享内存,适合暂存 tile。
089 计算核心最近、最快但容量最小的存储,保存正在计算的值。
090 GPU 中专门加速低精度矩阵乘加的计算单元。
091 单位时间能在显存和芯片之间搬多少数据,常决定 decode 速度上限。
092 浮点运算次数
Floating-Point OperationsFLOPs
描述执行了多少浮点计算;硬件峰值速度常写 FLOPS。
093 算术强度
Arithmetic IntensityAI
每从主存搬一个字节,完成多少次计算;用来判断 workload 更可能受算力还是带宽限制。
AI = FLOPs / bytes moved 边界:必须使用真实数据流量和有效硬件峰值;理想只读一次的估算通常高估实际 AI。
094 计算单元等数据的时间比真正计算更长,增加算力也不一定更快。
095 数据供应足够快,主要时间花在计算上,此时更强算力更有价值。
096 一次并行处理整段输入并建立 KV Cache,通常矩阵较大、计算利用率较高。
097 自回归地逐个生成新 token;每步计算窄,却要读取大量权重和历史缓存。
098 KV 缓存
Key-Value CacheKV Cache
保存历史 Token 在各层产生的 Key/Value,使 Decode 不必每一步重算整个前缀。
bytes ≈ 2 × layers × kv_heads × head_dim × tokens × bytes_per_element 边界:MLA、滑动窗口、KV 量化、分页、并行切分和 allocator 会改变实际占用。
099 像虚拟内存一样用固定大小块管理 KV Cache,减少碎片并支持动态请求。
100 复用多个请求相同前缀已计算的 KV Cache,省掉重复 prefill。
101 连续批处理
Continuous Batching
请求完成后立即把新请求补进运行批次,不等整批同时结束。
102 FlashAttention
FlashAttentionFA
通过 tiling 与在线 Softmax 减少 HBM 读写的精确注意力算法。
103 把大矩阵切成能放进片上存储的小块,分批加载、计算和复用。
104 在 GPU 等加速器上并行执行的一段底层程序,是算子真正落地的实现。
105 用更少比特表示权重或激活,换取更低显存、带宽与计算成本。
106 用一小批代表数据确定数值范围和缩放因子,减少低比特误差。
107 投机解码
Speculative Decoding
草稿模型先猜多个 token,目标模型一次验证,减少串行 decode 轮次。
108 首 Token 延迟
Time to First TokenTTFT
从请求发出到收到第一个输出 Token 的墙钟时间,包含网络、排队、Tokenize、Prefill 与流式 flush。
边界:不同客户端和服务端边界会改变口径;必须同时记录输入长度与并发。
109 每输出 Token 时间
Time per Output TokenTPOT
首 Token 之后,每产生一个输出 Token 的平均时间,用来描述稳定生成节奏。
TPOT ≈ (E2E - TTFT) / (output_tokens - 1) 边界:平均 TPOT 会隐藏 inter-token latency 抖动;流式 chunk 不一定等于 Token。
110 相邻 Token 延迟
Inter-token LatencyITL
相邻两个输出 token 的到达间隔;保留间隔分布可观察流式输出抖动与尾延迟。
111 单位时间系统完成的请求数或处理的 input/output/total token 数;必须写清分子,并和延迟一起看。
112 单位时间内同时满足既定 TTFT、TPOT/ITL 等 SLO 的请求数,而不是全部完成请求数。
113 服务级目标
Service Level ObjectiveSLO
系统承诺达到的延迟、可用性或质量目标及其分位数口径。
114 检索增强生成
Retrieval-Augmented GenerationRAG
回答前检索外部资料,把候选证据放入上下文,再让生成模型基于证据回答。
边界:检索命中、答案忠实度与引用正确性是不同层,必须分开评测。
115 把长文档拆成可索引片段;块太小缺上下文,太大则噪声和成本上升。
116 向量数据库
Vector DatabaseVector DB
存储 embedding 并高效做近似最近邻检索的系统。
117 同时使用关键词和向量检索,再融合结果,兼顾精确词项与语义相似。
118 对第一阶段召回的少量候选做更精细相关性打分并重新排序。
119 查询和文档分别编码成可预计算向量,用相似度高速召回大量候选。
120 把查询和候选一起送入 Transformer 做细粒度交互,通常更准但只能重排较少候选。
121 先独立编码查询和文档的多个 token 向量,检索时再做细粒度相似度聚合。
122 对比学习
Contrastive Learning
把匹配样本在表示空间拉近、非匹配样本推远,用来训练检索或跨模态表示。
123 看起来很像正确答案却被标为错误的候选,能训练细粒度区分,也可能因误标伤害模型。
124 近似最近邻检索
Approximate Nearest NeighborANN
用可控的召回损失换更低搜索时间和内存,使大规模向量库可查询。
125 分层可导航小世界图
Hierarchical Navigable Small WorldHNSW
把向量连成多层近邻图,从稀疏高层快速走向底层精细邻居。
126 乘积量化
Product QuantizationPQ
把向量分成子空间并用短码本编号近似表示,减少索引内存与距离计算。
127 围绕目标循环观察、规划、调用工具并根据结果继续行动的 AI 系统。
128 模型按约定结构选择工具和参数,外部程序执行后再把结果交回模型。
129 推理—行动循环
Reason + ActReAct
让模型交替产生思考或计划、执行动作、读取观察,再决定下一步。
130 同一个操作重复执行多次,最终效果仍和执行一次相同,能降低重试副作用。
131 在输入、工具权限、输出和执行结果上增加规则或模型检查,限制危险行为。
132 模型上下文协议
Model Context ProtocolMCP
让 AI 应用用统一方式发现和调用工具、资源与提示的开放协议。
133 由应用提供的高优先级行为说明,用来定义角色、边界和输出约束。
134 在提示中放少量输入输出例子,让模型模仿任务模式。
135 要求模型按 JSON Schema 等机器可解析契约返回结果。
136 中间填充训练
Fill-in-the-MiddleFIM
把代码中间片段遮住,让模型同时根据前缀与后缀补全,适合局部编辑。
137 用真实开源仓库 issue 和隐藏测试评测代码 Agent 修复能力的基准家族。
138 在应用代码改动前检查差异范围、测试证据、安全影响与可回滚性。
139 把像素或图像 patch 变成视觉特征序列,常见主干是 ViT。
140 把图片切成固定小区域并映射成向量,是 ViT 的基本输入单位。
141 模态连接器
Multimodal Connector
把视觉或音频特征映射、压缩成语言主干能读取的表示。
142 按短时间窗拆出频率能量,并用接近人耳感知的 Mel 频轴压缩,常作为语音识别输入。
143 神经音频编解码器
Neural Audio CodecCodec
把波形压成较低帧率的离散编号,并能从编号重建声音,方便生成模型逐帧预测。
144 自动语音识别
Automatic Speech RecognitionASR
把声音转成文字;它主要保留说了什么,不保证保留音色、重音和环境声。
145 把文字合成为可播放语音,需要同时控制可懂度、自然度、音色和首包延迟。
146 语音到语音
Speech-to-SpeechS2S
直接以语音为输入和输出,尽量保留语气、韵律与非语言线索。
147 语音活动检测
Voice Activity DetectionVAD
判断音频片段里是否有人声,帮助系统决定何时开始、结束或继续监听。
148 助手播报时检测用户重新开口,停止旧输出并根据新输入重规划。
149 根据当前观察、状态和候选动作预测未来变化,为规划与控制提供可试演的环境模型。
150 视觉—语言—动作模型
Vision-Language-Action ModelVLA
把图像或传感器观察与语言目标映射成机器人可执行的动作序列。
151 把连续控制量或离散动作编码成模型可预测的序列单位。
152 仿真到现实
Simulation-to-RealSim-to-Real
先在仿真中训练或验证策略,再处理物理差异并迁移到真实设备。
153 查询 Transformer
Querying TransformerQ-Former
用少量可学习 Query 从视觉特征里抽取并压缩信息的连接器。
154 视觉语言模型
Vision-Language ModelVLM
能共同处理图像与文字并用语言完成理解或生成任务的模型。
155 训练模型逐步去除噪声,从随机噪声还原出图片、视频或音频。
156 根据当前含噪样本和条件预测如何向更干净的数据移动。
157 变分自编码器
Variational AutoencoderVAE
把高维像素压到潜空间并可解码回来,让生成过程在更小表示上运行。
158 扩散 Transformer
Diffusion TransformerDiT
用 Transformer 取代传统 U-Net 作为扩散或流模型的去噪主干。
159 学习把噪声连续运输到数据分布的速度场,采样时求解这条流。
160 无分类器引导
Classifier-Free GuidanceCFG
组合有条件和无条件预测来加强文本控制,过强可能损伤自然度。
161 用固定数据集、任务和指标比较模型;高分不自动等于真实场景更好。
162 预测正确的样本数占全部样本的比例,类别失衡时可能误导。
163 精确率和召回率的调和平均,关注两者的平衡。
164 采样 k 个候选时至少一个通过测试的概率,代码模型评测常用。
165 用另一个语言模型按评分标准评价输出,规模化方便但自身也有偏差。
166 模型生成听起来合理但缺少事实依据、与证据冲突或凭空捏造的内容。
167 评测题或近似答案进入训练数据,使测试分数不能反映真正泛化。
168 不可信内容试图覆盖系统目标、诱导泄露信息或滥用工具权限。
169 模型用有限维度同时表示更多稀疏特征,使一个神经元可能混合多个概念。
170 稀疏自编码器
Sparse AutoencoderSAE
把稠密激活重构成较多但稀疏的特征坐标,方便检查内部表示。
171 激活替换实验
Activation Patching
把一条运行中的中间激活替换成另一条,再观察输出变化,用于检验局部因果假设。
172 用近似图追踪内部特征怎样跨层共同影响输出,并通过干预验证关键路径。
173 最小权限
Principle of Least Privilege
只给模型或工具完成当前任务所需的最少身份、数据、动作和时限权限。
174 拥有高权限的服务被低权限调用者借用,替其执行本不应被允许的动作。
175 Token 受众
Token AudienceAudience
访问令牌明确写明可交给哪个服务使用,避免一个服务的 Token 被转发到另一个服务。
176 把代码或工具限制在隔离环境与最小权限内,减小执行错误的影响范围。
177 主动设计对抗输入和滥用场景,寻找模型与系统的安全薄弱点。
178 把关键推理放到手机、PC、汽车、机器人或传感器附近,并在真实设备上共同验收内存、延迟、能耗、质量和隐私。
179 神经网络处理器
Neural Processing UnitNPU
针对张量计算设计的端侧加速器;模型图通常只有受支持的子图进入 NPU,其余算子仍可能回退 CPU 或 GPU。
180 量化感知训练
Quantization-Aware TrainingQAT
训练时模拟低比特舍入与截断,让参数适应量化误差;它能改善精度,但不保证目标芯片拥有对应高效算子。
181 用便宜的学习模型近似昂贵模拟或实验,把真正昂贵的验证预算留给最有价值或最不确定的候选。
182 模型根据价值或不确定性主动选择下一批最值得标注、模拟或实验的样本,再把结果回流训练。
183 任务或数据依次到来时持续更新模型,同时用历史评测检查新学习是否破坏旧能力。
184 灾难性遗忘
Catastrophic Forgetting
模型学习新任务后,旧任务能力出现显著、非预期下降;本质是新梯度干扰了旧能力依赖的共享参数。
185 针对一条或一批目标行为局部修改模型,并联合检查改写泛化、无关能力保持、多跳推理和连续编辑副作用。
186 秩一模型编辑
Rank-One Model EditingROME
在定位出的 Transformer MLP 上施加一次秩一更新来改写事实关联;适合研究局部编辑,不等同于无副作用的生产知识库。
187 批量模型编辑
Mass-Editing Memory in a TransformerMEMIT
把 ROME 风格更新扩展到多层和多条事实,以更大编辑容量换取更复杂的保持与累积回归风险。
188 智能体到智能体协议
Agent2Agent ProtocolA2A
让独立 Agent 发现彼此能力、委派任务并跟踪结果的协议;它连接远程协作者,不替代 Agent 内部工具接口。
189 A2A 中用于描述 Agent 能力、端点、认证要求与交互方式的机器可读名片,帮助客户端决定能否委派任务。
还没有收录这个说法 试试英文缩写或更短的核心词。例如把“模型为什么会胡说”改成“幻觉”。