跳到正文
动手理解 · CONCEPT LAB

GLM-5 用哪套缓存找位置,又用哪套缓存读内容?

GLM-5 的 DSA 不是一条“稀疏 MLA”黑盒:独立 indexer 保存 128 维 key、返回 Top-2,048 位置,MLA latent cache 再提供内容;MoE、共享式 MTP 与异步 Agent RL 分别改写 FFN、草稿与后训练系统。

已经发生 正在观察 接下来
01 / 04

状态传导图

h 当前 hidden
QI 32×128 Index Q
KI 128-d Index K
SCORE ReLU + 加权
TOP Causal Top-2048
IDS 位置 IDs

公开 GLM-5 config 没有固定 local-window 字段,不能自行加一条“近邻保底”。

观察点 01

32 个 128 维 Query head 扫描全部可见历史

当前 hidden 先形成 2,048 维 q residual,再展开为 32 个 128 维 index query;每个历史 token 另存一个 128 维 index key。点积分数经 ReLU 和当前 token 产生的 32 个权重合并,再做 causal Top-2,048。

历史扫描范围索引广看
主分支精算范围只读子集
此刻要记住

Indexer score 与 MLA attention score 是两套投影;前者只返回位置 IDs。

模型拆解 · 02 / GLM-5

GLM-5:索引器先找 2,048 个位置,MLA 再精读

GLM-5(Z.ai,2026-02-12)把 DeepSeek Sparse Attention(DSA,DeepSeek 稀疏注意力)接到 Multi-head Latent Attention(MLA,多头潜在注意力)上:独立 indexer 负责“看哪里”,MLA 才负责“读出什么”。Mixture of Experts(MoE,混合专家)控制前馈计算,Multi-Token Prediction(MTP,多 Token 预测)提供可选草稿,异步 Agent Reinforcement Learning(RL,强化学习)则属于后训练系统。

官方简称 744B / 40B active 完整权重 753.864B 78 层 · 3 dense + 75 MoE DSA · 32×128 indexer · Top-2,048 上下文 202,752 Base 训练 28.5T token 权重 MIT · 代码 Apache-2.0 历史型号 · 📅 2026-02-12
GLM-5 总览:报告 744B/40B 简称与公开 checkpoint 753.864B 的参数账;每层由 Lightning Indexer 选 Top-2048 位置,Sparse MLA 读取内容,前三层为稠密前馈、后七十五层为 256 选 8 加共享专家的 MoE;Muon Split、MTP、异步 Agent RL 和跨阶段蒸馏属于不同阶段
先分清三层:参数账回答要存多少权重,DSA + MLA回答历史怎样被定位和读取,MTP / Agent RL回答草稿与后训练怎样运行。它们不能合并成一句“744B 稀疏模型所以只算 40B”。查看原图 ↗
01 · 版本身份与参数口径

744B 是发布简称;公开 checkpoint 精确到 753,864,139,008

官方博客在 2026-02-12 发布 GLM-5,技术报告于 02-17 上 arXiv。核查日同一官方仓库已把 GLM-5.2 标为最新旗舰,所以本页把 GLM-5 视为可下载、仍可研究的历史型号,不把后续 GLM-5.1/5.2 的 IndexShare、1M 上下文或新 benchmark 倒灌回来。

MODEL WEIGHTS
官方 Hugging Face repo采用 MIT;配置为 GlmMoeDsaForCausalLM、默认 dtype 为 BFloat16(BF16,16 位脑浮点)。主体参数为 BF16,另有少量 FP32 路由校正 bias,见下表。
REPOSITORY
官方代码与部署仓库采用 Apache License 2.0。代码许可和模型权重许可不是同一文件,也不替代数据、输出和部署地区的合规判断。
REPORT
报告正文概括为“层数降到 80”,但附录给 3 dense + 75 MoE,发布配置也给 num_hidden_layers=78。本页以可执行配置和附录分项为准,并保留这处报告内部差异。
CURRENT STATUS
截至 2026-07-14,官方仓库首页同时列出 GLM-5、5.1、5.2,并明确称 5.2 为最新旗舰;本页所有能力分数仍以原始 GLM-5 报告为时间快照。
公开张量分组精确参数数怎样复算
78 层主干 + final norm742,008,052,992按 config 的 attention/indexer、3 个 dense FFN、75 个 256-expert MoE 与 norms 汇总
Token embedding951,582,720154,880 vocab × 6,144 hidden
Untied output head951,582,720tie_word_embeddings=false,因此不是与 embedding 共用一张矩阵
额外 MTP block9,952,920,576model.layers.78:fusion 参数 + 一整层 DSA/MoE + shared-head norm
Hugging Face safetensors753,864,139,008753,864,119,552 个 BF16 + 19,456 个 32-bit Floating Point(FP32,32 位浮点)参数;文件总字节约 1.508 TB / 1.371 TiB
报告内部矛盾

742.008B + 0.952B + 0.952B = 743.911B ≈ 744B,恰好复现“主干 + 两张词表矩阵、不含额外 MTP”的发布简称;但报告附录注释写的是“计 MTP、不计 embedding/output”。公开 checkpoint 无法让这两句话同时成立,因此本页直接标注冲突,不把约 10B 差异含糊地全归给词表层。

02 · 主干结构

78 个 Decoder block 都有 DSA;MoE FFN 只出现在后 75 层

GLM-5 是 Decoder-only(仅解码器)Transformer。每个主干 block 都先执行 DSA/MLA attention;只有 Feed-Forward Network(FFN,前馈网络)不同:前 3 层是稠密 SwiGLU,后 75 层换成 MoE。换句话说,“3 dense + 75 MoE”描述 FFN 类型,不代表前三层没有注意力。

组件发布配置它决定什么
残差主干78 layers;hidden 6,144;vocab 154,880注意力、FFN 与词表矩阵的公共宽度
MLA queryQ LoRA rank 2,04864 heads;每头 192 non-RoPE + 64 RoPE = 256当前 query 的低秩入口与注意力 head 几何
MLA KVKV LoRA rank 512;value head dim 256优化式 decode 可保存 512 维 latent KV 与 64 维位置 key,而不是逐头完整 K/V
DSA indexer32 query heads × 128 dim;每位置一个 128 维 index key;Top-2,048独立对全部可见历史位置打分,返回 MLA 要读取的位置 IDs
MoE FFN256 routed experts,Top-8;1 shared expert;expert intermediate 2,048后 75 层每个 token 只执行 8 个路由专家,同时执行共享专家
上下文max_position_embeddings=202752;RoPE theta 1,000,000公开配置的最大位置范围;不是整机一定能无条件承载的服务并发量
40B ACTIVE 能说明

一个 token 不计算全部 256 个专家

官方 active 口径包含稠密 attention、前三层 FFN、每层 router/normalization、Top-8 routed experts 与 shared expert 等路径的近似统计。

40B ACTIVE 不能说明

部署只需保存 40B 参数

下一枚 token 可能选择另一组专家;完整 753.864B checkpoint 仍须在设备、节点或可接受的 offload 层级上可寻址,还要支付 Expert Parallelism(EP,专家并行)通信。

03 · DSA / 两套缓存

Indexer 的 score 不是 MLA score;公开配置也没有固定 local window

当前 hidden 先下投影成 q_resid∈R²⁰⁴⁸。Indexer 再把它展开为 32 个 128 维 query;每个历史 token 则从 hidden 独立投影出一个 128 维 key。32 组点积经 ReLU 后,由当前 hidden 产生的 32 个权重加权求和,得到“每个历史位置一个 scalar score”,最后施加因果约束并选 Top-2,048。

GLM-5 DSA 精确链路:当前 hidden 产生 32 个 128 维 indexer query,历史 hidden 形成每位置 128 维 index key;点积经 ReLU 和学习权重合并后选择因果 Top-2048 位置;另一条 MLA 路径从 512 维 latent KV 加 64 维 RoPE key 缓存读取选中内容,再执行 64 头 256 维稀疏注意力;图下区分最后 decode query、完整 causal prefill 与实测计算口径
紫色是“找位置”的独立 index K cache,绿色是“拿内容”的 MLA latent cache。公开 config 没有 sliding-window 字段,报告也明确把 DSA 与固定窗口模式对比;因此不能凭通用稀疏注意力经验多画一条“LOCAL 保底”。查看原图 ↗
01 · INDEX

低维但仍扫描全部可见历史

Indexer score path 没有跳过远处 token;它用更窄的表示和融合 kernel 完成粗排。省下的是后续 MLA 对未入选位置的主注意力计算。

02 · SELECT

每个 query 最多 2,048 个位置

短于 2,048 时全部保留;更长时按内容 score 选位。Top-k 是位置集合,不是 2,048 个 block,也不是固定最近邻。

03 · ATTEND

只在入选集合内做 MLA softmax

MLA 的 query/key/value 参数与 indexer 分开训练;选中 IDs 只决定稀疏 mask,最终内容混合仍由主注意力概率完成。

202,752-token 窗口算式正确读法
最后一个 decode query2,048 / 202,752 = 1.0101%这一枚 query 的主 MLA 候选约少 99×;不包含 indexer、FFN、通信和其他层
Dense causal prefillL(L+1)/2 = 20,554,288,128 pairs完整因果三角形,不是每个 query 都有 L 个可见 key
Top-2,048 causal prefillΣ min(t,2,048) = 413,139,968 pairs主 attention 候选为 dense 的 2.01%,约少 49.75×,不是 99×
报告实测口径长序列 attention computation 约降 1.5–2×发布方实验结论;不能换成 49.75× 端到端吞吐或成本
batch=1、BF16、78 层主干的优化式逻辑缓存每 token202,752 tokens
MLA latent + RoPE key78×(512+64)×2 = 87.75 KiB16.97 GiB
独立 indexer K78×128×2 = 19.50 KiB3.77 GiB
主干合计107.25 KiB/token20.74 GiB

这是按 config 做的 latent-cache 元素账,不含 MTP 层、batch、分页 metadata、量化 scale、allocator 碎片与 kernel workspace。通用 Transformers eager path 还可能物化展开后的 K/V;生产引擎的实际布局不能只由这张表推断。

报告支持

所列 128K 长上下文任务是混合胜负

DSA 相对 MLA:MQ-NIAH 100.0 vs 100.0、MV-NIAH 97.0 vs 95.5、SQuAD 86.0 vs 79.7,但 HotpotQA 63.0 vs 66.3。更准确的结论是“在这四项中接近且各有胜负”,不是数学上的 lossless。

报告不支持

GLM-5 每层都已实测 90% 冗余

“90% attention entries 冗余”来自报告对 DeepSeek-V3.2-Exp 先前结果的概括,不是 GLM-5 全层、全任务的直接标注;不同内容分布也不会固定命中同一稀疏率收益。

RL 里的 Top-k

Agent RL 若把每个 token、每层的 2,048 个 index 全部 replay,按公开实现的 int32 粗算就是 78×2,048×4 = 638,976 bytes ≈ 624 KiB/token。报告因此没有存全部 indices,而是在 RL engine 使用确定性的 torch.topk,并默认冻结 indexer;作者称非确定性 CUDA/TileLang Top-k 会造成训练—推理选位不一致和快速退化。这是其大规模训练观察,不是所有 Top-k kernel 的通用定理。

04 · MoE 路由与 Muon Split

路由先用 bias 选 8 个专家;Muon Split 只改训练更新

后 75 层的 router 先对 256 个专家产生 sigmoid affinity s。公开实现用 s + e_score_correction_bias 决定 Top-8 indices,但真正混合 expert outputs 的权重来自原始 s:入选分数重新归一化,再乘 routed_scaling_factor=2.5;shared expert 不参加 Top-8,始终走另一条并行分支。

SELECTION

8 / 256 = 3.125%

这是 routed expert pool 内的选择率。GLM-5 的 n_group=1,因此没有 DeepSeek-V3 那种“8 组先留 4 组”的跨节点分组筛选。

MIXING

原始 sigmoid 分数归一化 × 2.5

校正 bias 只移动选路边界,不直接乘 expert output;共享专家的完整输出再与 routed sum 相加。

SYSTEM

稀疏计算不等于稀疏存储

一个 MoE 层的完整专家参数约 9.70B;跨设备 dispatch/combine、负载偏斜与小 batch 利用率决定能否兑现 40B-active 的计算优势。

报告架构消融HellaSwagMMLURACEBBHGSM8KHumanEval
GQA-877.361.279.653.347.638.5
MLA77.361.577.848.946.233.5
MLA + Muon Split77.862.579.951.845.036.7
MLA-256 + Muon Split77.462.079.651.347.536.6
MUON SPLIT

按 attention head 分开正交化

普通配方对 Q/K/V up-projection 的整张二维矩阵做 Muon 正交化;GLM-5 把它们按 head 拆成较小矩阵再分别处理,让不同 head 以不同尺度更新。它是 optimizer update 的组织方式,不是推理图里多出来的一个 layer。

MLA-256

64 heads,QK 总维 256,V 维 256

公开 config 把 Q/K 拆成 192 non-RoPE + 64 RoPE。报告称相对原 MLA 把 head width 增至 256、head 数减三分之一,在训练计算和参数近似不变时降低 decode 工作量;表中并非每个任务都超过 GQA-8。

05 · MTP / 共享草稿

“三层共享”是一套 9.953B 权重被调用三次

公开权重在 78 层主干之后还有 model.layers.78。它先分别归一化主模型 hidden 和当前 draft token embedding,拼接后投影回 6,144 维,再经过一整层 DSA + 256-expert MoE,最后复用主 Language Model Head(LM Head,语言模型输出头)产生草稿 logits。

GLM-5 MTP:主模型 hidden 与草稿 token embedding 经 norm、拼接和投影进入唯一的 model.layers.78 DSA 加 MoE block,复用主 LM head 产生草稿;训练时同一套权重按三个 MTP 深度重复调用,投机推理时可继续起草候选块,但最终由主模型验证
Checkpoint 只有一套额外 MTP 参数,不等于它只能起草一步;训练深度、运行时 speculative steps、最终接受长度是三个不同口径。查看原图 ↗
层级可确认事实不能偷换成
权重结构num_nextn_predict_layers=1;额外 tensors 精确为 9.953B三套独立 MTP heads,或 744B 已完整包含这 9.953B
训练深度报告称同一套 MTP layer 参数在 3 个预测层共享每个未来位置各有一套独立权重
作者私有实验同为 4 speculative steps:GLM-5 accept length 2.76,DeepSeek-V3.2 为 2.55公开 prompt 上可复现的接受率,或线上速度直接提升 8.2%
普通生成主模型可以独立逐 token 生成;MTP 是服务端可选优化每次加载权重都会自动启用投机解码
为什么接受更长仍未必更快

每轮还要支付 MTP block forward、草稿采样、候选组织和目标模型验证;batch、采样温度、prompt 分布、kernel、Expert Parallelism 与拒绝位置都会改变收益。报告只给平均接受长度,没有公开端到端 Tokens Per Second(TPS,每秒 token 数)对照。

06 · Base 与后训练配方

28.5T 是发布方总量;阶段名义值与 DSA 转换不能擅自再相加

报告把 Base 总量写成 28.5T,同时披露 27T 常规预训练与三段 mid-training:32K / 1T、128K / 500B、200K / 50B。四个名义值相加为 27 + 1 + 0.5 + 0.05 = 28.55T,相差 50B(约 0.18%),说明至少一处采用了约数;这些披露不能反推精确训练日志。

BASE

27T

通用、代码、数学与科学语料;报告称更早提高 code / reasoning 权重。

MID · 32K

1T

长文档、repo 级代码、issue/PR 与 agent trajectories 开始加权。

MID · 128K

500B

继续扩大长上下文与软件工程训练。

MID · 200K

50B

加入少量 MRCR-like 长对话数据;报告称也改善 128K 表现。

从 MLA 转到 DSA发布方披露本页复算 / 边界
Indexer warmup1,000 steps;每步 14 × 202,752 tokens;最高 learning rate 5e-31,000×14×202,752 = 2.838528B token
Sparse adaptation沿用 mid-training 数据/超参;20B token;constant learning rate 1e-5两段名义合计 22.838528B;报告未说明已包含在 28.5T 内,还是发生其后另计,本页只并列披露,不相加也不扣除
论文对照DeepSeek-V3.2 为 943.7B adaptation tokens模型、起点、数据、优化和目标不同;不能推出通用“省 41×/47×”
SFT context最长 202,752 tokens;并做 INT4 quantization-aware training训练可见长度不等于每个服务请求都能在同一硬件上以相同时延运行
SFTReasoning RLAgentic RLGeneral RLFinal Cross-Stage Distillation
蒸馏放在哪

报告引言说“throughout this process”,但方法 Section 3.5 明确定义为 final stage:使用前面 SFT / RL 阶段的最终 checkpoints 作 teachers,混合对应 prompts,从 teacher log-prob 差构造优势以恢复先前能力。本页以方法章节为准,不画成每两个阶段之间都实时蒸馏。

07 · 异步 Agent RL

Rollout 不等 Learner;吞吐提高后要补四道一致性护栏

Agent 轨迹长短差异很大,同步 RL 会让一批 Graphics Processing Unit(GPU,图形处理器)等待最慢样本。GLM-5 把 inference rollout 与 learner 放在不同 GPU:生成端持续采样,轨迹达到阈值后送去更新,训练端每 K 次 gradient updates 周期同步新权重。代价是同一条轨迹可能跨多个 policy version,天然引入 off-policy bias。

GLM-5 异步 Agent RL:Rollout GPU 经 Token-in-Token-out gateway 与工具环境交互,轨迹包保存 token IDs、rollout log probabilities、policy versions、失败原因和奖励;orchestrator 支持超过一千个并发 rollout,越界 token 被 importance-ratio mask,过旧或环境崩溃样本被过滤,learner 更新后周期同步新权重;后训练顺序为 SFT、Reasoning RL、Agentic RL、General RL、最终跨阶段蒸馏
“异步”不是把旧轨迹直接吞掉:Token-in-Token-out(TITO,token 进 token 出)守住分词边界,rollout log-prob 守住行为策略口径,policy version 守住 staleness,失败原因守住环境噪声。查看原图 ↗
ORCHESTRATION

中央 orchestrator 支持报告所称 1k+ concurrent rollouts

不同任务把 rollout/reward logic 做成独立服务,中央调度控制采样比例和生成速度,再统一成 message-list trajectory。这个数字是基础设施并发能力,不是 1,000 条都同时进入同一次 optimizer step。

TITO

训练直接消费生成端 token IDs

若只回传 text,learner 重新 tokenize 可能因空格、归一化、special tokens、截断或 streamed fragments 改变边界。TITO gateway 拦截 generation request,记录 token IDs 与 metadata,保持 action—reward 对齐。

IMPORTANCE MASK

越界的是 token;不是把整条 trajectory 都 clip

Direct double-sided importance sampling 使用 r=exp(log p_current−log p_rollout),不再单独跑历史 old-policy inference。落在信赖区间外的 token 直接 mask 掉梯度;这与标准 Proximal Policy Optimization(PPO,近端策略优化)的对称值截断不是同一个算子。

STALE / NOISY

过旧或环境崩溃才丢 sample

若当前版本与轨迹最早版本差超过阈值,整条 sample 丢弃;sandbox crash 也排除。Group Relative Policy Optimization(GRPO,组相对策略优化)组若剩余有效样本超过一半就重复有效样本补齐,否则整组丢弃。

KV LOCALITY

同一 rollout 固定到同一 DP rank

Data Parallelism(DP,数据并行)aware routing 用 rollout ID 做 consistent hashing,让多轮同前缀请求复用同一 rank 的 Key-Value Cache(KV Cache,键值缓存),再动态平衡 hash space;它优化增量 prefill,不等于跨 rank 同步 KV。

异步证据边界

报告没有公开一个可独立复现的“训练吞吐提升 X×”,也不能把最终 benchmark 提升单独归因给异步。系统还使用 FP8 rollouts、MTP、Prefill–Decode disaggregation、heartbeat fault tolerance 和环境扩展;算法、数据、采样与基础设施共同变化。

08 · 能力与部署证据

成绩是 2026-02 的发布快照;七平台适配不是七份统一 benchmark

下面只复述技术报告 Table 7 与 Appendix B 的设置。它们主要是发布方评测,且不同 benchmark 使用不同 harness、prompt、context strategy、timeout 或 judge;因此适合回答“原始 GLM-5 在这些明确设置下表现如何”,不能替代核查日排行榜。

BenchmarkGLM-5关键设置 / 读法
SWE-bench Verified / Multilingual77.8 / 73.3OpenHands;tailored instruction prompt;temperature 0.7;16,384 max new tokens;200K context
Terminal-Bench 2.0 · Terminus-256.2 / 60.7†2h timeout、128K context;† 为作者修订歧义任务后的 verified version
Terminal-Bench 2.0 · Claude Code56.2 / 61.1†Claude Code 2.1.14;移除 wall-clock limit;保留 CPU/RAM 限制;平均 5 runs
BrowseComp62.0 / 75.9前者保留最近 5 turns;后者用 discard-all context management,不能把两列当同一上下文策略
τ²-Bench89.7Retail/Telecom 调整 user-simulator prompt;Airline 采用 Claude Opus 4.5 system-card fixes
MCP-Atlas public set67.8500 tasks;每题 timeout 从 4 延到 10 分钟;Gemini 3 Pro 作 judge
Vending-Bench 2$4,432Andon Labs 独立运行;低于同表 Opus 4.5 的 $4,967 与 Gemini 3 Pro 的 $5,478;余额不是通用 Agent 成功率
CHECKPOINT FILES

裸文件约 1.371 TiB

这是 BF16 主体参数与少量 FP32 bias 的 safetensors metadata 精确字节账,不含 KV Cache、激活、通信缓冲和框架 workspace。40B active 不会把完整权重自动缩到 80 GiB。

SEVEN PLATFORMS

发布方称完成七个国产平台适配

华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦、燧原;报告详细展开的是 Ascend 案例,不是七个平台同配置同数据的横向测试。

ASCEND W4A8

Attention / 普通 MLP 为 W8A8,MoE experts 为 W4A8

报告称用混合精度把约 750B 模型放进一台 Atlas 800T A3 machine,并实现 Lightning Indexer、Sparse Flash Attention 与 MLAPO kernels。“一台 machine”不是“一颗 NPU”。

真正的设计课

GLM-5 不是把所有成本都交给一个“稀疏”标签:Indexer压主注意力候选,MLA压历史内容状态,MoE压每 token 的 FFN 路径,MTP压验证轮次,异步 RL压训练等待。每个机制都引入另一份 cache、通信、验证或一致性合同;系统设计的关键是把这些账分开验。

来源与核查 · 2026-07-14

报告给训练证据,配置给尺寸,权重索引与代码给真实执行路径

本页优先采用 Z.ai 官方博客、技术报告、模型仓库与实现。参数总数、DSA 两套投影、MoE 选路和 MTP extra layer 以公开 config / safetensors / framework code 交叉复算;厂商 benchmark 只按原始 harness 复述。

证据层一手来源本页核查用途
发布公告GLM-5: From Vibe Coding to Agentic Engineering2026-02-12 发布时间、744B/40B、28.5T、产品定位与原始发布表述
技术报告GLM-5 Technical Report · arXiv:2602.15763DSA、Muon Split、MTP、训练数据、异步 RL、跨阶段蒸馏、平台适配与完整评测设置
模型与配置GLM-5 model repoconfig.jsonMIT、78 层、MLA/indexer/MoE 维度、Top-2,048、202,752 context 与 MTP count
权重索引model.safetensors.index.json总字节数、model.layers.78、untied embedding/head 与精确参数分组复算
模型实现Transformers GLM-MoE-DSA implementationIndexer Q/K 投影、ReLU/head weighting、独立 cache、Top-k mask、sigmoid router、selection bias 与 mixing weights
后训练基础设施slime报告所用统一 RL stack 的 rollout customization、server-based execution 与训练/推理解耦背景
DSA 前身DeepSeek-V3.2 Technical ReportGLM-5 报告引用的 DSA 来源与 943.7B adaptation 对照;不把前身实验当成 GLM-5 直接测量
长期任务复核Andon Labs · Vending-Bench 2确认 $4,432 来自独立运行的模拟经营余额,而不是厂商自定义成功率
当前版本仓库zai-org/GLM-5截至核查日的 5 / 5.1 / 5.2 家族状态、代码 Apache-2.0 与历史型号边界