跳到正文
SPECIAL EDITION · 05.2
模型专题 · Z.ai / 智谱

GLM-5.2 怎样让百万上下文真正跑起来

它没有把模型再放大一轮,而是把同代 753.330B Mixture of Experts(混合专家,MoE) 主干改造成一套面向大型代码库、多小时研究和长程工具任务的系统:少重复检索,让 Multi-Token Prediction(多 Token 预测,MTP)多猜几步,再用更长、更难作弊的轨迹训练 Agent。

一句话判断

1M 不是把窗口数字改大。它要求 Attention、索引器、Key-Value(键值,KV)缓存、推测解码、训练轨迹和服务系统一起重做。

一条超长纸带进入分层模型机器,经索引书签、专家路由和并行轨道处理后,输出代码、研究报告和工具任务
把百万 Token 想成一卷很长的档案:GLM-5.2 不会每层重翻整卷,而是压缩存档、稀疏精读、跨层共用书签。
753.33BCheckpoint 总参数
≈ 40B每 Token 激活
78Backbone 层
1,048,576总上下文
21 + 57Full / Shared Indexer
128KAPI 最大输出*

* 最大输出与输入、历史、工具结果和 Thinking 共同占用 1M 总预算。

01 · 先把名字摆正

GLM-5.2 是同一副大骨架,换上一套长任务系统

GLM-5 建立 MoE、Multi-head Latent Attention(多头潜变量注意力,MLA)、DeepSeek Sparse Attention(DeepSeek 稀疏注意力,DSA)和 Agentic Engineering 主干;5.1 强化持续编码;5.2 的重点是 1M、IndexShare、新 MTP 与长程后训练。交付面包括 BFloat16(16 位脑浮点,BF16)、8-bit Floating Point(8 位浮点,FP8)和 NVIDIA 4-bit Floating Point(NVIDIA 4 位浮点,NVFP4)。它不是参数翻倍,也不是多模态新模型。

从 2026 年 2 月到 6 月,模型主干大体稳定,能力重心从 200K Agent 扩展到百万上下文长任务;5.2 同时提供 API、BF16、FP8 与 NVIDIA NVFP4 路线。查看原图 ↗
开放权重

BF16 / FP8

Z.ai 官方后训练 Checkpoint,MIT License。截至 2026-07-14,官方组织未发布 Base、Flash、Air、GGUF 或 INT4 版本。

适合:研究、私有化和 Engine 适配
托管服务

glm-5.2

标准 API model ID。GLM-5.2[1m] 是 Coding Plan 客户端选择提示,不是通用 API 名。

适合:先验证真实业务任务
硬件生态

NVFP4 / W8A8

NVIDIA 与昇腾生态的硬件优化路线,不应与 Z.ai 官方 BF16/FP8 权重混成一个口径。

适合:锁定硬件后的专项优化
白话理解

把 GLM-5、5.1、5.2 想成同一栋大型医院。5.2 没有再多盖一倍科室,而是重做了档案检索、会诊调度和连续值班制度,让它能接手更长、更复杂的病例。

模态边界:GLM-5.2 是文本 / 代码 / 工具结果输入,文本 / reasoning / tool call 输出。Tokenizer 里出现图像或音频特殊 Token,不等于它具备多模态编码器。
02 · 完整架构

一枚 Token,怎样穿过 78 层 GLM-5.2

每一层先决定“去历史哪里找”,再决定“找哪些专家加工”。前 3 层保持 Dense,后 75 层进入稀疏专家网络;MTP 是旁边反复复用的一套草稿模块。

主路径是 Embedding → 78 层检索与专家加工 → LM Head;一套共享 MTP 模块可以递归展开多个草稿步。查看原图 ↗
01 · 变成向量

Token → 6,144 维

Embedding 把词表编号变成模型可以计算的隐藏向量。词表共有 154,880 个位置。

02 · 找历史

MLA 压缩,DSA 精读

MLA 降低每个历史 Token 的 KV 体积;Indexer 先扫历史,核心 Attention 只精看 Top-2,048。

03 · 找专家

256 选 8 + 1

Router 从 256 个路由专家里选 8 个,同时经过 1 个共享专家,再合并回残差流。

04 · 预测未来

LM Head + MTP

主输出头预测下一 Token;共享 MTP 额外猜多个未来 Token,供推测解码一次验证。

Dense / MoE3 / 75 层共 78 层 Backbone
专家256 → Top-8另有 1 个 Shared Expert
Attention64 HeadsQ/K Head 256 维
DSATop-2,04832 个 Indexer Heads
KV 低秩联合压缩Rank 512Config 字段为 kv_lora_rank,不是微调适配器
位置范围2²⁰Rotary Position Embedding(旋转位置编码,RoPE)θ = 8,000,000
全部要存753.33B

所有专家的权重都要能被设备访问。

每步会算约 40B

一枚 Token 只经过被选中的少量专家。

MoE 像拥有 256 个科室的大医院:一次会诊只叫 8 个专科和 1 个全科医生,但其他科室不能从楼里消失。

03 · 核心升级

IndexShare:四层共用一次搜索结果

DSA 已经让核心 Attention 不再精读全部历史,但 Indexer 为了找出 Top-2,048,仍要扫描长历史。上下文扩大到 1M 后,“每层都查一次目录”本身又变贵了。

公开 Config 有一个容易漏掉的例外:第 1、2 层各自检索;从第 3 层起,才按“1 层 Full + 3 层 Shared”循环。查看原图 ↗
普通 DSA

78 层,各查各的

核心注意力已经稀疏,但每层 Indexer 仍轻扫一遍全部历史,再排序出 Top-k。

1M 时重复扫描累积成新瓶颈
GLM-5.2

21 层查,57 层复用

前两层是 Full;从第 3 层起,每个 Full 层把 Top-k 结果传给后续三个 Shared 层。

57 / 78 = 73.1% 层省去独立 Indexer
精确排布:按 0-based 层号,Full Indexer 位于 0、1、2、6、10、…、74;换成人类常用的第几层,就是第 1、2、3、7、11、…、75 层。其余 57 层直接复用上一份 Top-2,048。
减少的 Checkpoint 参数534,198,528GLM-5.1 张量统计 − GLM-5.2 张量统计
=
Shared 层57不再保存独立 Indexer
×
每个 Indexer9,371,904按公开维度计算
官方 2.9×

指 1M 场景每 Token 的 Floating-Point Operations(浮点运算量,FLOPs)降至约原来的 1 / 2.9,即减少约 65.5%

不是 2.9× 速度

真实延迟还包括权重、KV、Kernel、通信、排队和 MTP 接受率。

论文实测边界:IndexCache 论文在 30B、单机 8×H100、200K 输入上报告 Prefill 19.5s → 10.7s(1.82×)、单请求 Decode 58 → 86 Token/s(1.48×)、满 KV 吞吐 197 → 297 Token/s(1.51×)。它验证了跨层复用方向,但不是 753B GLM-5.2 的实测速度。
白话理解

前两位研究员先各自检索;从第三位开始,每四位组成一组,第一位贴书签、后三位沿用。省的是重复找页,不是让整座图书馆凭空变小。

04 · 百万上下文

能放进 1M,不等于还能完整输出 128K

1,048,576 是整场会话的总预算。System Prompt、历史、代码、工具结果、Thinking 和最终回答都从同一个“行李箱”取空间。

1M 是一只共享行李箱;输出上限是 128K,但剩余空间不足时,实际可输出量会更小。查看原图 ↗
动手试一下

拖动输入长度,看还剩多少

示例固定预留 32,768 Token 给后续工具结果和格式开销;最终回答仍受 131,072 Token 上限约束。

这是容量示意,不是平台自动替你预留的固定规则。
总窗口1,048,576
已有上下文720,896
工具与格式预留32,768
理论可给最终回答131,072仍受 128K 输出上限约束
01 · 计算

要找哪些历史

DSA 与 IndexShare 主要解决 Indexer 和 Attention 的计算增长。

02 · KV

每个会话都要占

MLA、FP8 KV、CP 和分层缓存降低容量压力,但不会让 KV 消失。

03 · 质量

长不等于会找

噪声、冲突、时序和恶意内容变多,仍需要检索、摘要与权限过滤。

04 · 服务

一个与并发不是一回事

长 Prefill、排队、超时、恢复和 OOM 会把单请求能力变成系统问题。

部署边界:vLLM Recipe 明确写的是:8×H200 可加载 FP8;完整 1M 的起点是 8×B200 + FP8 KV,并从 max-num-seqs=32 起调。能跑一个 1M 请求,仍不等于具备 1M 高并发。
05 · Decode 加速

MTP:同一位速记员,多猜几枚未来 Token

标准 Decode 每轮只前进一步。共享 MTP 先连续写出一小段草稿,昂贵的主模型再一次并行检查;只要连续猜对超过一个,就能减少串行等待。

Checkpoint 只有一套物理 MTP 模块;7-step 指重复展开 7 次,不是保存 7 套独立权重。查看原图 ↗
01

IndexShare

第一个草稿步计算 Top-k,后续草稿步复用同一组历史位置。

02

KV Share

后续草稿步也复用第一步的 KV,避免把不同草稿隐藏态写成一串不一致的缓存。

03

Rejection Sampling

用拒绝采样构造训练目标,让递归草稿更贴近主模型会接受的分布。

04

Total Variation Loss

用总变差(Total Variation,TV)损失端到端压低分布差异。

官方 7-step 编码消融

平均连续接受长度

基于 GLM-5.1 Backbone 和编码训练数据。它说明草稿更准,不等于端到端同幅加速。

Baseline4.56
+ Index / KV Share5.10
+ Rejection Sampling5.29
+ End-to-end TV5.47
白话理解

速记员先猜“下一句大概会怎么写”,总编辑一次校对整小段。模板化代码往往更好猜,开放式创作更难;因此接受长度和收益会随任务、Batch 与 Engine 改变。

06 · 长程 Agent 训练

长任务不能只拉长答案,还要重做训练闭环

数小时任务会产生不等长的终端、工具与子 Agent 轨迹。GLM-5.2 把它们压成可学习片段,用 Critic(价值评估器)估计 Token 级优势,再用 Proximal Policy Optimization(近端策略优化,PPO)更新;并行 On-Policy Distillation(同策略蒸馏,OPD)则把十多个专长模型合回一个模型。

能力来自模型和训练环境共同设计:轨迹要能压缩、归因、反作弊,还要把不同专长重新合回同一个 Policy。查看原图 ↗
来自 GLM-5 的主干谱系

28.5T 是基础训练,不是 5.2 新增量

  • GLM-5 报告把基础训练总量写作 28.5T Token
  • 分阶段名义值为 27T + 32K 的 1T + 128K 的 500B + 200K 的 50B = 28.55T,与总量相差 0.05T;这只支持“披露数字是近似口径”,不能反向当成精确总账
  • DSA 转换另披露 2.838528B Warmup + 20B Sparse Adaptation;报告没有说明它们包含在 28.5T 内还是额外发生
  • Supervised Fine-Tuning(监督微调,SFT)→ Reasoning Reinforcement Learning(推理强化学习,RL)→ Agentic RL → General RL → 跨阶段蒸馏
GLM-5.2 明确披露的新增方向

把训练目标换成真正的长任务

  • 显著扩大 1M Coding Agent 训练;“持续数月”来自官方产品说明
  • IndexShare 从 128K Mid-training 开始适应
  • Compact Trajectory(压缩轨迹)+ Sub-agent Rollout(子 Agent 采样)
  • Critic-based PPO:单条 Rollout、Token-level Advantage 与 Token-level Loss
  • Parallel OPD 约两天合并十多个专家模型;这是发布方披露的训练效率,不是可独立复现的算力账
ONLINE ANTI-HACK

通过测试,不等于真的会做题

可疑工具调用隐藏测试 / 上游 Commit / 下载补丁
规则高召回先快速圈出风险调用
LLM Judge进一步判断真实意图
阻止但继续返回虚拟信息,保留其余有效轨迹
仍未公开:5.2 额外 Token总 FLOPs / GPU 数完整 1M CurriculumBF16 / FP8 全量质量对照
07 · 能力与证据

官方成绩看上限,独立评测看能复现多少

GLM-5.2 在长程编码、终端和 10K~100K 长文档上进入开放权重第一梯队;但官方 Agent 分数常包含 Claude Code、OpenHands、数小时预算和 400K~1M 上下文。

Agent 榜单测的是“模型 + 脚手架 + 工具 + 预算 + Judge”;不能把分数当成裸模型一次采样。查看原图 ↗
官方模型卡

GLM-5.2 相比 5.1

5.1 5.2
HLEHumanity’s Last Exam · text-only · 163,840 max gen
31
40.5
CritPt高难推理
4.6
20.9
SWE-bench ProOpenHands · 400K
58.4
62.1
Terminal-Bench 2.1Terminus-2 · 256K
63.5
81
FrontierSWEProximal · 1M
30.5
74.4
MCP-Atlas公开 500 题 · 10 min
71.8
76.8

不同 Benchmark 使用不同 Harness 与时长:例如 HLE 最大生成 163,840,SWE-bench Pro 用 400K,Terminus-2 用 256K,FrontierSWE 用 1M。图只展示模型卡快照,不构成统一排行榜。

证据较强长程编码 · 网页生成 · 知识工作 · 10K~100K 跨文档
证据中等通用工具与终端 Agent,受 Harness 影响很大
证据不足512K / 1M 无损理解 · 专业科学可靠性 · 全面安全性
关键边界:配置和第一方服务支持 1M;独立 Artificial Analysis Long Context Reasoning(AA-LCR)只覆盖 10K~100K 文档。当前仍没有第三方完整 512K/1M 多针、干扰和多步推理曲线证明“窗口内等质量”。
08 · 托管 API

Thinking、工具调用和缓存,必须由编排器接对

标准托管 API 默认开启 Thinking,且 reasoning_effort 默认 max。模型可以提出工具调用,却不会自己执行 Shell、数据库或 Model Context Protocol(模型上下文协议,MCP);Preserved Thinking 也需要客户端把历史 reasoning 原样回传。

模型负责“建议调用什么”,控制面负责“是否允许、在哪里执行、结果怎样回传”。查看原图 ↗
OPENAI-COMPATIBLEmodel = "glm-5.2"

国际:https://api.z.ai/api/paas/v4/
中国:https://open.bigmodel.cn/api/paas/v4/

1M总上下文
128K最大输出
128最多 Functions
JSONjson_object
Non-thinking

简单任务少走推理

分类、改写、抽取和短回答。可用 minimal / none 或禁用 Thinking。

High

普通代码与工具

low / medium 会兼容映射到 High,适合作为成本可控的起点。

Max · 默认

困难调试与长程 Agent

能力更强,也可能先生成数万 reasoning Token;必须设置预算、超时与停止规则。

托管与自部署不要混参:上面的 none/minimal → 不思考low/medium → highxhigh → max 是 Z.ai 标准 API 规则;SGLang 自部署使用 Chat Template,截至核查日只有显式 high 会降档,其他未识别值会回落到 Max。
PRESERVED THINKING

标准 API 的 thinking.clear_thinking 默认是 true。若改为 false,历史 reasoning_content 必须完整、原样、按顺序回传;Coding Plan 的默认行为与标准 API 不同。

国际站价格快照 · 2026-07-14

一次任务到底多少钱?

未缓存输入 $1.40 / 1M,缓存命中 $0.26 / 1M,输出 $4.40 / 1M。Thinking 属于输出侧用量。

估算 Token 账单$0.3240
未命中输入
$0.2800
缓存输入
$0.0000
输出 / Reasoning
$0.0440
不含工具 API、沙箱、检索、存储与重试;生产应看“每个成功任务成本”。
09 · 权重与容量

40B Active,为什么仍要装下 0.465~1.507 TB 权重

Active Parameters 回答“这枚 Token 算多少”,权重文件回答“整座模型要放多少”。MoE 的其余专家这一步不计算,但仍必须常驻或能被快速访问。

先按数据与硬件选择权重,再按 KV、并发和上下文长度做容量模型。查看原图 ↗
Z.ai 官方

BF16

1.370 TiB1.507 TB · 1,403.19 GiB · 282 分片

适合大显存多节点和质量基线;运行时还需 KV、Buffer 与安全余量。

Z.ai 官方 · 生产主线

FP8

703.72 GiB755.62 GB · 141 分片 · E4M3

FP8 只覆盖可转换的线性权重;文件还含 BF16/F32 张量与 Scale,不能用“753B × 1 Byte”粗算。

NVIDIA ModelOpt

NVFP4

432.87 GiB464.80 GB · 47 分片 · Blackwell

只量化 MoE 专家内的线性算子权重与激活;共享专家不量化,其他模块保留更高精度。

单位纠错:以上都按各仓库 model.safetensors.index.jsontotal_size 复算,是权重 Payload,不是进程峰值显存。原页面把 BF16 的约 1,403 GiB 误写成了 1.403 TiB;正确值是 1.370 TiB。
运行时总内存≈ 权重 + KV × 并发 + 激活 / 临时 Buffer + 通信 / Kernel Workspace + 安全余量
8×96GB = 768GB

只比 FP8 文件稍大,几乎没有空间留给 KV 和运行时,不能据此宣称稳定可服务。

社区低比特 / Offload

可以降低 GPU 门槛,但长上下文 KV、CPU 内存带宽、格式兼容和质量要重新验证。

10 · 生产部署

GPU 负责推理,控制面负责把长任务管住

可用的生产系统不只是一个模型 Endpoint。它还需要网关、上下文管理、Role-Based Access Control(基于角色的访问控制,RBAC)、沙箱、缓存、Checkpoint、Artifact Store 和端到端 Trace。

模型只占推理平面的一部分;长任务的权限、恢复和验收都在控制面。查看原图 ↗
路径 A · 托管 API

先验证任务成功率

无需先持有 0.465~1.507 TB 权重,也不用维护 Kernel、并行和弹性。

适合:试点、波动负载、快速验证
路径 B · 官方 FP8

Hopper / AMD 主线

vLLM 或 SGLang 从已验证 Recipe 起步;完整 1M 不要从理论显存下限反推。

适合:稳定大流量、数据隔离
路径 C · NVFP4

Blackwell 优化

文件更小,但硬件与 Kernel 绑定更强;必须对长任务和工具格式做业务 A/B。

适合:B200/B300/GB300 集群
vLLM

TP8 · MTP · Tool / Reasoning Parser

  • v0.23.0 Recipe:官方 FP8 从 8×H200 装载起步
  • 完整 1M 明确起点:8×B200 + FP8 KV
  • 示例取 5 个 speculative tokens;这是运行时旋钮,不是模型固定值
SGLang

CP · EP · P/D · HiCache

  • Context Parallelism(上下文并行,CP)可让 64K Prefill 在其测试中快约 2.5~2.8×
  • CP 会分割 KV Pool 并增加 Decode 侧开销,只适合长 Prefill
  • Expert Parallelism(专家并行,EP)、Prefill/Decode(P/D)分离与分层 KV 缓存按已验证镜像锁版本
Ascend / Offload

先看“验证到多长”

  • 当前链接是 Developer Preview;单机 A3 的公开 W8A8 示例仅 20,480
  • 4 节点共置示例验证 200K;A2 P/D 示例的 Prefill 长度为 115,168,不是 1M
  • 能启动不等于完整 1M、长 Thinking 或业务工具格式已验证
上线前六件事

把“能回答”升级成“能完成”

  1. 容量:按长度 Bucket × 并发估 KV,而非只算权重。
  2. 工具:Schema、RBAC、沙箱、审批和出网白名单。
  3. 恢复:保存状态机、Workspace、幂等键和预算。
  4. 观测:Time to First Token(首 Token 延迟,TTFT)、KV、Cache、MTP 接受率与每成功任务成本。
  5. 验证:128K / 512K / 1M 固定正确性集与量化 A/B。
  6. 安全:Prompt Injection、越权、Secret 与 Artifact 生命周期。
11 · 选型边界

它适合长程工程,不是一台工作站上的万能模型

GLM-5.2 的优势最容易在大型代码库、长研究和工具任务中兑现;短问答、极低时延和资源受限场景,不必为 1M 与 753B 付出全部成本。

更适合

上下文长、工具多、验收明确

  • 大型仓库跨文件修改与持续调试
  • 多论文、规范、日志联合研究
  • 终端、浏览器、MCP 和内部工具协作
  • 需要开放权重和私有化的长程 Agent
  • 有沙箱、测试、Checkpoint 与人工审批
不一定适合

短、快、便宜,或没有控制面

  • 毫秒级分类、抽取和短改写
  • 消费级单卡生产部署
  • 没有权限隔离与审计的自动执行
  • 对事实零容忍却没有检索和人审
  • 把大窗口当成知识库治理替代品
模型与训练

没有独立 GLM-5.2 完整技术报告;额外 Token、FLOPs、GPU 和训练数据细节未披露。

长上下文

官方把它称为“solid 1M”,但尚无第三方 512K/1M 全面曲线;2.9× 也不是服务速度 Service-Level Agreement(服务等级协议,SLA)。

质量与安全

完整 Eval Runner、系统安全卡和权威安全评估不足;Anti-hack 不等于生产安全。

API 与量化

固定限流未公开;严格 json_schema、官方 Base 和 BF16/FP8 全量质量对照未见。

最终判断

GLM-5.2 最有价值的不是 753B 这个数字,而是 MLA 压 KV、DSA 稀疏精读、IndexShare 少查目录、MTP 提高 Decode 并行度,再用长轨迹 PPO 与 Anti-hack 把它训练成 Agent。先用 20~50 个真实长任务验证成功率和完整成本,再决定是否把私有化当成一个集群项目。

12 · 资料来源

这篇专题的证据来自哪里

架构和接口优先使用官方发布、机器可读 Config、权重索引、论文与框架 Recipe;能力结论再用独立评测校准。动态价格、版本、硬件支持和榜单均以 2026-07-14 为核查边界。

证据边界:截至核查日,没有找到独立成篇的《GLM-5.2 Technical Report》。GLM-5 论文只解释同代主干谱系;5.2 新增机制以官方博客、模型卡和 Config 为主。独立榜单受 Provider、Harness、日期和预算影响,不写成永久排名。