BF16 / FP8
Z.ai 官方后训练 Checkpoint,MIT License。截至 2026-07-14,官方组织未发布 Base、Flash、Air、GGUF 或 INT4 版本。
适合:研究、私有化和 Engine 适配它没有把模型再放大一轮,而是把同代 753.330B Mixture of Experts(混合专家,MoE) 主干改造成一套面向大型代码库、多小时研究和长程工具任务的系统:少重复检索,让 Multi-Token Prediction(多 Token 预测,MTP)多猜几步,再用更长、更难作弊的轨迹训练 Agent。
1M 不是把窗口数字改大。它要求 Attention、索引器、Key-Value(键值,KV)缓存、推测解码、训练轨迹和服务系统一起重做。
* 最大输出与输入、历史、工具结果和 Thinking 共同占用 1M 总预算。
GLM-5 建立 MoE、Multi-head Latent Attention(多头潜变量注意力,MLA)、DeepSeek Sparse Attention(DeepSeek 稀疏注意力,DSA)和 Agentic Engineering 主干;5.1 强化持续编码;5.2 的重点是 1M、IndexShare、新 MTP 与长程后训练。交付面包括 BFloat16(16 位脑浮点,BF16)、8-bit Floating Point(8 位浮点,FP8)和 NVIDIA 4-bit Floating Point(NVIDIA 4 位浮点,NVFP4)。它不是参数翻倍,也不是多模态新模型。
Z.ai 官方后训练 Checkpoint,MIT License。截至 2026-07-14,官方组织未发布 Base、Flash、Air、GGUF 或 INT4 版本。
适合:研究、私有化和 Engine 适配glm-5.2标准 API model ID。GLM-5.2[1m] 是 Coding Plan 客户端选择提示,不是通用 API 名。
NVIDIA 与昇腾生态的硬件优化路线,不应与 Z.ai 官方 BF16/FP8 权重混成一个口径。
适合:锁定硬件后的专项优化把 GLM-5、5.1、5.2 想成同一栋大型医院。5.2 没有再多盖一倍科室,而是重做了档案检索、会诊调度和连续值班制度,让它能接手更长、更复杂的病例。
每一层先决定“去历史哪里找”,再决定“找哪些专家加工”。前 3 层保持 Dense,后 75 层进入稀疏专家网络;MTP 是旁边反复复用的一套草稿模块。
Embedding 把词表编号变成模型可以计算的隐藏向量。词表共有 154,880 个位置。
MLA 降低每个历史 Token 的 KV 体积;Indexer 先扫历史,核心 Attention 只精看 Top-2,048。
Router 从 256 个路由专家里选 8 个,同时经过 1 个共享专家,再合并回残差流。
主输出头预测下一 Token;共享 MTP 额外猜多个未来 Token,供推测解码一次验证。
所有专家的权重都要能被设备访问。
一枚 Token 只经过被选中的少量专家。
MoE 像拥有 256 个科室的大医院:一次会诊只叫 8 个专科和 1 个全科医生,但其他科室不能从楼里消失。
1,048,576 是整场会话的总预算。System Prompt、历史、代码、工具结果、Thinking 和最终回答都从同一个“行李箱”取空间。
示例固定预留 32,768 Token 给后续工具结果和格式开销;最终回答仍受 131,072 Token 上限约束。
这是容量示意,不是平台自动替你预留的固定规则。DSA 与 IndexShare 主要解决 Indexer 和 Attention 的计算增长。
MLA、FP8 KV、CP 和分层缓存降低容量压力,但不会让 KV 消失。
噪声、冲突、时序和恶意内容变多,仍需要检索、摘要与权限过滤。
长 Prefill、排队、超时、恢复和 OOM 会把单请求能力变成系统问题。
max-num-seqs=32 起调。能跑一个 1M 请求,仍不等于具备 1M 高并发。标准 Decode 每轮只前进一步。共享 MTP 先连续写出一小段草稿,昂贵的主模型再一次并行检查;只要连续猜对超过一个,就能减少串行等待。
第一个草稿步计算 Top-k,后续草稿步复用同一组历史位置。
后续草稿步也复用第一步的 KV,避免把不同草稿隐藏态写成一串不一致的缓存。
用拒绝采样构造训练目标,让递归草稿更贴近主模型会接受的分布。
用总变差(Total Variation,TV)损失端到端压低分布差异。
基于 GLM-5.1 Backbone 和编码训练数据。它说明草稿更准,不等于端到端同幅加速。
速记员先猜“下一句大概会怎么写”,总编辑一次校对整小段。模板化代码往往更好猜,开放式创作更难;因此接受长度和收益会随任务、Batch 与 Engine 改变。
数小时任务会产生不等长的终端、工具与子 Agent 轨迹。GLM-5.2 把它们压成可学习片段,用 Critic(价值评估器)估计 Token 级优势,再用 Proximal Policy Optimization(近端策略优化,PPO)更新;并行 On-Policy Distillation(同策略蒸馏,OPD)则把十多个专长模型合回一个模型。
GLM-5.2 在长程编码、终端和 10K~100K 长文档上进入开放权重第一梯队;但官方 Agent 分数常包含 Claude Code、OpenHands、数小时预算和 400K~1M 上下文。
不同 Benchmark 使用不同 Harness 与时长:例如 HLE 最大生成 163,840,SWE-bench Pro 用 400K,Terminus-2 用 256K,FrontierSWE 用 1M。图只展示模型卡快照,不构成统一排行榜。
标准托管 API 默认开启 Thinking,且 reasoning_effort 默认 max。模型可以提出工具调用,却不会自己执行 Shell、数据库或 Model Context Protocol(模型上下文协议,MCP);Preserved Thinking 也需要客户端把历史 reasoning 原样回传。
model = "glm-5.2"国际:https://api.z.ai/api/paas/v4/
中国:https://open.bigmodel.cn/api/paas/v4/
分类、改写、抽取和短回答。可用 minimal / none 或禁用 Thinking。
low / medium 会兼容映射到 High,适合作为成本可控的起点。
能力更强,也可能先生成数万 reasoning Token;必须设置预算、超时与停止规则。
none/minimal → 不思考、low/medium → high、xhigh → max 是 Z.ai 标准 API 规则;SGLang 自部署使用 Chat Template,截至核查日只有显式 high 会降档,其他未识别值会回落到 Max。标准 API 的 thinking.clear_thinking 默认是 true。若改为 false,历史 reasoning_content 必须完整、原样、按顺序回传;Coding Plan 的默认行为与标准 API 不同。
未缓存输入 $1.40 / 1M,缓存命中 $0.26 / 1M,输出 $4.40 / 1M。Thinking 属于输出侧用量。
Active Parameters 回答“这枚 Token 算多少”,权重文件回答“整座模型要放多少”。MoE 的其余专家这一步不计算,但仍必须常驻或能被快速访问。
适合大显存多节点和质量基线;运行时还需 KV、Buffer 与安全余量。
FP8 只覆盖可转换的线性权重;文件还含 BF16/F32 张量与 Scale,不能用“753B × 1 Byte”粗算。
只量化 MoE 专家内的线性算子权重与激活;共享专家不量化,其他模块保留更高精度。
model.safetensors.index.json 的 total_size 复算,是权重 Payload,不是进程峰值显存。原页面把 BF16 的约 1,403 GiB 误写成了 1.403 TiB;正确值是 1.370 TiB。只比 FP8 文件稍大,几乎没有空间留给 KV 和运行时,不能据此宣称稳定可服务。
可以降低 GPU 门槛,但长上下文 KV、CPU 内存带宽、格式兼容和质量要重新验证。
可用的生产系统不只是一个模型 Endpoint。它还需要网关、上下文管理、Role-Based Access Control(基于角色的访问控制,RBAC)、沙箱、缓存、Checkpoint、Artifact Store 和端到端 Trace。
无需先持有 0.465~1.507 TB 权重,也不用维护 Kernel、并行和弹性。
适合:试点、波动负载、快速验证vLLM 或 SGLang 从已验证 Recipe 起步;完整 1M 不要从理论显存下限反推。
适合:稳定大流量、数据隔离文件更小,但硬件与 Kernel 绑定更强;必须对长任务和工具格式做业务 A/B。
适合:B200/B300/GB300 集群GLM-5.2 的优势最容易在大型代码库、长研究和工具任务中兑现;短问答、极低时延和资源受限场景,不必为 1M 与 753B 付出全部成本。
没有独立 GLM-5.2 完整技术报告;额外 Token、FLOPs、GPU 和训练数据细节未披露。
官方把它称为“solid 1M”,但尚无第三方 512K/1M 全面曲线;2.9× 也不是服务速度 Service-Level Agreement(服务等级协议,SLA)。
完整 Eval Runner、系统安全卡和权威安全评估不足;Anti-hack 不等于生产安全。
固定限流未公开;严格 json_schema、官方 Base 和 BF16/FP8 全量质量对照未见。
GLM-5.2 最有价值的不是 753B 这个数字,而是 MLA 压 KV、DSA 稀疏精读、IndexShare 少查目录、MTP 提高 Decode 并行度,再用长轨迹 PPO 与 Anti-hack 把它训练成 Agent。先用 20~50 个真实长任务验证成功率和完整成本,再决定是否把私有化当成一个集群项目。
架构和接口优先使用官方发布、机器可读 Config、权重索引、论文与框架 Recipe;能力结论再用独立评测校准。动态价格、版本、硬件支持和榜单均以 2026-07-14 为核查边界。
发布日期、IndexShare、MTP 与长程训练
结构、评测设置、MIT 权重与框架版本
78 层、Indexer 排布、1M 与 MTP 配置
精确字节数、分片与张量映射
复算减少的 57 组 Indexer 参数
官方 FP8 配置与权重分片
主干架构和基础训练谱系
跨层索引复用的 30B / H100 实验
Full / Shared Indexer 的实际传递路径
Agent RL、Rollout 与训练基础设施
模型 ID、上下文与最大输出
默认采样、Thinking 与 reasoning_effort
reasoning_effort 映射和上下文定义
128 个 Functions、JSON 与响应字段
Interleaved / Preserved Thinking
国际站 Token 单价快照
Blackwell 量化范围、验证硬件与评测
H200/B200/AMD 与 MTP 起点
并行、硬件和长上下文部署
Developer Preview 的 A2/A3 与长度边界
独立能力、Terminal-Bench 与动态服务快照
10K~100K 跨文档独立评测
长程软件工程 Agent 排名与 Dominance
多小时软件工程任务 Pass@1
证据边界:截至核查日,没有找到独立成篇的《GLM-5.2 Technical Report》。GLM-5 论文只解释同代主干谱系;5.2 新增机制以官方博客、模型卡和 Config 为主。独立榜单受 Provider、Harness、日期和预算影响,不写成永久排名。