跳到正文
动手理解 · CONCEPT LAB

三层压缩状态,一层直接寻址完整 KV

Qwen3-Next 以 Gated DeltaNet 状态层为主,每第四层插入门控全注意力;48 层的前馈部分全部采用 512 选 10 加一个门控共享专家的 MoE。checkpoint 另带一个可重复调用的 MTP decoder block。

已经发生 正在观察 接下来
01 / 04

状态传导图

D1 DeltaNet 层 1
D2 DeltaNet 层 2
D3 DeltaNet 层 3
A4 Full Attention 层 4
NEXT 下一组

固定状态是一种有损压缩,不是无限无损记忆;并行训练 kernel 仍有额外中间量。

观察点 01

连续三层维护固定形状状态,快速吸收新 Token

Gated DeltaNet 先以 kernel=4 的短卷积处理 q、k、v,再用衰减门 α 和 delta 更新强度 β 把当前关联写入矩阵状态。每层 recurrent state 是 32×128×128 个元素,不为每个历史位置保留完整 KV。

随长度增长的状态基本固定
精确历史寻址依赖压缩
此刻要记住

状态层像容量固定、可擦写的关联记事板;解码缓存不随序列长度增长。

模型拆解 · 04 / Qwen3-Next

Qwen3-Next:三层压状态,一层回看全历史

Qwen3-Next-80B-A3B(Qwen,2025-09-10)不是单靠一个“线性注意力”标签变快。它把三份账分开优化:用 36 个 Gated DeltaNet 层压缩历史状态,用 12 个门控全注意力层保留直接寻址,用 Mixture of Experts(MoE,混合专家)让每个 token 只走一小部分前馈参数;Multi-Token Prediction(MTP,多 Token 预测)则是可选的草稿模块。

48 层 · 36 GDN + 12 Full Attention 官方简称 80B / 3B active MoE 51210 + 1 shared 原生 262,144 · 外推验证约 1.01M 预训练 15T token Apache-2.0 · 📅 2025-09-10
Qwen3-Next 总览:官方 80B/3B 简称与公开权重 81.325B 的参数口径;十二组每组三层 Gated DeltaNet 加一层门控全注意力;每层接 512 选 10 加共享专家的 MoE;GDN 状态、全注意力 KV 与 MTP 分别计费
先分清三层:3:1 是序列主干比例,80B/3B 是 MoE 参数口径,MTP 是主模型之外的可选草稿路径。把三者混成一个“3B 线性模型”,后续显存、复杂度和速度推导都会错。查看原图 ↗
01 · 版本身份

博客训练过 Base;公开集合没有 Base checkpoint

官方发布博客用 Qwen3-Next-80B-A3B-Base 做训练与基准对照,但当前官方 Hugging Face collection只有 Instruct、Thinking 及各自 8-bit Floating Point(FP8,8 位浮点)版本。因此“发布了 Base 权重”是事实错误;更准确的说法是:发布方披露并评测了 Base 训练结果,同时公开了两种后训练权重。

INSTRUCT
官方模型卡明确设为 non-thinking only:对话时不要期待它切换出 Thinking 模型的显式推理形态。
THINKING
独立的 thinking-only checkpoint。两种后训练形态不是同一权重靠开关互换。
BASE
15T-token 预训练结果出现在博客的 Base benchmark 与效率实验中;截至 2026-07-14,官方 Qwen 账号下没有对应公开 Base repo。
LICENSE
公开权重采用 Apache License 2.0。这是模型权重许可,不替代数据、输出内容与部署地区各自的合规判断。
时间边界

“Next”是 2025 年型号名,不代表核查日的最新 Qwen。后来的 Qwen3.5 与 Qwen3-Coder-Next 延续了这条混合架构路线;本页只解释 Qwen3-Next-80B-A3B 的公开权重与发布证据。

02 · 主干与参数账

12 个四层小周期;每一层后面都接 MoE

可执行配置把 48 层排成 12 × [3 × Gated DeltaNet → 1 × Gated Full Attention]。注意力类型在第 4、8、12……层切换,但前馈部分没有“稠密过渡层”:48 层全部使用 MoE

组件公开配置它决定什么
残差主干48 layers;hidden size 2048;词表 151,936所有 attention / mixer 与 MoE 共享的残差宽度
混合节奏full_attention_interval=436 层 Gated DeltaNet + 12 层 Gated Full Attention,严格按 3:1 周期排列
Full Attention16 query heads / 2 Key-Value(KV,键值)heads;head dim 256属于 Grouped-Query Attention(GQA,分组查询注意力);每层每 token 只写 2 组 K/V
位置与输出门Rotary Position Embedding(RoPE,旋转位置编码)只用于每头前 64/256 维;attention output 再乘 sigmoid gate位置子空间与内容子空间部分解耦;输出门按当前 query 调节各头结果
Gated DeltaNet16 key heads / 32 value heads;key/value dim 128;depthwise conv kernel 4固定形状递归状态与短程局部特征路径
MoE512 routed experts,Top-10;1 shared expert;expert intermediate 512前馈容量巨大,但每 token 只计算 10 个路由专家和 1 个门控共享专家
参数口径数值怎样读
官方模型卡标题80B total / 3B activated;79B non-embedding便于比较的十亿级四舍五入口径,描述主模型容量与每 token 路径
主模型配置算术79,674,391,296按 config 与公开 tensor shapes 汇总主 Causal LM;与“80B”一致
额外 MTP tensors1,650,471,424公开 checkpoint 中的 projection、norm 与唯一一个 mtp.layers.0
BFloat16(BF16,16 位脑浮点)权重索引81,324,862,720 parameters · 约 151.48 GiB模型仓库 safetensors metadata 的精确总数,包含 MTP;不是说官方“80B”造假
激活路径配置算术3.253B non-embedding parameters / token约等于官方 3B;不同统计是否计 router、norm、head 会产生小差异
3B ACTIVE 能说明

一个 token 不计算全部 512 个专家

稀疏路由把每层 routed Feed-Forward Network(FFN,前馈网络)限到 Top-10,再加共享专家、序列 mixer、router、normalization 与输出头。

3B ACTIVE 不能说明

部署时只准备 3B 权重

下一 token 可能选中别的专家,因此完整专家池仍需在加速设备、节点或可接受的 offload 层级上可寻址。

03 · 两种历史状态

GDN 写一块固定矩阵;全注意力保留逐 token KV

Gated DeltaNet(GDN,门控 Delta 网络)不是“没有记忆”,而是把到目前为止的历史折叠进固定形状矩阵。其更新可写成 Sₜ=Sₜ₋₁[αₜ(I−βₜkₜkₜᵀ)]+βₜvₜkₜᵀ,再以 oₜ=Sₜqₜ 读取:α 控制遗忘,β 控制对当前 key-value 关联的修正。

Qwen3-Next 两种历史状态:Gated DeltaNet 经短卷积和门控 delta recurrence 把历史压缩到 32 乘 128 乘 128 的固定矩阵;每第四层的 GQA 将两组 K/V 追加到随上下文增长的缓存,完整注意力输出再经过 sigmoid gate
上半条链是有损的状态压缩,下半条链是增长型 KV。全注意力提供的是本层对已有 KV 的直接寻址,并不能神奇“恢复”此前 GDN 已经丢掉的信息。查看原图 ↗
LOCAL FEATURES

kernel=4 的深度卷积先看局部

只有 q、k、v 经过短 depthwise convolution(深度卷积)与 SiLU 非线性;z 旁路卷积,留给后面的 gated RMSNorm 输出门。

STATE UPDATE

衰减旧状态,再做 delta 修正

α 可以逐步擦除旧内容;β 决定当前关联写入多少。固定容量意味着长历史必然竞争表示空间。

DIRECT ADDRESSING

每第四层仍对全部历史做 softmax

Scaled Dot-Product Attention(SDPA,缩放点积注意力)直接计算当前 query 与全部历史 key 的分数,再由 sigmoid output gate 调节结果。

batch=1、BF16 的逻辑状态算式结果
GDN recurrent state36 × 32 × 128 × 128 × 2 bytes36 MiB,不随上下文长度增长
GDN conv state36 × 8,192 channels × 4 × 2 bytes2.25 MiB;具体 kernel 可只保留所需历史并采用不同布局
Full-attention KV / token12 × 2 KV heads × 256 × K/V × 2 bytes24 KiB/token
262,144 tokens24 KiB × 262,1446 GiB full-attention KV
1,010,000 tokens24 KiB × 1,010,00023.12 GiB full-attention KV
复杂度边界

36 个 GDN 层的递归解码状态不随长度增长,不等于整个模型是纯 O(n):12 个完整注意力层的 prefill / 训练仍含二次 score 矩阵,decode 仍随历史长度读 KV。上表也只是逻辑元素账,不含权重、激活、分页、量化 scale、kernel workspace 与 allocator 碎片。

04 · 极稀疏 MoE

Top-10 前先 softmax,入选权重再归一化

Qwen3-Next 的 router 对 512 个 routed experts 产生 logits,先在全部专家上做 softmax,再取 Top-10;因为配置为 norm_topk_prob=true,十个入选概率会重新归一化。共享专家走另一条分支,其输出乘独立 sigmoid gate 后再与 routed sum 相加。

Qwen3-Next MoE:token hidden 经 512 logits、softmax、Top-10 和重新归一化后送到十个 routed experts;共享专家并行执行并乘独立 sigmoid gate;两路结果最终相加
共享专家不是“第 11 名 routed expert”:它不参加 Top-10 竞争,而且有自己的 gate。多张 Graphics Processing Unit(GPU,图形处理器)做 Expert Parallelism(EP,专家并行)时,还要支付 dispatch / combine 的 All-to-All(全互联交换)通信。查看原图 ↗
ROUTING

10/512 = 1.95%

这是 routed expert pool 内的选择率,分母只包含 512 个路由专家;它不包含共享专家和所有稠密组件。

ACTIVE PARAMETERS

3B/80B ≈ 3.75%

这是发布方对整个主模型参数路径的近似,分母不同,因此不能拿 1.95% 指责 3.75% “算错”。

SYSTEM COST

稀疏计算不等于稀疏存储

router、token 重排、跨设备通信、负载偏斜和完整权重容量仍在;小 batch 下尤其可能吃不满专家 General Matrix Multiplication(GEMM,通用矩阵乘)。

负载均衡不要套错模型
官方博客称采用 global load balancing;公开 config 同时保留 router_aux_loss_coef=0.001。这不足以推出完整训练控制器,也绝不是 DeepSeek-V3 的“selection bias + 原始 affinity”路由。能确认的执行语义是 softmax、Top-10、renormalize 与 gated shared expert。
05 · MTP / 可选草稿

权重里只有一个 MTP block;多步来自运行时复用

公开 safetensors 只有一个 mtp.layers.0。它把主模型 hidden state 与当前 draft token embedding 分别归一化、拼接并投影,再经过一个“门控全注意力 + MoE”的额外 Decoder block,最后复用主 Language Model Head(LM Head,语言模型输出头)产生下一份草稿 logits。

Qwen3-Next MTP:主模型 hidden 与当前草稿 token embedding 融合后经过唯一的 mtp.layers.0 和共享 LM head 生成草稿;推理引擎可重复调用同一 block 多步,再由主模型一次验证候选前缀
“多 Token”描述训练目标与可连续起草能力,不代表 checkpoint 内有 N 个并列预测头,也不代表候选未经目标模型验证就成为最终输出。查看原图 ↗
层级可确认事实不能偷换成
权重结构一个 projection + norm 组 + 1 个 full-attention/MoE Decoder block;复用主 output head两个、三个或任意固定数量的独立 MTP heads
2025 模型卡示例vLLM 示例设置 num_speculative_tokens=2;SGLang 示例使用 NEXTN,并单独设置 steps / draft tokens模型天生固定预测 2 个 token
当前 vLLM截至 2026-07-14,旧 qwen3_next_mtp 名称会提示弃用并映射到通用 mtp旧示例命令永远是推荐接口
速度候选由主模型验证;收益取决于接受长度、batch、kernel、并行和额外 MTP 计算发布方给出一个跨框架固定接受率或加速倍数
普通生成可以不启用 MTP;Transformers 模型卡明确提示其支持并非普遍可用加载 Qwen3-Next 就会自动获得投机解码收益
为什么可能变慢

若候选频繁被拒,系统仍支付 MTP block 的 forward、草稿采样与验证组织成本;同一个 block 连跑更多步还会积累误差。是否启用应以目标 batch、提示长度、采样参数和服务级指标做 A/B,而不是照抄“2 个 speculative tokens”。

06 · 训练、稳定性与长上下文

15T 是语料抽样;9.3% 与 10× 是厂商同系对照

发布方从 Qwen3 的 36T-token 语料中均匀抽取 15T token 训练 Base,并把效率与 Qwen3-32B-Base、Qwen3-30B-A3B 比较。数字很有价值,但博客正文没有给出完整硬件、batch、并行和 kernel 配置,因此只能当作同一团队实验环境里的相对证据

STABILITY

三处把“大激活”压回去

全注意力输出加入 query-dependent sigmoid gate;Root Mean Square Layer Normalization(RMSNorm,均方根层归一化)采用 zero-centered 参数化,即实际 scale 为 1+w;发布方还对 norm weights 做 weight decay,并在初始化时归一化 router 参数。官方将这些设计与 attention sink / massive activation 缓解联系起来,这是其训练实验结论,不是跨模型定律。

PRETRAINING

15T / 36T corpus

15T 是从 Qwen3 36T corpus 均匀采样的训练 token 数。博客报告 GPU hours 少于 Qwen3-30B-A3B 的 80%,训练计算约为 Qwen3-32B-Base 的 9.3%;二者对照分母不同,不能合并成同一句“省 90.7% GPU 时间”。

CONTEXT

262,144 原生;1,010,000 是 YaRN

max_position_embeddings=262144 是原生窗口。约 1.01M 的 RULER(What’s the Real Context Size of Your Long-Context Language Models?,长上下文评测套件)结果启用了静态 YaRN(Yet another RoPE extensioN,上下文窗口扩展方法);它不是把原生窗口改写成 1M,而且模型卡提醒固定 scaling 可能影响短文本表现。

官方发布实验Qwen 报告值证据边界
Base 训练计算Qwen3-32B-Base 的 9.3%同篇博客的厂商对照;多数而非全部所列 Base benchmarks 更高
Base GPU hours低于 Qwen3-30B-A3B 的 80%对照对象不同,不能与 9.3% 互换
4K prefill / decode7× / 4× 对 Qwen3-32B发布方环境结果;不是任意 GPU、量化和 serving engine 的固定速度
>32K prefill / decode两者均 >10× 对 Qwen3-32B博客未在正文完整披露硬件、batch 与并行配置,不能做跨系统外推
07 · 评测证据

长上下文成绩很强;通用与 Agent 基准并非全面领先

下面只复述官方 Instruct 模型卡的同表数字。它们说明发布时的相对位置,不是独立复现,也不代表 2026 年最新榜单。Judge-based(裁判模型评分)与工具环境任务还会受 judge 版本、提示模板、工具实现和运行失败影响。

Benchmark / 指标Qwen3-Next InstructQwen3-235B-A22B Instruct 2507怎样读
LiveCodeBench v656.651.8官方表内代码能力更高
Arena-Hard v282.779.2以 GPT-4.1 为 judge 的偏好评测,不是客观正确率
Aider-Polyglot49.857.3仓库编辑任务上更大的同系模型领先
TAU2-Bench Telecom13.232.5工具型 Agent 场景差距明显;不能概括为“全面媲美”
RULER 长度Qwen3-Next 80B-A3B实验口径
15 个长度平均91.8YaRN enabled;每个长度 260 samples = 13 个子任务 × 20;比较表中的 Qwen3-2507 模型另用了 Dual Chunk Attention
256K93.5
1000K80.3
这组证据支持

架构在发布方设置下兑现了长上下文效率

固定 GDN 状态、只在 12 层增长 KV,以及 512 选 10 的 FFN 路径,共同解释了相对 Qwen3-32B 的吞吐优势方向。

这组证据不支持

任何任务、硬件与长度都固定快十倍

短提示、低 batch、专家通信、MTP 接受率、量化 kernel 和显存布局都会改变瓶颈;能力表也清楚显示混合胜负。

真正的设计课

Qwen3-Next 不是用一种新模块取代 Transformer,而是把压缩历史、直接寻址、稀疏前馈、可选草稿放在不同层级组合。工程上最值得复用的不是“3:1”这个常数,而是先找清成本属于状态、计算、通信还是验证,再选择对应机制。

来源与核查 · 2026-07-14

博客给实验,配置给尺寸,代码给真实执行路径

本页优先使用 Qwen 官方博客、官方模型仓库与主流框架实现,再以两篇机制论文解释 recurrence 和 output gate。厂商 benchmark 只按其原始比较对象复述,不把相对倍数包装成通用结论。

证据层一手来源本页核查用途
发布博客Qwen3-Next: Towards Ultimate Training & Inference Efficiency2025-09-10 发布;3:1 设计、Gated Attention、512 选 10、稳定性、15T、9.3%、GPU hours 与吞吐实验
官方模型集合与模型卡Qwen3-Next collectionInstructThinking当前四个公开项、80B/3B、精确 layout、上下文、Instruct/Thinking 身份、部署示例、RULER 与通用评测
配置与权重config.jsonweight index48 层、GDN/GQA 维度、RoPE 比例、MoE、262K、router coefficient、MTP tensor 名与 BF16 总字节数
模型实现Transformers Qwen3-Next implementationGDN 投影与 recurrence、每第四层完整注意力、SDPA 后 sigmoid gate、Top-10 renormalize 与 gated shared expert
MTP 运行时vLLM qwen3_next_mtp.pyspeculative config默认一个 MTP layer、同一层按 speculative step 复用、融合 hidden 与 token embedding、共享 LM head,以及旧 method 名称到通用 mtp 的版本映射
机制论文Gated Delta Networks · ICLR 2025Gated Attention for LLMs · NeurIPS 2025Gated Delta recurrence 的精确公式;SDPA 输出门的结构、受控实验与证据边界
架构延续Qwen3-Coder-Next Technical Report确认后续代码模型沿用 Qwen3-Next 混合架构;不把 2025 型号误写为当前最新