跳到正文
ARCHITECTURE ATLAS · FOUR-LAYER MODEL TAXONOMY

AI 模型不是几选一,而是四层组合

不要再把 Transformer、MoE、Diffusion 当成三个互斥选项。真实模型更像一台由多层零件拼成的机器:它怎样生成、怎样传递信息、怎样调度参数、怎样连接模态,要分开看。

ARCHITECTURE CONFIGA × B × C × D
01
生成方式答案怎样出现?
A
02
信息骨架信息怎样混合?
B
03
参数组织哪些参数参与?
C
04
模态组织图文音视频怎样相遇?
D
组合示例 自回归 × Hybrid × MoE × Connector 四个标签可以同时成立
PLATE 01 · THE MAP

先学会“分层”,再谈分几种

“有几种模型”没有唯一答案,就像问汽车有几种:可以按能源、车身、驱动和用途分别分类。AI 架构也一样。

一句话答案

面向普通读者,可以先记 6 类系统;真正拆架构,要用 4 层标签。同一个模型会同时落在四层里。

A答案怎样出现?

生成方式

它决定模型是一个一个写、整排反复填、整块连续修,还是一次性生成。

  • 自回归
  • 掩码迭代
  • Diffusion / Flow
  • GAN
B信息怎样混合?

信息骨架

它决定当前内容怎样读取上下文、空间邻域或持续更新的历史状态。

  • Transformer / DiT
  • U-Net / CNN
  • SSM / Linear
  • Hybrid
C哪些参数参与?

参数组织

它决定所有输入是否共享同一套参数,还是按 token、生成阶段或模态调用不同参数。

  • Dense
  • Token MoE
  • 阶段专家
  • 模态专用参数
D图文音视频怎样相遇?

模态组织

它决定不同模态只在结果处会面、单向读取、双向联合建模,还是进入共享 token 序列。

  • 双塔
  • Connector
  • Cross / Joint Attention
  • 统一 Token
2026 AI 模型架构四层分类法:生成方式、信息骨架、参数组织和模态组织
读图方法:每层先选主标签,再把四层串起来;真实模型在同一层也可能多标签。MoE、Diffusion 与 Transformer 位于不同层级,因此从来不是三选一。 查看原图 ↗
面向用途

普通读者先记这 6 类

这是“系统给你做什么”的分类,不是底层神经网络的互斥分类。

01

表示模型

把输入压成向量

搜索、分类、召回
02

序列生成模型

逐 token 或迭代生成

文本、代码、Codec
03

连续媒体模型

在 token 或 latent 中生成

图像、视频、音频
04

多模态模型

跨模态理解与生成

VLM、Omni
05

世界模型

学习环境怎样演化

模拟、机器人、游戏
06

复合系统

模型 + 检索 + 工具 + 控制

RAG、Agent、工作流
INTERACTIVE SPECIMEN · MODEL BUILDER

用四个旋钮,拼出一个模型

教学器让每一列只选一个主标签,帮助建立第一张配置单;真实模型在同一轴也可能多标签,例如 Connector 与 Cross-Attention 共存、模态专用参数与 Token MoE 叠加。

A怎样生成
B信息骨架
C参数组织
D模态组织
YOUR CONFIGURATION

自回归 × Transformer / DiT × Token MoE × 单模态

按顺序逐 token 生成;用 token 间动态关系混合信息;路由器只激活少量 token 专家;只处理一种主要数据表示。

可能擅长文本、代码、Codec token 与交错序列
主要代价严格串行,长输出需要反复调用网络;还要承担 Token MoE 和单模态的工程成本。
这是按主路径编码的教学组合器:同一轴可能还有其他标签,任意组合也不一定已有成熟模型;最终以真实模型卡为准。
REAL MODELS · PRIMARY SOURCES

现实里有哪些模型这样设计?

主标签 4 / 4 · 2 个公开案例

按本页的简化主标签编码,下面模型四轴一致;这不表示它没有其他并存标签。点击可回到一手来源。

PLATE 02 · EVOLUTION

前世今生:新路线没有简单消灭旧路线

2013—2026 的主线不是“下一代取代上一代”,而是旧机制逐渐变成新系统里的部件:VAE 变成压缩层,GAN 变成锐化器,Transformer 进入 DiT,参数专用化开始按 token、生成阶段和模态分工。

2013 到 2026 生成路径、序列骨架、参数组织和多模态架构演进时间轴
时间轴强调四条并行脉络。2026 的关键词不是单一赢家,而是组合、压缩、稀疏、流式与跨模态同步。 查看原图 ↗

生成模型与序列骨架各自成形

VAE、GAN 提出连续生成路线;Transformer 用 Attention 重写了序列建模。

预训练与扩散进入规模化

BERT、GPT、T5 分化出读懂、续写和读写分工;DDPM、Flow Matching 建立连续生成新主线。

状态、稀疏与统一 token

Mamba、MLA、视觉自回归与统一多模态让“上下文怎么存、模态怎么接”成为核心问题。

混合系统成为常态

线性层与全注意力混合,自回归与 Flow 分工;Token MoE、阶段专家与模态专用路径分别扩展容量。

PLATE 03 · TRANSFORMER FORMS

同样叫 Transformer,三种主干干的活不同

Transformer 本质上是一种“动态建立关系”的骨架。Encoder-only、Decoder-only 与 Encoder–Decoder 的差别,主要来自可见范围和读写分工,而不是 Attention 这个零件突然变了。

READ

Encoder-only

先完整读懂

像阅卷老师:整篇都看完,再给文章贴标签或提炼成一个向量。

擅长
分类、检索、抽取、Embedding
代价
不会天然从左到右持续写长答案。
WRITE

Decoder-only

看左边再续写

像接龙作者:每写一个词,都只能使用已经出现的内容。聊天与代码模型最常见。

擅长
开放式生成、聊天、代码、工具调用
代价
生成严格串行,长历史还会带来 KV Cache。
READ → WRITE

Encoder–Decoder

读写分工

像同传团队:一个人完整听懂原文,另一个人一边读取笔记一边输出译文。

擅长
翻译、摘要、TTS、长条件转换
代价
有两套角色,训练和部署组织更复杂。
Encoder-only、Decoder-only 和 Encoder-Decoder 三种 Transformer 主干对比
白话记忆:Encoder-only 是阅卷,Decoder-only 是接龙,Encoder–Decoder 是读写分工。 查看原图 ↗
白话但重要

“推理模型”通常不是第四种 Transformer。它多数仍使用 Decoder-only 或混合主干,能力提升更多来自推理数据、强化学习、搜索、验证器与更大的测试时计算预算。DeepSeek-R1 的公开报告就是这种拆法。

PLATE 04 · GENERATION

答案究竟怎样出现?四种动作最容易记

生成目标和网络骨架是两件事。Transformer 可以逐 token 写,也可以预测图像 latent 的速度;Diffusion 可以使用 U-Net,也可以使用 DiT。

AR一个接一个

自回归

“北 → 京 → 是 → …”

像写小说:前文已经落笔,下一步只能继续往后写。天然适合流式输出,但后一步必须等待前一步。

文本、代码、语音 Codec token、视觉 token
MASK整排反复填

掩码迭代

“今 □ 很 □” → “今天很好”

像填字游戏:先放一排空格,再根据左右两边不断补全和修改。可并行改多个位置,但需要多轮网络调用。

BERT 式表示学习;MaskGIT / LLaDA 式迭代生成
FLOW整块连续修

Diffusion / Flow

噪声 → 轮廓 → 主体 → 细节

像雕塑或修图:每一步都更新整块 latent,不是先画左上角再画右下角。它很适合连续的图像、视频和声音。

图像、视频、音频、连续控制
GAN生成器一次出稿

对抗生成

噪声 → Generator → 样本

像造假者和鉴定师对练:生成器努力骗过判别器。推理可以很快,但训练双方容易失衡。

Vocoder、超分、实时增强、专用生成
自回归、掩码迭代、Diffusion Flow 和 GAN 四种生成方式对比
判断生成方式时,重点看依赖是否串行、网络调用多少次、输出是离散 token 还是连续 latent。 查看原图 ↗
CONTINUOUS MEDIA

连续媒体不是只有 Diffusion

现代生图、生视频与音频系统经常把四条路径串在一起:VAE 负责压缩,Flow Transformer 负责生成 latent,GAN loss 或专用 Decoder 再恢复锐利细节。

01

VAE

压缩机

把高维媒体压进 latent,再解码回来。今天常是 Diffusion / Flow 系统的“前后门”。

02

GAN

高速锐化器

一次前向很快;今天常在声码器、超分和媒体 Decoder 中提供对抗损失,并与重建、感知损失配合。

03

Diffusion

多步去噪

学习各种噪声强度下应该往哪里修,质量高但通常要多次调用网络。

04

Flow Matching

速度场导航

直接学习概率路径上的速度,采样时用 ODE solver 沿路径积分。

VAE、GAN、Diffusion 和 Flow Matching 四条连续生成路径
四条路径的训练信号、推理次数与现代系统角色不同;它们经常是流水线伙伴,而不是互斥竞品。 查看原图 ↗
PLATE 05 · MEMORY

长上下文之争,本质是“历史怎样抵达现在”

Full Attention 像随时翻完整档案,SSM / Linear 像维护一份持续更新的摘要。前者检索直接但历史越来越贵,后者状态稳定却可能出现信息瓶颈。

01

MHA

每个 Query 头各存一套 K/V

表达直接,KV 最大
02

MQA / GQA

多个 Query 头共享 K/V

显著减少 KV Cache
03

MLA

缓存低维 KV latent 与解耦 RoPE key

矩阵吸收可避免显式恢复完整 K/V
04

Sparse Attention

只读取选中的历史位置

少看一些,关系成本下降
05

State / SSM

把历史写进固定形状状态

状态不随序列长度线性长大
MHA、GQA、MLA、稀疏注意力和固定状态五种长上下文记忆方法
这些机制分别压缩 KV、减少可见位置或把历史写入固定状态,而且可以在同一个模型里组合。 查看原图 ↗
Full Attention、SSM Linear Attention 和 Hybrid 序列骨架的数据流对比
部分长上下文 Hybrid 的折中:大量低成本状态层处理大部分序列,少量完整 Attention 层负责直接内容寻址;另一类模型则混合完整与稀疏 Attention。 查看原图 ↗
为什么 Hybrid 变多?

状态层与完整 Attention 的混合,把低成本流式记忆和精确内容寻址放进同一主干,Qwen3-Next、Kimi Linear 属于这一路线。GLM-5.2 是另一种混合:周期性完整注意力加稀疏注意力,并让每四个稀疏层共享索引器;不要把 IndexShare 误叫成状态层。

PLATE 06 · PARAMETER ORGANIZATION

Dense 与 MoE:不是两种生成方式,是两种“养参数”的办法

Dense 是全员上班;MoE 是前台路由器看一眼请求,只叫少数专家来处理。专家通常替换 Transformer block 的 FFN,并不替代整个 Transformer。

DENSE

所有 token 走同一套参数

行为稳定、硬件利用简单;模型越大,每个 token 的计算和权重搬运也一起增大。

TOKEN MoE

每个 token 选择 Top-k 专家

总容量可以变大,激活计算增长较慢;代价是路由、负载均衡和跨卡 All-to-All。

SPECIALIZATION

路由与专用化对象扩展

视频可按噪声时间段选专家;Omni 也可保留模态专用路径与共享主干,但这不自动等于稀疏 MoE。

Dense FFN 与 Token MoE 路由数据流,以及阶段专家和模态专用参数扩展
看 MoE 必须同时看:总参数、激活参数、专家分布、通信、batch 和权重搬运。只报一个参数量没有意义。 查看原图 ↗
PLATE 07 · VISION

图像生成也有“写 token”“修 latent”和“先规划再执行”

自回归视觉把图片离散化后像语言一样写;Diffusion / Flow 在连续 latent 中反复更新;混合系统先用自回归模型确定结构,再让 DiT 补足纹理、光照与高频细节。

视觉自回归、Diffusion Flow 和自回归加 DiT 混合图像生成路线
类比:自回归像先列施工清单,Flow 像在整张画布上持续修正,混合路线则让规划师与画师分工。 查看原图 ↗
AR

统一 token 的诱惑

文字和图像都变成 token 后,可使用相似的上下文、交错生成和编辑接口;代价是高分辨率视觉序列极长。

FLOW

连续细节的优势

每一步同时更新整块 latent,更适合纹理、光照和连续空间;但需要多步采样与 VAE 编解码。

HYBRID

结构与细节分工

用紧凑 token 规划布局和对象关系,再用 DiT 生成细节;系统更强,也更复杂、更难端到端调试。

PLATE 08 · MULTIMODAL

多模态不是一种架构,至少有四种连接方式

“原生多模态”描述训练和能力范围,不自动证明图像、声音与文字从输入到输出都共享完全相同的内部通路。

双塔、Connector、Cross 或 Joint Attention 和统一 Token 四种多模态融合架构
融合越早,联合建模越直接;模块越独立,替换、调试和按模态优化越容易。没有一条路线在所有目标上都占优。 查看原图 ↗
01

双塔

图像和文字各自编码,最后只比较向量。擅长海量检索,但不会自动产生复杂的跨模态生成。

02

Connector

视觉 Encoder 先提特征,Projector 或 Q-Former 把它翻译成 LLM 能读取的 token。成本可控,模块边界清楚。

03

Cross / Joint Attention

Cross-Attention 常让一条流读取另一条记忆;MMDiT 一类 Joint Attention 则让图文表示在联合注意力中双向交换。两者不能混成同一条单向箭头。

04

统一 Token

文字、图像或音频 token 进入共享序列目标,利于交错理解生成;不同信号速率和长度会变成新难题。

OMNI ≠ ONE PIPE

统一体验背后,仍可能有三种组织思路

实时全模态系统除了“理解得对”,还必须处理音画同步、首包延迟、打断、全双工和不同信息密度。

Thinker-Talker、音视频双流和统一流式 Token 三种 Omni 模型组织架构
Thinker–Talker 便于语义与声学分工;双流保留音频和视频专长;统一 token 流追求原生交错与全双工。 查看原图 ↗
PLATE 09 · VIDEO & AUDIO

视频不是很多张图片,声音也不是文字附件

视频模型必须共同维持空间、时间、因果、身份、镜头与声音;逐帧独立生图没有跨帧状态,纹理和人物会随机漂移。

Video DiT 将视频压缩为时空 token 并通过 Flow 生成再解码的数据流
主流 Video DiT 路线:3D / causal VAE 压缩时间与空间,时空 token 进入 DiT / Flow,再解码为连续帧。 查看原图 ↗
SPACE

空间

这一帧的人、物、文字与透视是否正确?

TIME

时间

下一帧还是同一个人、同一件衣服和同一个房间吗?

CAUSE

因果

动作、碰撞与遮挡是否真的接得上,而不只是看起来像?

SOUND

声音

对白、口型、音效和环境声是否发生在正确时刻?

PLATE 10 · WORLD MODELS

世界模型:重点不是“画得像”,而是“世界怎样演化”

广义世界模型学习环境的空间与时间规律;面向控制的世界模型还显式接收动作,让 Agent 在内部 rollout 多条未来,再比较奖励与风险。

世界模型从当前状态和动作预测下一状态,再由策略选择动作的闭环
图中展示面向控制的世界模型闭环:状态与动作共同决定下一状态。广义的生成式环境模拟器未必同时提供策略、奖励或终止头。 查看原图 ↗
不要并列

Agent、RAG、Reasoning 是系统或训练层,不是固定底座架构

RAG 是检索后把外部证据放进上下文。

Agent 是规划、工具、状态与重试组成的控制循环。

Reasoning model 常是原有主干经过推理数据、RL 与测试时计算训练。

PLATE 11 · 2026 LANDSCAPE

站在 2026 年看:主流是并存,更是跨层组合

下图只用公开论文、模型卡和仓库说明真实组合;闭源产品没有披露的结构不强行归类。地图展示的是路线,不是排行榜。

2026 文本、图像、视频、音频和全模态交互的主流模型架构地图
同一模态并存多条路线:文本有 Dense、MoE、Hybrid 与 Diffusion;图像有 Flow、MMDiT、AR + DiT 与统一自回归。 查看原图 ↗
EIGHT DOCUMENTED SPECIMENS

把 8 个有一手披露的模型拆成四层配置单

每张卡都指向一手论文、模型卡或官方仓库;“有公开证据”不等于“开放权重”。

文本 / 代码

DeepSeek-V3 ↗

  1. A自回归
  2. BTransformer + MLA
  3. C稀疏 MoE
  4. D文本 Token

671B 总参数、每 token 约 37B 激活;用 MLA 压缩 KV 表示。

文本 / 代码

Qwen3-Next ↗

  1. A自回归
  2. BGated DeltaNet + Attention
  3. C稀疏 MoE
  4. D文本 Token

80B 总参数、约 3B 激活;用线性与全注意力混合处理长上下文。

文本 / Agent

GLM-5.2 ↗

  1. A自回归
  2. BDSA + IndexShare
  3. C753B 稀疏 MoE
  4. D文本与工具

官方模型卡披露 1M 上下文;IndexShare 让每四个稀疏注意力层共享索引器,并报告相关每 token FLOPs 降低 2.9×。

图像

Qwen-Image-2.0 ↗

  1. A连续 latent 去噪
  2. B多模态 DiT
  3. C参数组织未公开
  4. D图文条件

把强视觉语言条件与连续 latent 生成结合;“理解核心”和“画图核心”承担不同角色。

图像

GLM-Image ↗

  1. AAR + Diffusion
  2. B语言规划 + DiT
  3. C分阶段模块
  4. D图文 Token / latent

先用自回归部分规划紧凑结构,再由扩散部分补出连续细节。

视频

Wan2.2 ↗

  1. AFlow / Diffusion
  2. BVideo DiT
  3. C时间步 MoE
  4. D时空 latent

高噪声专家负责整体布局,低噪声专家负责细节;专家分工不再只按 token。

音视频

LTX-2 ↗

  1. A连续生成
  2. B音频 / 视频双流
  3. C模态专用参数
  4. D双向 Cross-Attn

视频流和音频流保留各自时空结构,再双向交换信息以保持同步。

音频

AudioCALM ↗

  1. A连续 latent AR
  2. BBlock-causal AR-Flow
  3. C语音残差专家
  4. D文本 / 音频 latent

按自回归位置推进,但用轻量 Flow Matching head 预测连续 latent 的速度;语音再由专用残差专家补充能力。

PLATE 12 · DECISION

不要先问谁最强,先问你要输出什么

架构选择最终要落到质量、P95 延迟、显存、失败率、可控性与开放部署边界。品牌名不能代替约束分析。

从表示、离散序列、连续媒体和行动后果选择模型架构的决策树
选型顺序:输出表示 → 生成依赖 → 历史保存 → 参数激活 → 模态连接 → 部署约束。 查看原图 ↗
搜索 / 分类

Encoder 或双塔

重点是向量质量、召回延迟和索引成本,不需要让模型逐 token 写长答案。

聊天 / 代码 / 工具

AR Decoder + KV 策略

再根据长上下文和容量选择 GQA / MLA、Hybrid、Dense 或 MoE。

图片 / 编辑

Flow / Diffusion 或 Hybrid

关注 VAE、文字渲染、参考图条件、采样步数和局部控制,而不只看 benchmark。

视频 / 带声视频

Video DiT + 时空压缩

身份一致、因果、声音同步、时长和首帧控制共同决定路线。

实时语音 / 数字人

Codec / Flow + 流式组织

首包延迟、可打断、全双工和音视频时钟通常比单轮生成质量更关键。

机器人 / 环境

World Model + Policy

把动作条件、状态转移、奖励和真实闭环误差写进评估,而不是只看生成画面。

PLATE 13 · MYTH CABINET

十二个最容易混在一起的概念

这部分适合读完全文后快速自测:如果前半句听起来仍然合理,就回到对应的四层标签再拆一次。

01MoE 是 Transformer 的替代品+

MoE 通常只是把 Transformer block 里的 FFN 换成专家池。一个模型完全可以同时是 Transformer、MoE 和自回归。

02Diffusion 一定使用 U-Net+

Diffusion 是生成目标;网络骨架可以是 U-Net,也可以是 DiT、MMDiT 或其他 Transformer。

03Transformer 都是自回归+

BERT 是双向掩码训练,DiT 可预测噪声或速度;Transformer 只规定信息怎样混合。

04多模态就是一套参数吃所有原始信号+

很多系统仍有视觉 Encoder、音频 Codec、Connector 或专用生成头。统一体验不等于内部完全同路。

05MoE 每次都算全部参数+

路由器通常只激活少量专家;总参数、激活参数和设备通信必须分开看。

06SSM 完全没有缓存+

它通常维护固定形状的递归状态;“不存完整 KV”不等于“什么都不存”。

07Flow Matching 只是一个更快采样器+

它首先是训练速度场的目标;solver 才是沿速度场积分的推理算法。

08VAE 已经过时+

现代图像与视频模型常用 VAE 把像素压进 latent,直接决定小字、细节和运动压缩上限。

09世界模型就是更长的视频模型+

广义世界模型学习环境如何演化;面向控制与规划时,还要让动作影响未来状态,并可预测奖励或终止。逼真视频只是可能的表现形式。

10推理模型是一种全新网络+

多数 reasoning model 仍是 Decoder-only 或其混合变体,差异常来自训练数据、RL、搜索和推理预算。

11闭源产品越新,架构信息越完整+

产品能力、模型卡与完整结构披露是三件事。没有一手材料时应标注未知,而不是用旧代架构硬套。

12统一模型一定优于模块化系统+

统一有利于联合建模;模块化有利于替换、调试、低延迟和不同信号速率,工程上常是混合方案。

PLATE 14 · READING METHOD

以后看到任何新模型,用七步拆解

名字会变,四层问题不会变。沿这七步读技术报告,可以把营销名词还原成数据表示、训练目标、信息流与部署代价。

  1. 01

    输入输出是什么表示

    文字 token、视觉 token、连续 latent、音频 codec,还是动作与状态?

  2. 02

    训练目标是什么

    Next-token、masked reconstruction、noise / velocity prediction,还是对抗目标?

  3. 03

    主干怎样混合信息

    Full Attention、Sparse Attention、SSM、CNN、DiT,还是混合层?

  4. 04

    参数怎样组织

    Dense、Top-k token experts、阶段专家,还是模态专用参数?

  5. 05

    历史怎样保存

    完整 KV、GQA / MLA 压缩、选址索引,还是固定状态?

  6. 06

    一次输出调用几次网络

    逐 token、固定多步、动态 early exit,还是一次前向?

  7. 07

    事实与推断分开

    论文明确披露、官方模型卡说明、合理推断和未知,必须使用不同措辞。

2026 → NEXT

五个更确定的趋势

混合比纯粹更重要:Attention + State、AR + Flow、共享 + 专用专家会继续增加。

表示层重新成为主战场:视觉 tokenizer、VAE、音频 codec 与状态压缩直接决定模型上限。

路由对象继续扩展:不只按 token,还会按时间、模态、任务、分辨率和计算预算路由。

统一的是语义和接口:内部仍可能保留专用流、专用编码器与不同采样时钟。

公开度本身成为变量:可复现开放模型与仅公开能力的闭源产品,需要不同证据标准。

PLATE 15 · FAQ

初学者常问的十二个问题

Q01主流模型到底可以分为几种?展开

没有唯一数字。按用户用途可先分为表示、序列生成、连续媒体、多模态、世界模型和复合系统六类;按底层架构则应使用“生成方式 × 信息骨架 × 参数组织 × 模态组织”四层标签。

Q02大语言模型都是 Transformer 吗?展开

2026 年主流 LLM 仍以 Transformer 为主,但越来越多模型混入线性注意力、SSM、检索式稀疏注意力或卷积。称它们为 Hybrid 比硬分成两派更准确。

Q03ChatGPT、Claude、Gemini 属于什么架构?展开

它们是产品或模型家族名。公开资料可确认的能力不等于完整内部结构;没有模型卡或论文披露的部分,应保留为未知。

Q04DiT 是 Transformer 吗?展开

是。DiT 把图像或视频 latent 切成 patch/token,用 Transformer 预测噪声、速度或其他连续生成目标。它不是“文本模型直接拿来画图”,而是同类信息混合骨架服务了不同目标。

Q05MoE 为什么参数很大却未必很慢?展开

因为每个 token 只激活少量专家。但权重搬运、All-to-All 通信、batch 大小和路由不均仍会影响实际延迟,所以不能只看激活参数。

Q06自回归和 Diffusion 谁更先进?展开

没有单向答案。自回归擅长离散、可流式、强顺序的输出;Diffusion / Flow 擅长整块连续媒体。2026 的重要趋势是把两者分工组合。

Q07为什么长上下文越来越多 Hybrid?展开

纯全注意力能直接找任意历史,但 KV 和关系成本高;纯状态模型成本稳定,却可能丢失精确内容寻址。混合架构把少量精读层与大量低成本状态层组合。

Q08原生多模态是什么意思?展开

通常表示多模态数据参与了较早或较统一的训练,而不是后装一个完全独立的识图插件;但它不自动证明所有模态共享完全相同的参数通路。

Q09Agent 是一种模型架构吗?展开

通常不是。Agent 是模型外部的控制循环:规划、调用工具、读取结果、保存状态和继续执行。底层可以换用多种模型架构。

Q10世界模型一定生成像素吗?展开

不一定。它可以在像素、token 或潜在状态中预测未来。广义上重点是学习环境动力学;若用于控制,还要检验动作条件、状态转移和闭环规划能力。

Q11该怎样选择架构?展开

先从输出表示、P95 延迟、上下文长度、可控性、显存和开放部署边界开始,再反推生成方式、骨架和参数组织。

Q12这篇专题的时间边界是什么?展开

研究核查截至 2026 年 7 月 14 日。对结构未公开的闭源模型只讨论官方明确披露的能力,不把传闻写成架构事实。

RESEARCH LEDGER

一手来源与证据边界

本页以论文、官方模型卡、官方仓库和研究机构技术报告为主。对未披露架构的闭源新模型,不用社区猜测补空白。

完整研究底稿

网页负责科普与浏览;更细的定义、八个模型拆解、误区、选型和 52 条一手来源已沉淀在站点研究稿中。

architecture/ModelArchitecture/2026生成式AI主流模型架构全景.md