生成方式
它决定模型是一个一个写、整排反复填、整块连续修,还是一次性生成。
- 自回归
- 掩码迭代
- Diffusion / Flow
- GAN
不要再把 Transformer、MoE、Diffusion 当成三个互斥选项。真实模型更像一台由多层零件拼成的机器:它怎样生成、怎样传递信息、怎样调度参数、怎样连接模态,要分开看。
“有几种模型”没有唯一答案,就像问汽车有几种:可以按能源、车身、驱动和用途分别分类。AI 架构也一样。
面向普通读者,可以先记 6 类系统;真正拆架构,要用 4 层标签。同一个模型会同时落在四层里。
它决定模型是一个一个写、整排反复填、整块连续修,还是一次性生成。
它决定当前内容怎样读取上下文、空间邻域或持续更新的历史状态。
它决定所有输入是否共享同一套参数,还是按 token、生成阶段或模态调用不同参数。
它决定不同模态只在结果处会面、单向读取、双向联合建模,还是进入共享 token 序列。
这是“系统给你做什么”的分类,不是底层神经网络的互斥分类。
把输入压成向量
搜索、分类、召回逐 token 或迭代生成
文本、代码、Codec在 token 或 latent 中生成
图像、视频、音频跨模态理解与生成
VLM、Omni学习环境怎样演化
模拟、机器人、游戏模型 + 检索 + 工具 + 控制
RAG、Agent、工作流教学器让每一列只选一个主标签,帮助建立第一张配置单;真实模型在同一轴也可能多标签,例如 Connector 与 Cross-Attention 共存、模态专用参数与 Token MoE 叠加。
按顺序逐 token 生成;用 token 间动态关系混合信息;路由器只激活少量 token 专家;只处理一种主要数据表示。
按本页的简化主标签编码,下面模型四轴一致;这不表示它没有其他并存标签。点击可回到一手来源。
2013—2026 的主线不是“下一代取代上一代”,而是旧机制逐渐变成新系统里的部件:VAE 变成压缩层,GAN 变成锐化器,Transformer 进入 DiT,参数专用化开始按 token、生成阶段和模态分工。
VAE、GAN 提出连续生成路线;Transformer 用 Attention 重写了序列建模。
BERT、GPT、T5 分化出读懂、续写和读写分工;DDPM、Flow Matching 建立连续生成新主线。
Mamba、MLA、视觉自回归与统一多模态让“上下文怎么存、模态怎么接”成为核心问题。
线性层与全注意力混合,自回归与 Flow 分工;Token MoE、阶段专家与模态专用路径分别扩展容量。
Transformer 本质上是一种“动态建立关系”的骨架。Encoder-only、Decoder-only 与 Encoder–Decoder 的差别,主要来自可见范围和读写分工,而不是 Attention 这个零件突然变了。
像阅卷老师:整篇都看完,再给文章贴标签或提炼成一个向量。
像接龙作者:每写一个词,都只能使用已经出现的内容。聊天与代码模型最常见。
像同传团队:一个人完整听懂原文,另一个人一边读取笔记一边输出译文。
“推理模型”通常不是第四种 Transformer。它多数仍使用 Decoder-only 或混合主干,能力提升更多来自推理数据、强化学习、搜索、验证器与更大的测试时计算预算。DeepSeek-R1 的公开报告就是这种拆法。
生成目标和网络骨架是两件事。Transformer 可以逐 token 写,也可以预测图像 latent 的速度;Diffusion 可以使用 U-Net,也可以使用 DiT。
“北 → 京 → 是 → …”像写小说:前文已经落笔,下一步只能继续往后写。天然适合流式输出,但后一步必须等待前一步。
文本、代码、语音 Codec token、视觉 token“今 □ 很 □” → “今天很好”像填字游戏:先放一排空格,再根据左右两边不断补全和修改。可并行改多个位置,但需要多轮网络调用。
BERT 式表示学习;MaskGIT / LLaDA 式迭代生成噪声 → 轮廓 → 主体 → 细节像雕塑或修图:每一步都更新整块 latent,不是先画左上角再画右下角。它很适合连续的图像、视频和声音。
图像、视频、音频、连续控制噪声 → Generator → 样本像造假者和鉴定师对练:生成器努力骗过判别器。推理可以很快,但训练双方容易失衡。
Vocoder、超分、实时增强、专用生成现代生图、生视频与音频系统经常把四条路径串在一起:VAE 负责压缩,Flow Transformer 负责生成 latent,GAN loss 或专用 Decoder 再恢复锐利细节。
把高维媒体压进 latent,再解码回来。今天常是 Diffusion / Flow 系统的“前后门”。
一次前向很快;今天常在声码器、超分和媒体 Decoder 中提供对抗损失,并与重建、感知损失配合。
学习各种噪声强度下应该往哪里修,质量高但通常要多次调用网络。
直接学习概率路径上的速度,采样时用 ODE solver 沿路径积分。
Full Attention 像随时翻完整档案,SSM / Linear 像维护一份持续更新的摘要。前者检索直接但历史越来越贵,后者状态稳定却可能出现信息瓶颈。
每个 Query 头各存一套 K/V
表达直接,KV 最大多个 Query 头共享 K/V
显著减少 KV Cache缓存低维 KV latent 与解耦 RoPE key
矩阵吸收可避免显式恢复完整 K/V只读取选中的历史位置
少看一些,关系成本下降把历史写进固定形状状态
状态不随序列长度线性长大状态层与完整 Attention 的混合,把低成本流式记忆和精确内容寻址放进同一主干,Qwen3-Next、Kimi Linear 属于这一路线。GLM-5.2 是另一种混合:周期性完整注意力加稀疏注意力,并让每四个稀疏层共享索引器;不要把 IndexShare 误叫成状态层。
Dense 是全员上班;MoE 是前台路由器看一眼请求,只叫少数专家来处理。专家通常替换 Transformer block 的 FFN,并不替代整个 Transformer。
行为稳定、硬件利用简单;模型越大,每个 token 的计算和权重搬运也一起增大。
总容量可以变大,激活计算增长较慢;代价是路由、负载均衡和跨卡 All-to-All。
视频可按噪声时间段选专家;Omni 也可保留模态专用路径与共享主干,但这不自动等于稀疏 MoE。
自回归视觉把图片离散化后像语言一样写;Diffusion / Flow 在连续 latent 中反复更新;混合系统先用自回归模型确定结构,再让 DiT 补足纹理、光照与高频细节。
文字和图像都变成 token 后,可使用相似的上下文、交错生成和编辑接口;代价是高分辨率视觉序列极长。
每一步同时更新整块 latent,更适合纹理、光照和连续空间;但需要多步采样与 VAE 编解码。
用紧凑 token 规划布局和对象关系,再用 DiT 生成细节;系统更强,也更复杂、更难端到端调试。
“原生多模态”描述训练和能力范围,不自动证明图像、声音与文字从输入到输出都共享完全相同的内部通路。
图像和文字各自编码,最后只比较向量。擅长海量检索,但不会自动产生复杂的跨模态生成。
视觉 Encoder 先提特征,Projector 或 Q-Former 把它翻译成 LLM 能读取的 token。成本可控,模块边界清楚。
Cross-Attention 常让一条流读取另一条记忆;MMDiT 一类 Joint Attention 则让图文表示在联合注意力中双向交换。两者不能混成同一条单向箭头。
文字、图像或音频 token 进入共享序列目标,利于交错理解生成;不同信号速率和长度会变成新难题。
实时全模态系统除了“理解得对”,还必须处理音画同步、首包延迟、打断、全双工和不同信息密度。
视频模型必须共同维持空间、时间、因果、身份、镜头与声音;逐帧独立生图没有跨帧状态,纹理和人物会随机漂移。
这一帧的人、物、文字与透视是否正确?
下一帧还是同一个人、同一件衣服和同一个房间吗?
动作、碰撞与遮挡是否真的接得上,而不只是看起来像?
对白、口型、音效和环境声是否发生在正确时刻?
广义世界模型学习环境的空间与时间规律;面向控制的世界模型还显式接收动作,让 Agent 在内部 rollout 多条未来,再比较奖励与风险。
RAG 是检索后把外部证据放进上下文。
Agent 是规划、工具、状态与重试组成的控制循环。
Reasoning model 常是原有主干经过推理数据、RL 与测试时计算训练。
下图只用公开论文、模型卡和仓库说明真实组合;闭源产品没有披露的结构不强行归类。地图展示的是路线,不是排行榜。
每张卡都指向一手论文、模型卡或官方仓库;“有公开证据”不等于“开放权重”。
671B 总参数、每 token 约 37B 激活;用 MLA 压缩 KV 表示。
80B 总参数、约 3B 激活;用线性与全注意力混合处理长上下文。
官方模型卡披露 1M 上下文;IndexShare 让每四个稀疏注意力层共享索引器,并报告相关每 token FLOPs 降低 2.9×。
把强视觉语言条件与连续 latent 生成结合;“理解核心”和“画图核心”承担不同角色。
先用自回归部分规划紧凑结构,再由扩散部分补出连续细节。
高噪声专家负责整体布局,低噪声专家负责细节;专家分工不再只按 token。
视频流和音频流保留各自时空结构,再双向交换信息以保持同步。
按自回归位置推进,但用轻量 Flow Matching head 预测连续 latent 的速度;语音再由专用残差专家补充能力。
架构选择最终要落到质量、P95 延迟、显存、失败率、可控性与开放部署边界。品牌名不能代替约束分析。
重点是向量质量、召回延迟和索引成本,不需要让模型逐 token 写长答案。
再根据长上下文和容量选择 GQA / MLA、Hybrid、Dense 或 MoE。
关注 VAE、文字渲染、参考图条件、采样步数和局部控制,而不只看 benchmark。
身份一致、因果、声音同步、时长和首帧控制共同决定路线。
首包延迟、可打断、全双工和音视频时钟通常比单轮生成质量更关键。
把动作条件、状态转移、奖励和真实闭环误差写进评估,而不是只看生成画面。
这部分适合读完全文后快速自测:如果前半句听起来仍然合理,就回到对应的四层标签再拆一次。
MoE 通常只是把 Transformer block 里的 FFN 换成专家池。一个模型完全可以同时是 Transformer、MoE 和自回归。
Diffusion 是生成目标;网络骨架可以是 U-Net,也可以是 DiT、MMDiT 或其他 Transformer。
BERT 是双向掩码训练,DiT 可预测噪声或速度;Transformer 只规定信息怎样混合。
很多系统仍有视觉 Encoder、音频 Codec、Connector 或专用生成头。统一体验不等于内部完全同路。
路由器通常只激活少量专家;总参数、激活参数和设备通信必须分开看。
它通常维护固定形状的递归状态;“不存完整 KV”不等于“什么都不存”。
它首先是训练速度场的目标;solver 才是沿速度场积分的推理算法。
现代图像与视频模型常用 VAE 把像素压进 latent,直接决定小字、细节和运动压缩上限。
广义世界模型学习环境如何演化;面向控制与规划时,还要让动作影响未来状态,并可预测奖励或终止。逼真视频只是可能的表现形式。
多数 reasoning model 仍是 Decoder-only 或其混合变体,差异常来自训练数据、RL、搜索和推理预算。
产品能力、模型卡与完整结构披露是三件事。没有一手材料时应标注未知,而不是用旧代架构硬套。
统一有利于联合建模;模块化有利于替换、调试、低延迟和不同信号速率,工程上常是混合方案。
名字会变,四层问题不会变。沿这七步读技术报告,可以把营销名词还原成数据表示、训练目标、信息流与部署代价。
文字 token、视觉 token、连续 latent、音频 codec,还是动作与状态?
Next-token、masked reconstruction、noise / velocity prediction,还是对抗目标?
Full Attention、Sparse Attention、SSM、CNN、DiT,还是混合层?
Dense、Top-k token experts、阶段专家,还是模态专用参数?
完整 KV、GQA / MLA 压缩、选址索引,还是固定状态?
逐 token、固定多步、动态 early exit,还是一次前向?
论文明确披露、官方模型卡说明、合理推断和未知,必须使用不同措辞。
混合比纯粹更重要:Attention + State、AR + Flow、共享 + 专用专家会继续增加。
表示层重新成为主战场:视觉 tokenizer、VAE、音频 codec 与状态压缩直接决定模型上限。
路由对象继续扩展:不只按 token,还会按时间、模态、任务、分辨率和计算预算路由。
统一的是语义和接口:内部仍可能保留专用流、专用编码器与不同采样时钟。
公开度本身成为变量:可复现开放模型与仅公开能力的闭源产品,需要不同证据标准。
没有唯一数字。按用户用途可先分为表示、序列生成、连续媒体、多模态、世界模型和复合系统六类;按底层架构则应使用“生成方式 × 信息骨架 × 参数组织 × 模态组织”四层标签。
2026 年主流 LLM 仍以 Transformer 为主,但越来越多模型混入线性注意力、SSM、检索式稀疏注意力或卷积。称它们为 Hybrid 比硬分成两派更准确。
它们是产品或模型家族名。公开资料可确认的能力不等于完整内部结构;没有模型卡或论文披露的部分,应保留为未知。
是。DiT 把图像或视频 latent 切成 patch/token,用 Transformer 预测噪声、速度或其他连续生成目标。它不是“文本模型直接拿来画图”,而是同类信息混合骨架服务了不同目标。
因为每个 token 只激活少量专家。但权重搬运、All-to-All 通信、batch 大小和路由不均仍会影响实际延迟,所以不能只看激活参数。
没有单向答案。自回归擅长离散、可流式、强顺序的输出;Diffusion / Flow 擅长整块连续媒体。2026 的重要趋势是把两者分工组合。
纯全注意力能直接找任意历史,但 KV 和关系成本高;纯状态模型成本稳定,却可能丢失精确内容寻址。混合架构把少量精读层与大量低成本状态层组合。
通常表示多模态数据参与了较早或较统一的训练,而不是后装一个完全独立的识图插件;但它不自动证明所有模态共享完全相同的参数通路。
通常不是。Agent 是模型外部的控制循环:规划、调用工具、读取结果、保存状态和继续执行。底层可以换用多种模型架构。
不一定。它可以在像素、token 或潜在状态中预测未来。广义上重点是学习环境动力学;若用于控制,还要检验动作条件、状态转移和闭环规划能力。
先从输出表示、P95 延迟、上下文长度、可控性、显存和开放部署边界开始,再反推生成方式、骨架和参数组织。
研究核查截至 2026 年 7 月 14 日。对结构未公开的闭源模型只讨论官方明确披露的能力,不把传闻写成架构事实。
本页以论文、官方模型卡、官方仓库和研究机构技术报告为主。对未披露架构的闭源新模型,不用社区猜测补空白。
网页负责科普与浏览;更细的定义、八个模型拆解、误区、选型和 52 条一手来源已沉淀在站点研究稿中。
architecture/ModelArchitecture/2026生成式AI主流模型架构全景.md