跳到正文
EARLY-FUSION LOOM · FIELD 04
模型专题 · Meta Llama 4

把文字与图像,织进同一条
专家网络

Llama 4 不是把 Llama 3 简单做大。它先用 Early Fusion 把图像与文本排进同一序列,再用共享专家 + Top-1 路由控制每步计算,最后以 iRoPE 的局部与全局交错,把 Scout 的输入窗口推到 10M。

一句话判断

Scout 是超长上下文路线,Maverick 是综合质量路线。两者都只有约 17B 参数在一枚 Token 上激活,但仍须保存 109B 或约 400B 的完整权重。

蓝色文本片段与橙色图像块在左侧汇成紫色 Token 流,穿过层叠主干和每步点亮一名路由专家的节点,右侧分向长路径与更大的专家网络
总览:图文先汇成同一条 Token 序列,再让共享专家与每步选中的一名路由专家共同加工;插画只表达直觉,精确层数、范围和显存账见后文 SVG。
RELEASED2Scout / Maverick
ACTIVE17B每枚 Token 约激活
LAYERS48统一语言主干
ROUTING1 + 1共享 + Top-1
SCOUT10M官方上下文
MAVERICK1M官方上下文
01 · 家族状态

真正可下载的是两名学生,不是那位 2T 教师

截至 2026-07-17,Meta 官方目录仍只列 Scout 与 Maverick 两个可下载的 Llama 4 型号。Behemoth 是蒸馏教师的发布期预览,仍没有官方权重、模型卡或正式技术报告。010203

Llama 4 家族状态图:Scout 109B 总参 17B 激活和 Maverick 400B 总参 17B 激活为开放权重,Behemoth 接近 2T 总参 288B 激活但仍是未发布教师预览
“参与蒸馏”不等于“已经发布”:Behemoth 教过 Maverick,但公众目前拿到的仍是 Scout 与 Maverick。 查看原图 ↗
开放权重 · 长上下文

Scout

109B total / 17B active

16 个路由专家,官方 10M 输入;更适合超长代码库、文档和多图材料。06

开放权重 · 综合质量

Maverick

约 400B total / 17B active

128 个路由专家,官方 1M 输入;更偏视觉推理、知识问答与通用助手。07

教师预览 · 未发布

Behemoth

近 2T total / 288B active

用于教师蒸馏和能力展示;没有一手依据证明它已经发布或已经取消。

白话先懂

把它们想成同一所学校:Scout 擅长读超长材料,Maverick 综合成绩更好,Behemoth 是给学生示范解题的大老师。老师参与课堂,不代表学校把老师的大脑和全部教材发给了公众。

类比的边界是:这不是三个尺寸递增、可以任意互换的同款模型。Scout 与 Maverick 的专家数量、FFN 排布、上下文和部署资源不同;Behemoth 目前更不能被当成一个可选 Endpoint。

工程含义

模型清单、权重清单和产品宣传必须分开维护;任何 Behemoth 上线日期都应标为未知,而不是从旧公告推断。

02 · 型号选择

先问材料有多长,再问质量要多高

Scout 与 Maverick 都写着 17B Active,但一个把资源投向长上下文,另一个把容量投向更多专家。下面先看决策图,再用交互把任务、窗口和硬件放到同一张选择单。

Llama 4 选型决策树:超长代码库和文档优先 Scout,综合质量和视觉推理优先 Maverick,本地资源不足时优先托管服务并核对 Provider 实际窗口
模型卡窗口只是第一层;真正可用长度还受推理框架、Endpoint 限额、KV Cache(Key-Value Cache,键值缓存)与预算共同约束。 查看原图 ↗
交互 · 选型织片

把你的任务挂到织机上

主要任务
最长输入
可用资源
推荐起点 Scout · 托管服务

超长材料是首要约束;先用 Scout 在 Provider 实际开放的窗口内验证检索和跨章节推理。

不要直接把模型卡 10M 当成 Endpoint 保证值。
白话先懂

选模型像选车辆:Scout 更像长途货车,能挂很长的材料车厢;Maverick 更像动力和配置更高的综合车型,面对复杂图文任务更有优势。没有自己的车库和维修队,就先租云端车辆。

类比的边界是:窗口更长不等于每个位置上的推理都同样可靠,综合分数更高也不等于你的行业数据一定更好。最后选择仍要经过同 Prompt、同精度、同数据集的复跑。

工程含义

先固定真实 P95 输入长度,再决定型号;绝大多数业务不应为了少量极长请求,让所有请求长期承担 10M 资源配置。

03 · 总体架构

两种输入先汇流,再走同一条 48 层主干

文本直接变成 Token;图片先切块、编码并投影为 5120 维视觉表示。两条线在主干前汇合,之后共同经过 Attention、Dense 或 MoE FFN(Feed-Forward Network,前馈网络),最终仍按自回归方式输出文本或代码 Token。1012

Llama 4 完整架构:文本 Tokenizer 与图片切块、视觉编码、Pixel Shuffle、Adapter 和 Linear Projection 汇成统一序列,经过 48 层 iRoPE Attention 与 Dense 或 MoE FFN,最后由 LM Head 输出文本代码
原生多模态发生在输入与共同训练阶段;输出仍是文本和代码,不是音频、图片或视频生成。 查看原图 ↗
01 · 感知

文本 / 图片

文字查 Token Embedding;图片经视觉编码器与两级投影进入语言维度。

02 · 汇流

Early Fusion

视觉 Token 填入图片占位位置,与文本排成同一条因果序列。

03 · 读取

iRoPE Attention

三层读取当前 8K 分块,第四层周期性回看全部历史。

04 · 加工

Dense / MoE

Dense 直接变换;MoE 同时走共享专家和一个路由专家。

05 · 输出

LM Head

48 层表示变成下一枚文本或代码 Token 的概率。

白话先懂

可以把整套模型想成一台织机:文字是蓝线,图片是橙线。视觉编码器先把图片纤维整理成机器能接受的线,两种线从较早位置就一起进入同一块布,而不是最后才把一张图片说明贴上去。

类比的边界是:图片并没有被先翻译成一段可读文字,48 层也不是 48 台独立机器。它们是连续向量,统一隐藏状态在同一条主干里被注意力、FFN 和残差反复改写。

工程含义

预处理器、图片尺寸、切块策略和 Prompt Template 都是模型协议的一部分;换错 Processor 会在进入主干前就破坏对齐。

04 · Early Fusion

图片不是一段外包摘要,而是一组参与注意力的 Token

官方预处理会保持宽高比缩放、补边和切块;视觉 Transformer 提取 Patch(图像块)表示,Pixel Shuffle(像素重排)减少空间 Token,Adapter MLP(适配器多层感知机)与独立 Linear(线性投影)再把它们对齐到语言 hidden size 5120。图片占位与消息边界也属于 Prompt Format 协议。121314

Llama 4 图片 Early Fusion 数据流:任意尺寸图片选择画布、保比例缩放、补边、切块,进入视觉 Transformer、Pixel Shuffle、Adapter MLP 和 Linear 5120 投影,再与文本 Token 形成统一序列
“Early”不是跳过视觉编码器,而是视觉表示在统一语言主干前就与文本汇合,并在训练中共同出现。 查看原图 ↗
保比例缩放补边与切块视觉编码压缩与投影统一 Token 序列
白话先懂

传统级联更像先让看图助手写一段摘要,再把摘要交给语言助手;Early Fusion 则像把图片拆成特殊词片,与问题一起装订进同一本练习册,让主干学习图块与句子之间的对应关系。

类比的边界是:视觉 Token 不是自然语言词语,也不会自动保留每个原始像素。切块、Pixel Shuffle 和投影都在压缩信息,小字 OCR(Optical Character Recognition,光学字符识别)、切块边缘与超长图仍可能丢细节。

工程含义

图片数量和分辨率会转化为额外 Token、Prefill 与 KV 压力;多图能力不是免费附件,应单独记录图片 Token 和首 Token 延迟。

05 · 单层路径

Attention 负责找资料,FFN 负责加工资料

一枚 Token 进入每层后,先经 RMSNorm(Root Mean Square Layer Normalization,均方根归一化)与 GQA(Grouped-Query Attention,分组查询注意力)混合序列信息,再经第二次 RMSNorm 进入 Dense 或 MoE FFN(Feed-Forward Network,前馈网络)。两次残差旁路都保留原表示,让 48 层逐步修正而不是每层推倒重来;具体几何以两份 Checkpoint 配置为准。2324

Llama 4 单层 Token 路径:输入隐藏状态经 RMSNorm、局部 RoPE 或全局 NoPE Attention、残差相加,再经 RMSNorm、Dense 或共享专家加 Top-1 MoE FFN、残差相加进入下一层
Attention 与 FFN 是一层内的两种工作:前者读取上下文,后者对当前表示做非线性变换。 查看原图 ↗
输入hidden 5120同一枚 Token 的当前表示
Attention40Q / 8KVGQA 减少 KV Head
FFNDense 或 MoE由型号与层号决定
重复48 层最后进入 LM Head
白话先懂

读一道题时,Attention 像翻资料并圈出相关句子,FFN 像在草稿纸上整理和推导。残差旁路则像保留原题复印件,防止每次加工都把前面的关键信息完全覆盖。

类比的边界是:模型没有人类可读的“资料页”和“草稿步骤”。这些操作是高维矩阵变换;即便 Attention 看到了正确位置,后续 FFN 也可能组合错误,反过来亦然。

工程含义

性能优化不能只盯 MoE;Attention Kernel、KV 格式、FFN 专家通信与残差融合都会影响端到端吞吐。

06 · 稀疏专家

不是 128 位专家会诊,而是全科 + 一名专科

每个 MoE(Mixture of Experts,混合专家)层都包含一个所有 Token 必经的共享专家。Router(路由器)先按原始 logits(未归一化分数)选择 Top-1 路由专家,再对被选分数应用 sigmoid 得到门值;被选专家与共享专家的输出相加后才回到残差主路。11

Llama 4 MoE 路由:Token 同时进入共享专家和 Router;Router 先按原始 logits 从 Scout 16 个或 Maverick 128 个路由专家中选 Top-1,再用 sigmoid 把选中分数变为门值 s,以 s 乘 Token hidden 后送入被选专家,最后与共享专家输出相加
身份与门值是两步:先在原始 logits 上选 Top-1,再对选中分数做 sigmoid 并缩放专家输入;未选专家不算,但完整专家权重仍须保存。 查看原图 ↗
共享支路1 个必经

所有 Token 的通用变换

+
路由支路16 / 128 选 1

训练形成的稀疏分工

=
本层回主干hidden 5120

约 17B Active 是模型级路径口径

白话先懂

它像医院分诊:每位患者先见全科医生,再由分诊台送到一个最合适的专科。这样每次不必召集全部专家,却能把不同知识容量分散到更大的专家库里。

类比的边界是:路由专家并不天然对应“数学科”或“法语科”。分工是训练自动形成的高维模式,同一专家可能同时处理多种语言和概念,不能凭几个样本给它贴固定标签。

工程含义

MoE 节省的是每 Token 计算,不是权重容量;多卡部署还会新增 Expert Parallel、负载不均和 All-to-All 通信问题。

07 · 48 层节奏

Scout 每层请专家,Maverick 一层 Dense、一层 MoE

两者语言主干都是 48 层,但 FFN 节奏不同:Scout 每层都是 MoE;Maverick 按一号层计数为奇数 Dense、偶数 MoE,共 24 个 Dense 与 24 个 MoE 层。2324

Llama 4 48 层 FFN 排布对照:Scout 第 1 到 48 层全部为 16 选 1 加共享专家的 MoE,Maverick 从第 1 层 Dense、第 2 层 128 选 1 MoE 开始交替到第 48 层
Attention 的四层周期与 FFN 的 Dense/MoE 周期是两个独立维度;同一层要同时回答两道问题。 查看原图 ↗
交互 · 48 层显微镜

拖到任意一层,看两种节奏如何重叠

ATTENTION局部 RoPE只读取当前 8192 Token 分块
FFNMoE共享专家 + 16 个路由专家选 1

第 1 层:局部 RoPE Attention;Scout 在这一层使用 MoE。

白话先懂

把 48 层想成 48 个连续工位。Scout 每个工位都有分诊台;Maverick 则在标准流水线与专家工位之间交替。两者都还会叠加“这一层看局部还是看全局”的第二条节拍。

类比的边界是:Dense 层不是“没有专家能力”,MoE 层也不是必然更聪明。它们是在容量、计算密度、通信和训练稳定性之间做不同取舍。

工程含义

若采用跨设备 Expert Parallel(专家并行),Maverick 的专家 Dispatch / All-to-All 只出现在一半 FFN 层;做性能画像时应按真实 layer type 与放置拓扑采样,不能把 48 层都当成同一种 Kernel。

08 · iRoPE

三层看眼前 8K,一层回看从开头到现在

每四层中,前三层使用 RoPE(Rotary Position Embedding,旋转位置编码)与 8192 Token 固定分块注意力,第四层使用不加入显式旋转位置编码的全局 NoPE Attention。这个四拍循环在 48 层中重复 12 次;官方代码还实现了随位置缓慢增长的 Query 温度缩放。0910

Llama 4 iRoPE 四层循环:第 1、2、3 层使用 RoPE 与 8192 Token 分块注意力,第 4 层使用 NoPE 全局注意力,四层节奏重复十二次形成 48 层
iRoPE 的 i 是 interleaved:它交错局部 RoPE 层与全局 NoPE 层,不是把所有层都变成一种新位置编码。 查看原图 ↗
1LOCALRoPE · 8K
2LOCALRoPE · 8K
3LOCALRoPE · 8K
4GLOBALNoPE · 全历史
× 12
白话先懂

像读一本极长的书:大多数时候只摊开眼前一叠 8192 Token 的页面,专注语法和近邻细节;每四层进入一次总目录室,允许把从开头到当前位置的材料重新串起来。

类比的边界是:NoPE 不是完全没有顺序。因果 Mask 仍限制只能看过去,前三层的 RoPE 表示也会沿残差传递;全局层只是没有额外加入同样的旋转位置编码。

再深一层:NoPE 的推理时温度缩放展开公式直觉
scale(p) = 1 + 0.1 × log(floor((p + 1) / 8192) + 1)

短位置缩放接近 1,位置越远才逐步增大 Query 尺度,帮助全局 NoPE 层在超长序列中维持注意力区分度。它改善的是长度泛化,不是把全局 Attention 变成常数成本。

工程含义

后端必须同时正确实现 chunked 与 full causal mask、混合 KV 和温度缩放;只改 max_position_embeddings 得不到等价行为。

09 · 注意力范围

局部层负责精细织纹,全局层负责跨块接线

局部 RoPE 层把读取范围限制在当前固定 8K 分块,降低大多数层的注意力成本;全局 NoPE 层仍然读取从开头到当前位置的历史,让跨块信息能够周期性交汇。这里是 chunked attention(分块注意力),不是随当前位置平移的 sliding window(滑动窗口)。10

Llama 4 两种注意力可见范围:局部 RoPE 层只看当前 8192 Token 分块,全局 NoPE 层看从序列开头到当前位置的全部历史,两者通过层间残差交替传递信息
局部不是遗忘全部旧信息:旧信息可由全局层和层间表示带入;但精确远距离访问仍主要依赖周期性全局层。 查看原图 ↗
36 层 · 局部

RoPE + 8K Chunk

便宜地处理邻近关系、局部语法和当前代码段;缓存有机会在 8K 附近封顶。

12 层 · 全局

NoPE + Full History

跨章节、跨文件、跨图像整合;KV 和 Attention 仍随总长度增长。

白话先懂

局部层像一位校对员,拿着放大镜逐行检查当前页面;全局层像总编辑,定期把前面所有章节摊开,确认人物、论点和线索是否连得上。两种角色交替,才兼顾细节与全局。

类比的边界是:总编辑并不会保存一份压缩摘要,而是全局 Attention 真实访问完整历史。因此序列增长时,昂贵的全局读取仍然存在,只是从 48 层减少到约 12 层。

工程含义

长上下文优化应分别观察局部层与全局层的 KV、Kernel 和通信;平均到所有层的一个显存数字会掩盖真正瓶颈。

10 · 10M 上下文

Scout 在 256K 学习,再把长度泛化到 10M

Meta 明确写道,Scout 的预训练和后训练上下文为 256K;10M 来自长上下文 Mid-training(中期训练)、iRoPE 与推理时温度缩放的共同泛化,而不是每个训练样本都长达 10M。01

Llama 4 Scout 上下文泛化链路:常规多模态预训练进入长上下文 Mid-training,在 256K 训练与后训练长度上结合 iRoPE 和推理时温度缩放,展示到 10M 的检索与代码 NLL 测试
10M 是模型支持与长度泛化口径;NLL(Negative Log-Likelihood,负对数似然)等测试也不等于所有位置的复杂推理质量相同,更不等于每家 Provider 都开放 10M。 查看原图 ↗
01能否加载

框架、位置配置与 Processor 是否接受该长度。

02能否跑完

KV、临时 Workspace、Prefill 与超时是否可承受。

03能否找回

远处证据是否仍能被准确检索,而非只看字符串针。

04能否推理

跨多个远距离证据组合时是否仍保持正确。

白话先懂

这像一个学生平时在 256K 长度的模拟卷上训练,但借助更好的目录结构和读题方法,在考试时能处理远长于练习册的材料。找到藏在第 900 万 Token 的一句话,证明他能翻到那里。

类比的边界是:翻到一句话不等于能把十本书的多条线索正确组合。Needle 检索、代码 NLL、跨章节推理与真实 Agent 工作负载是不同能力,不能用一个 10M 标记全部替代。

工程含义

长上下文验收至少拆成加载、跑完、召回、推理四层;生产默认窗口应由真实质量与成本曲线决定,而不是取模型卡最大值。

11 · 权重与 KV

权重能进一张卡,不代表 10M 历史也能进去

按 Hugging Face 当前 safetensors 元数据,Scout / Maverick Checkpoint 分别含 108,641,793,536 / 401,583,781,376 个参数;官方模型卡把它们四舍五入为 109B / 400B。Scout 裸权重按 INT4(4-bit Integer,4 位整数)理论下限约 54.32GB,所以官方给出单张 H100 的装载口径;但 10M 上下文下,即便理想化地让 36 个局部层只保留当前 8K 分块,12 个全局层的 BF16(Brain Floating Point 16,16 位脑浮点)KV 缓存仍约 492.7GB。023132

Llama 4 权重和 KV Cache 增长图:Scout 与 Maverick 权重由总参数和精度决定;36 个局部层的缓存可在 8192 Token 附近封顶,12 个全局层继续线性增长,1M 理想混合 BF16 KV 约 50.4GB,10M 约 492.7GB
图中混合 KV 是按公开结构推算的理想化容量,不是任何框架的实测承诺;图片 Token、Batch、碎片与 Workspace 另算。 查看原图 ↗
交互 · 容量估算器

分开算权重与历史

默认 Batch 1。权重用当前 Checkpoint 精确参数数,KV 用公开配置的 48 层、8 KV Heads、Head Dim 128;不同后端可能保留完整局部 KV,或采用分页、量化、Offload 与 Context Parallel(上下文并行)。2324

理论权重下限217.3 GB总参数 × 权重字节
48 层全局 KV196.6 GB朴素对照,不代表实际后端
理想化混合 KV50.4 GB12 全局 + 36 局部封顶 8K
权重 + 理想混合 KV267.7 GB估算值;未含运行时余量
白话先懂

权重像整座图书馆的书架,KV Cache 像当前读者铺在桌上的历史索引。把书压成 INT4 可以让书架变小,却不会自动缩短每位读者正在使用的索引;上下文越长,桌面仍会被全局层的历史占满。

类比的边界是:真实后端不一定完全按这张理想账单工作。分页、KV 量化、局部淘汰、Context Parallel 和 CPU Offload 会改变容量与速度,图片 Token、碎片和 Attention Workspace 也不在公式里。

工程含义

容量规划必须写成“权重 + KV × 并发 + Workspace + 余量”;单卡宣传只说明特定精度的权重装载起点,不说明最大上下文吞吐。

12 · 训练工厂

先联合学习图文,再为长上下文和难题加专项工序

Llama 4 使用文本、图片、视频帧等多模态数据做 Early Fusion 预训练,再进行长上下文 Mid-training,最后经过轻量 SFT(Supervised Fine-Tuning,监督微调)、多模态在线 RL(Reinforcement Learning,强化学习)与轻量 DPO(Direct Preference Optimization,直接偏好优化)。模型卡给出的 Scout / Maverick 约 40T / 22T Token 与 5.0M / 2.38M H100-80GB GPU 小时都是预训练口径,不代表含 Mid-training 和后训练的完整总账。0102

Llama 4 训练工厂:多语言文本、图片与视频帧进入 Early Fusion MoE 预训练,再依次经过长上下文 Mid-training、轻量 SFT、多模态在线 RL 和轻量 DPO;下方标出 MetaP、FP8 与预训练 GPU 小时
40T / 22T Token 与 5.0M / 2.38M H100 GPU 小时都是各 Checkpoint 的预训练口径;发布博客的超过 30T 是家族级数据混合描述,不能把这些数字相加成完整训练总量。 查看原图 ↗
SCOUT · PRETRAINING约 40T Token5.0M H100-80GB GPU 小时
MAVERICK · PRETRAINING约 22T Token2.38M H100-80GB GPU 小时
LANGUAGE200 预训练官方明确支持 12 种
CUTOFF2024-08静态离线训练数据
白话先懂

训练像先让学生在图文混合教材里打基础,再安排超长阅读课,最后用难题、反馈和对话规范修整行为。Early Fusion 从基础课开始,而不是毕业前临时补一门看图课。

类比的边界是:公开的 Token 和 GPU 小时不能直接还原训练成本。数据可能重复采样,集群利用率、失败重跑、网络、内部软件和每阶段 Batch 都没有完整披露。

工程含义

评估可复现性时应区分开放权重与开放训练配方;Llama 4 可下载,但外部无法仅凭公开材料完整复刻其数据和蒸馏链。

13 · MetaP

先在缩比模型上找尺度规律,再把参数带到巨型训练

MetaP 用于让逐层学习率、初始化尺度等关键超参数,在模型宽度、深度、Batch Size 与训练 Token 数变化时仍能迁移,减少直接在 400B 或近 2T 模型上盲目搜索的成本;发布资料没有公开足够细节让外部完整复现这套规则。01

MetaP 超参数迁移:在较小代理模型上搜索逐层学习率与初始化尺度,形成参数化规则,再迁移到更宽、更深、更大 Batch 和更多训练 Token 的 Llama 4 训练并做大规模前验证
MetaP 解决的是跨规模调参迁移,不是一个新的 Attention 或 MoE 模块,也不意味着大模型无需校准。 查看原图 ↗
代理模型逐层 LR / 初始化宽度深度BatchToken大规模验证
白话先懂

这像先在风洞里测试缩比机翼,再用一套尺度规律推到真飞机。超大模型每次完整试错都极昂贵,所以先找到“尺寸变了,学习率和初始化该怎样跟着变”的规律。

类比的边界是:风洞规律不会消除真机试飞。数据分布、精度、网络和新架构仍可能带来大规模独有问题;MetaP 降低搜索空间,并不保证一次迁移就成功。

工程含义

训练方案评审要把“可迁移的超参数规则”和“最终大规模验证”分开预算,不能把小模型稳定直接当作大模型稳定证据。

14 · Codistillation

Behemoth 不只给答案,还把“不确定性”教给 Maverick

同一训练样本同时进入教师和学生。Behemoth 提供各 Token 概率分布形式的软目标,真实数据提供硬目标;Meta 的蒸馏损失在训练中动态调整两者权重,再更新 Maverick。公开材料描述的是 codistillation(协同蒸馏)机制,但没有公开教师 Checkpoint 与完整损失配方。01

Llama 4 Codistillation:同一训练样本进入 Behemoth 教师和 Maverick 学生,教师产生 Token 概率软目标,真实数据提供硬目标,动态加权蒸馏损失比较学生输出并更新 Maverick
教师尚未发布,不影响它作为训练信号存在;但这也意味着外部无法完整复现相同软目标。 查看原图 ↗
硬目标

正确答案是 B

监督当前样本的真实下一个 Token,信息明确但只有一个目标。

软目标

B 70% · C 20% · A 近 0

携带教师对相似概念、候选答案与不确定性的细粒度判断。

白话先懂

硬目标像老师只在答题卡上写“B”;软目标还会说“B 很可能,C 有一点道理,A 基本不可能”。后者把答案之间的相似关系和犹豫程度也传给学生。

类比的边界是:Maverick 不会因此成为 Behemoth 的完整复制品。学生容量、专家结构和预算更小,蒸馏只能帮助它在自身容量内逼近教师行为,不能继承教师全部能力。

工程含义

对 Llama 4 做再训练时,公开 checkpoint 可以复用,但原始教师目标不可得;复现实验应明确自己使用的是普通 SFT、离线蒸馏还是在线教师。

15 · 后训练

少做已经会的题,把在线 RL 留给“刚好还能学”的题

Meta 用模型 Judge(判分模型)移除超过 50% 的容易 SFT 数据,在更难样本上轻量 SFT;在线 RL 过程中又不断用更新后的策略模型重估难度,只保留仍有优势信号的中高难 Prompt,最后以轻量 DPO 修整表达边角。这里是发布团队披露的流程摘要,不是可复现的完整训练配方。01

Llama 4 后训练循环:候选 Prompt 经模型 Judge 判断难度,太容易的移除,中高难进入轻量 SFT 和在线 RL,更新后的策略重新筛选 Prompt 形成持续循环,最后轻量 DPO 平衡对话质量
目标不是无限提高难度,而是持续找到既不会全对、也不会全错,能产生有效奖励差异的训练区间。 查看原图 ↗
太容易优势接近 0

大量移除,避免 GPU 反复练熟题。

刚好能学进入 Online RL

答案有区分度,奖励能指导策略更新。

几乎全错同样缺信号

需要改题、分步或换更合适阶段。

白话先懂

像备考时把已经连续答对的基础题移出练习册,让新题难度随着学生水平一起升级。题目适度困难时,不同答案才有可比较的得分,学生也能知道下一步该改什么。

类比的边界是:越难不一定越有效。模型若几乎永远失败,所有轨迹同样低分,奖励仍然没有方向;动态筛题追求的是“当前策略刚好还能学”的窄区间。

工程含义

RL 数据管线必须记录 Prompt 难度随策略版本的漂移;一次离线打标不能长期代表更新后模型的学习价值。

16 · 多图与 Grounding

能描述图片只是起点,真正难的是把问题落到正确区域

多张图片与文字问题进入同一 Early Fusion 序列,跨模态 Attention 需要解析“右下角、红色、按钮”等约束,在视觉 Token 中定位相应区域,再把证据带回文本回答。发布博客、训练观察与模型卡的图像理解测试分别使用过不同图片数量,不能合并成统一服务上限。0102

Llama 4 多图 Grounding:图片 A 与图片 B 变成视觉 Token,文字问题和区域描述变成文本 Token,在 Early Fusion 序列中通过跨模态 Attention 对齐区域与概念,并引用视觉证据生成回答
训练最多 48 图、发布说明中的后训练观察至 8 图、模型卡图像理解测试至 5 图是三个不同口径,不能合成“稳定支持 48 图”。 查看原图 ↗
PRETRAIN最多 48 图训练样本规模,不是服务保障
POST-TRAIN NOTE至 8 图效果良好发布团队能力观察
MODEL CARD IMAGE UNDERSTANDING测试至 5 图超过后需开发者补测
白话先懂

Grounding 像让读者不仅说“页面上有一个按钮”,还要用“右下角、红色、提交”三条线索把手指准确放到目标区域。多图时还要先分清证据来自哪一页。

类比的边界是:模型输出通常是文本判断,不等于一个专用检测器提供像素级可信坐标。小字、低清、遮挡、切块边缘和相似物体都会让定位与引用产生幻觉。

工程含义

多图验收应拆成 OCR、图表数值、空间关系、跨图身份一致性、区域引用与图片数量退化,不能只评价描述是否流畅。

17 · Benchmark

发布分数是候选证据,不是你的生产结论

Meta 模型卡的公开评测使用 BF16;量化 Checkpoint、Provider、Prompt Template(提示模板)和 Harness(评测脚手架)变化后都需要重测。发布博客中 1417 Arena 还明确属于“实验性聊天版本”,不能自动转移给公开 Maverick Instruct。0102

Llama 4 证据阶梯:发布博客对比图、带 Shots 与 Metric 的官方模型卡、可下载 BF16 Checkpoint、公开 Harness 复跑、自有业务数据集、生产 A B 与成本监控,越往后越接近真实决策
比较模型时同时锁定 Checkpoint、精度、Prompt、最大输出、图片预处理、工具和重试;否则分数差异不只来自权重。 查看原图 ↗
官方 Instruct · BF16Scout / Maverick
MMMU
69.473.4
MMMU Pro
52.259.6
MathVista
70.773.7
ChartQA
88.890.0
DocVQA
94.494.4
LiveCodeBench
32.843.4
MMLU Pro
74.380.5
GPQA Diamond
57.269.8

左侧为 Scout,右侧为 Maverick;不同 Benchmark 量纲不同,不能横向求平均。完整 Shots、Metric 与数据集版本见官方模型卡。02

白话先懂

Benchmark 像标准化考试,能帮助筛选候选人;Checkpoint、精度、Prompt 和工具像考生、笔、题型说明与辅助设备。换其中任何一个,成绩都可能变化。

类比的边界是:生产系统不是考场。长输入延迟、并发、工具参数、中文稳定性、图片数量与安全策略都可能不在榜单里;官方成绩也没有替你承担量化后的退化。

工程含义

采购记录必须保存完整 Harness 快照;Arena 实验系统、官方 BF16 表格、第三方 API 和自建量化模型应分成不同证据层。

18 · 部署、许可与安全

开放了权重,也把系统责任交给了部署者

Scout 官方 BF16 可在加载时做 INT4;Maverick 提供 BF16 与 FP8,FP8 是单台 H100 DGX 主机级口径。无论自建还是 MaaS(Model as a Service,模型即服务),都要同时处理框架、并行、Provider 生命周期、Llama 4 自定义许可与系统级 Guard。0203

Llama 4 部署与安全全链路:先核对欧盟多模态许可限制、权重精度与容量,再经并行运行时、Prompt Guard、Llama Guard 和模型;输出检查后把合规回答返回用户,把工具调用送往 Schema 白名单权限检查与副作用审计,把不合规输出拒绝或隔离
模型服务不等于安全系统:Prompt Guard、Llama Guard、Code Shield、工具白名单、参数校验、权限和审计各自解决不同问题。 查看原图 ↗
参考与验证

Transformers

图文 Processor、Flex Attention、量化与 CPU Offload;适合先验证协议和质量。08

官方仓库的完整 BF16 参考运行至少 4 GPU
自建服务

vLLM / TensorRT-LLM

当前两套引擎都列出 Llama 4 支持;仍要从 128K 起逐级压测,并按真实硬件配置 Tensor、Expert 与 Context Parallel。1628

记录权重、KV、Prefill 与并发
托管服务

AWS / Vertex / Azure

窗口、输出、地域、工具和生命周期各不相同;不要拿模型卡替代 Endpoint 文档。

准备 Provider 退役与迁移预案
AWS BEDROCKScout 10M · Maverick 1M当前文档仍标 Active;“no sooner than 2026-04-28”不是自动退役日。1718
GOOGLE · US-EAST5Scout 1,310,720 · Maverick 524,288需接受 EULA(End User License Agreement,终端用户许可协议);不要把官方 10M / 1M 直接当端点窗口。19
AZURE FOUNDRYMaverick FP8 · Scout 128K / 8K直售与伙伴目录口径不同,需逐项目复核。2030
WEIGHTS仍可申请官方仓库仍列 Scout / Maverick;Endpoint 下线不等于权重撤回。03
SERVERLESS 生命周期 · 截至 2026-07-17

Groq 的 Maverick 端点已于 2026-03-09 下线;其条目没有限定为开发者层。Scout 的公布下线日是 2026-07-17,且官方明确这次退役只适用于免费/开发者层,已有承诺消费合同的企业客户不受影响。Together Serverless 的 Scout 与 Maverick FP8 分别于 2026-02-06、2026-03-31 下线;Fireworks 当前仍把 Scout 标为 Ready,但只提供 On-demand。三种状态只描述各自端点,不改变开放权重本身。252627

许可不是 Apache / MIT

使用前过一遍主体与分发关系

  • 分发时提供许可证副本与指定 Notice
  • 相关界面或文档显著展示 Built with Llama
  • 用材料或输出训练并分发的模型,名称以 Llama 开头
  • 发布日前一月月活超过 7 亿需另行申请许可
  • 个人住所或公司主要营业地在欧盟时,不获授多模态模型的 Section 1(a) 权利;集成该模型的产品或服务终端用户例外

0405

安全不是一个总开关

模型前后都要有独立防线

  • Prompt Guard 识别 Jailbreak 与 Prompt Injection
  • Llama Guard 做图文输入和输出策略分类
  • Code Shield 检查生成代码的不安全模式
  • 工具层仍做白名单、Schema、权限、幂等与审计
  • 为人群、语言和业务建立自己的安全测试集

2122

白话先懂

开放权重像把发动机和图纸交给你:你能研究、改装和装车,但车库、电路、刹车、驾驶规则与牌照仍要自己负责。云平台只是替你管理一部分发动机房,不会自动统一窗口、价格或合规。

类比的边界是:许可证与安全责任不是普通技术配置。主体所在地、分发关系、终端用户、工具权限和数据治理都可能改变结论;专题页只能提示检查项,不能替代法务和业务风险评审。

工程含义

上线清单要同时有模型版本、Provider 退役、许可、输入防护、输出防护、工具执行与审计 Owner;只部署一个 Endpoint 不是完整交付。

19 · 来源与透明度

配置讲几何,模型卡讲边界,Provider 文档讲今天能不能用

本页以 Meta 官方公告、模型卡、代码、Checkpoint 配置和许可为事实底座;框架与托管状态来自各项目或平台自己的当前文档。动态状态统一核查于 2026-07-17。Meta 曾把 Llama API 公布为 limited preview,官方 Python SDK 仓库仍在,但公开 GA(General Availability,正式商用)、统一价格与长期 SLA(Service Level Agreement,服务等级协议)仍不能从这两项证据推出。1529

01
Meta:The Llama 4 herd

发布状态、MoE、Early Fusion、iRoPE、训练与蒸馏

02
Llama 4 官方 Model Card

参数、模态、训练、评测、量化与安全

03
Meta llama-models 官方仓库

当前型号目录、下载、原生运行与量化入口

04
Llama 4 Community License

分发、署名、命名与 7 亿 MAU 条款

05
Llama 4 Acceptable Use Policy

使用边界与欧盟多模态主体限制

06
Scout Instruct 官方模型卡

Scout 权重、上下文、处理器与示例

07
Maverick Instruct 官方模型卡

Maverick BF16 / FP8 与部署信息

08
Transformers:Llama 4

公开配置、Flex Attention、量化与 Offload

09
Hugging Face Llama 4 架构说明

iRoPE、分块注意力与工程解释

10
Meta 官方 Transformer 实现

Attention、温度缩放与层级实现

11
Meta 官方 MoE 实现

共享专家、Router 与 Top-1 数据流

12
Meta 官方视觉嵌入实现

视觉 Transformer、Adapter 与投影

13
Meta 官方图像预处理

缩放、补边、切块与图片 Token

14
Meta Prompt Format

消息边界、图片 Token 与工具调用格式

15
Meta LlamaCon 公告

Llama API limited preview 的官方口径

16
vLLM 支持模型目录

Scout / Maverick 图文服务支持

17
AWS Bedrock Scout

托管上下文、输出与地域

18
AWS Bedrock Maverick

托管能力、工具与地域

19
Google Llama MaaS(原 Vertex AI 文档)

模型 ID、实际窗口、地域与 EULA

20
Microsoft Foundry 模型目录

Azure 当前型号与服务限制

21
Llama Guard 4 模型卡

图文输入输出策略分类

22
Meta Llama Protection Tools

Prompt Guard、Code Shield 与系统防护

23
Scout 官方 config.json

48 层、16 专家、10M 与注意力配置

24
Maverick 官方 config.json

48 层、128 专家、Dense/MoE 交替

25
Groq 退役时间表

第三方 Endpoint 生命周期

26
Together AI Changelog

Serverless Llama 4 下线记录

27
Fireworks Scout 模型页

当前 On-demand 服务状态

28
TensorRT-LLM 支持模型

当前 Llama 4 引擎支持状态

29
Meta Llama API Python SDK

官方端点与 SDK 仍存在的证据

30
Microsoft Foundry 伙伴与社区模型

Scout 更广目录的 128K 输入与 8K 输出服务口径

31
Scout Hugging Face API 元数据

Checkpoint 精确参数计数快照

32
Maverick Hugging Face API 元数据

Checkpoint 精确参数计数快照

仍然未知,不能用社区猜测补齐

完整数据配比、去重阈值与阶段级训练超参数

Behemoth 最终状态、权重日期与正式模型卡

10M 多类复杂推理的完整质量与吞吐曲线

不同后端是否真实淘汰局部 KV 及量化逐项损失

Meta Llama API 的公开 GA、统一价格与长期 SLA

所有 Provider 后续窗口、地域与退役时间

最终判断

Llama 4 的核心不是某一张榜单,而是三种结构共同工作:Early Fusion 让图文提前共用主干;共享专家 + Top-1 路由让总容量变大而每步约激活 17B;三层局部 RoPE + 一层全局 NoPE 把长上下文成本从“每层全局”改为“周期性全局”。它开放了权重,却没有消除总权重、全局 KV、许可和安全系统的工程门槛。