Scout
109B total / 17B active16 个路由专家,官方 10M 输入;更适合超长代码库、文档和多图材料。06
Llama 4 不是把 Llama 3 简单做大。它先用 Early Fusion 把图像与文本排进同一序列,再用共享专家 + Top-1 路由控制每步计算,最后以 iRoPE 的局部与全局交错,把 Scout 的输入窗口推到 10M。
Scout 是超长上下文路线,Maverick 是综合质量路线。两者都只有约 17B 参数在一枚 Token 上激活,但仍须保存 109B 或约 400B 的完整权重。
截至 2026-07-17,Meta 官方目录仍只列 Scout 与 Maverick 两个可下载的 Llama 4 型号。Behemoth 是蒸馏教师的发布期预览,仍没有官方权重、模型卡或正式技术报告。010203
16 个路由专家,官方 10M 输入;更适合超长代码库、文档和多图材料。06
128 个路由专家,官方 1M 输入;更偏视觉推理、知识问答与通用助手。07
用于教师蒸馏和能力展示;没有一手依据证明它已经发布或已经取消。
把它们想成同一所学校:Scout 擅长读超长材料,Maverick 综合成绩更好,Behemoth 是给学生示范解题的大老师。老师参与课堂,不代表学校把老师的大脑和全部教材发给了公众。
类比的边界是:这不是三个尺寸递增、可以任意互换的同款模型。Scout 与 Maverick 的专家数量、FFN 排布、上下文和部署资源不同;Behemoth 目前更不能被当成一个可选 Endpoint。
模型清单、权重清单和产品宣传必须分开维护;任何 Behemoth 上线日期都应标为未知,而不是从旧公告推断。
Scout 与 Maverick 都写着 17B Active,但一个把资源投向长上下文,另一个把容量投向更多专家。下面先看决策图,再用交互把任务、窗口和硬件放到同一张选择单。
超长材料是首要约束;先用 Scout 在 Provider 实际开放的窗口内验证检索和跨章节推理。
不要直接把模型卡 10M 当成 Endpoint 保证值。选模型像选车辆:Scout 更像长途货车,能挂很长的材料车厢;Maverick 更像动力和配置更高的综合车型,面对复杂图文任务更有优势。没有自己的车库和维修队,就先租云端车辆。
类比的边界是:窗口更长不等于每个位置上的推理都同样可靠,综合分数更高也不等于你的行业数据一定更好。最后选择仍要经过同 Prompt、同精度、同数据集的复跑。
先固定真实 P95 输入长度,再决定型号;绝大多数业务不应为了少量极长请求,让所有请求长期承担 10M 资源配置。
文本直接变成 Token;图片先切块、编码并投影为 5120 维视觉表示。两条线在主干前汇合,之后共同经过 Attention、Dense 或 MoE FFN(Feed-Forward Network,前馈网络),最终仍按自回归方式输出文本或代码 Token。1012
文字查 Token Embedding;图片经视觉编码器与两级投影进入语言维度。
视觉 Token 填入图片占位位置,与文本排成同一条因果序列。
三层读取当前 8K 分块,第四层周期性回看全部历史。
Dense 直接变换;MoE 同时走共享专家和一个路由专家。
48 层表示变成下一枚文本或代码 Token 的概率。
可以把整套模型想成一台织机:文字是蓝线,图片是橙线。视觉编码器先把图片纤维整理成机器能接受的线,两种线从较早位置就一起进入同一块布,而不是最后才把一张图片说明贴上去。
类比的边界是:图片并没有被先翻译成一段可读文字,48 层也不是 48 台独立机器。它们是连续向量,统一隐藏状态在同一条主干里被注意力、FFN 和残差反复改写。
预处理器、图片尺寸、切块策略和 Prompt Template 都是模型协议的一部分;换错 Processor 会在进入主干前就破坏对齐。
官方预处理会保持宽高比缩放、补边和切块;视觉 Transformer 提取 Patch(图像块)表示,Pixel Shuffle(像素重排)减少空间 Token,Adapter MLP(适配器多层感知机)与独立 Linear(线性投影)再把它们对齐到语言 hidden size 5120。图片占位与消息边界也属于 Prompt Format 协议。121314
传统级联更像先让看图助手写一段摘要,再把摘要交给语言助手;Early Fusion 则像把图片拆成特殊词片,与问题一起装订进同一本练习册,让主干学习图块与句子之间的对应关系。
类比的边界是:视觉 Token 不是自然语言词语,也不会自动保留每个原始像素。切块、Pixel Shuffle 和投影都在压缩信息,小字 OCR(Optical Character Recognition,光学字符识别)、切块边缘与超长图仍可能丢细节。
图片数量和分辨率会转化为额外 Token、Prefill 与 KV 压力;多图能力不是免费附件,应单独记录图片 Token 和首 Token 延迟。
一枚 Token 进入每层后,先经 RMSNorm(Root Mean Square Layer Normalization,均方根归一化)与 GQA(Grouped-Query Attention,分组查询注意力)混合序列信息,再经第二次 RMSNorm 进入 Dense 或 MoE FFN(Feed-Forward Network,前馈网络)。两次残差旁路都保留原表示,让 48 层逐步修正而不是每层推倒重来;具体几何以两份 Checkpoint 配置为准。2324
读一道题时,Attention 像翻资料并圈出相关句子,FFN 像在草稿纸上整理和推导。残差旁路则像保留原题复印件,防止每次加工都把前面的关键信息完全覆盖。
类比的边界是:模型没有人类可读的“资料页”和“草稿步骤”。这些操作是高维矩阵变换;即便 Attention 看到了正确位置,后续 FFN 也可能组合错误,反过来亦然。
性能优化不能只盯 MoE;Attention Kernel、KV 格式、FFN 专家通信与残差融合都会影响端到端吞吐。
每个 MoE(Mixture of Experts,混合专家)层都包含一个所有 Token 必经的共享专家。Router(路由器)先按原始 logits(未归一化分数)选择 Top-1 路由专家,再对被选分数应用 sigmoid 得到门值;被选专家与共享专家的输出相加后才回到残差主路。11
所有 Token 的通用变换
训练形成的稀疏分工
约 17B Active 是模型级路径口径
它像医院分诊:每位患者先见全科医生,再由分诊台送到一个最合适的专科。这样每次不必召集全部专家,却能把不同知识容量分散到更大的专家库里。
类比的边界是:路由专家并不天然对应“数学科”或“法语科”。分工是训练自动形成的高维模式,同一专家可能同时处理多种语言和概念,不能凭几个样本给它贴固定标签。
MoE 节省的是每 Token 计算,不是权重容量;多卡部署还会新增 Expert Parallel、负载不均和 All-to-All 通信问题。
两者语言主干都是 48 层,但 FFN 节奏不同:Scout 每层都是 MoE;Maverick 按一号层计数为奇数 Dense、偶数 MoE,共 24 个 Dense 与 24 个 MoE 层。2324
第 1 层:局部 RoPE Attention;Scout 在这一层使用 MoE。
把 48 层想成 48 个连续工位。Scout 每个工位都有分诊台;Maverick 则在标准流水线与专家工位之间交替。两者都还会叠加“这一层看局部还是看全局”的第二条节拍。
类比的边界是:Dense 层不是“没有专家能力”,MoE 层也不是必然更聪明。它们是在容量、计算密度、通信和训练稳定性之间做不同取舍。
若采用跨设备 Expert Parallel(专家并行),Maverick 的专家 Dispatch / All-to-All 只出现在一半 FFN 层;做性能画像时应按真实 layer type 与放置拓扑采样,不能把 48 层都当成同一种 Kernel。
每四层中,前三层使用 RoPE(Rotary Position Embedding,旋转位置编码)与 8192 Token 固定分块注意力,第四层使用不加入显式旋转位置编码的全局 NoPE Attention。这个四拍循环在 48 层中重复 12 次;官方代码还实现了随位置缓慢增长的 Query 温度缩放。0910
像读一本极长的书:大多数时候只摊开眼前一叠 8192 Token 的页面,专注语法和近邻细节;每四层进入一次总目录室,允许把从开头到当前位置的材料重新串起来。
类比的边界是:NoPE 不是完全没有顺序。因果 Mask 仍限制只能看过去,前三层的 RoPE 表示也会沿残差传递;全局层只是没有额外加入同样的旋转位置编码。
scale(p) = 1 + 0.1 × log(floor((p + 1) / 8192) + 1)短位置缩放接近 1,位置越远才逐步增大 Query 尺度,帮助全局 NoPE 层在超长序列中维持注意力区分度。它改善的是长度泛化,不是把全局 Attention 变成常数成本。
后端必须同时正确实现 chunked 与 full causal mask、混合 KV 和温度缩放;只改 max_position_embeddings 得不到等价行为。
局部 RoPE 层把读取范围限制在当前固定 8K 分块,降低大多数层的注意力成本;全局 NoPE 层仍然读取从开头到当前位置的历史,让跨块信息能够周期性交汇。这里是 chunked attention(分块注意力),不是随当前位置平移的 sliding window(滑动窗口)。10
便宜地处理邻近关系、局部语法和当前代码段;缓存有机会在 8K 附近封顶。
跨章节、跨文件、跨图像整合;KV 和 Attention 仍随总长度增长。
局部层像一位校对员,拿着放大镜逐行检查当前页面;全局层像总编辑,定期把前面所有章节摊开,确认人物、论点和线索是否连得上。两种角色交替,才兼顾细节与全局。
类比的边界是:总编辑并不会保存一份压缩摘要,而是全局 Attention 真实访问完整历史。因此序列增长时,昂贵的全局读取仍然存在,只是从 48 层减少到约 12 层。
长上下文优化应分别观察局部层与全局层的 KV、Kernel 和通信;平均到所有层的一个显存数字会掩盖真正瓶颈。
Meta 明确写道,Scout 的预训练和后训练上下文为 256K;10M 来自长上下文 Mid-training(中期训练)、iRoPE 与推理时温度缩放的共同泛化,而不是每个训练样本都长达 10M。01
框架、位置配置与 Processor 是否接受该长度。
KV、临时 Workspace、Prefill 与超时是否可承受。
远处证据是否仍能被准确检索,而非只看字符串针。
跨多个远距离证据组合时是否仍保持正确。
这像一个学生平时在 256K 长度的模拟卷上训练,但借助更好的目录结构和读题方法,在考试时能处理远长于练习册的材料。找到藏在第 900 万 Token 的一句话,证明他能翻到那里。
类比的边界是:翻到一句话不等于能把十本书的多条线索正确组合。Needle 检索、代码 NLL、跨章节推理与真实 Agent 工作负载是不同能力,不能用一个 10M 标记全部替代。
长上下文验收至少拆成加载、跑完、召回、推理四层;生产默认窗口应由真实质量与成本曲线决定,而不是取模型卡最大值。
按 Hugging Face 当前 safetensors 元数据,Scout / Maverick Checkpoint 分别含 108,641,793,536 / 401,583,781,376 个参数;官方模型卡把它们四舍五入为 109B / 400B。Scout 裸权重按 INT4(4-bit Integer,4 位整数)理论下限约 54.32GB,所以官方给出单张 H100 的装载口径;但 10M 上下文下,即便理想化地让 36 个局部层只保留当前 8K 分块,12 个全局层的 BF16(Brain Floating Point 16,16 位脑浮点)KV 缓存仍约 492.7GB。023132
默认 Batch 1。权重用当前 Checkpoint 精确参数数,KV 用公开配置的 48 层、8 KV Heads、Head Dim 128;不同后端可能保留完整局部 KV,或采用分页、量化、Offload 与 Context Parallel(上下文并行)。2324
权重像整座图书馆的书架,KV Cache 像当前读者铺在桌上的历史索引。把书压成 INT4 可以让书架变小,却不会自动缩短每位读者正在使用的索引;上下文越长,桌面仍会被全局层的历史占满。
类比的边界是:真实后端不一定完全按这张理想账单工作。分页、KV 量化、局部淘汰、Context Parallel 和 CPU Offload 会改变容量与速度,图片 Token、碎片和 Attention Workspace 也不在公式里。
容量规划必须写成“权重 + KV × 并发 + Workspace + 余量”;单卡宣传只说明特定精度的权重装载起点,不说明最大上下文吞吐。
Llama 4 使用文本、图片、视频帧等多模态数据做 Early Fusion 预训练,再进行长上下文 Mid-training,最后经过轻量 SFT(Supervised Fine-Tuning,监督微调)、多模态在线 RL(Reinforcement Learning,强化学习)与轻量 DPO(Direct Preference Optimization,直接偏好优化)。模型卡给出的 Scout / Maverick 约 40T / 22T Token 与 5.0M / 2.38M H100-80GB GPU 小时都是预训练口径,不代表含 Mid-training 和后训练的完整总账。0102
训练像先让学生在图文混合教材里打基础,再安排超长阅读课,最后用难题、反馈和对话规范修整行为。Early Fusion 从基础课开始,而不是毕业前临时补一门看图课。
类比的边界是:公开的 Token 和 GPU 小时不能直接还原训练成本。数据可能重复采样,集群利用率、失败重跑、网络、内部软件和每阶段 Batch 都没有完整披露。
评估可复现性时应区分开放权重与开放训练配方;Llama 4 可下载,但外部无法仅凭公开材料完整复刻其数据和蒸馏链。
MetaP 用于让逐层学习率、初始化尺度等关键超参数,在模型宽度、深度、Batch Size 与训练 Token 数变化时仍能迁移,减少直接在 400B 或近 2T 模型上盲目搜索的成本;发布资料没有公开足够细节让外部完整复现这套规则。01
这像先在风洞里测试缩比机翼,再用一套尺度规律推到真飞机。超大模型每次完整试错都极昂贵,所以先找到“尺寸变了,学习率和初始化该怎样跟着变”的规律。
类比的边界是:风洞规律不会消除真机试飞。数据分布、精度、网络和新架构仍可能带来大规模独有问题;MetaP 降低搜索空间,并不保证一次迁移就成功。
训练方案评审要把“可迁移的超参数规则”和“最终大规模验证”分开预算,不能把小模型稳定直接当作大模型稳定证据。
同一训练样本同时进入教师和学生。Behemoth 提供各 Token 概率分布形式的软目标,真实数据提供硬目标;Meta 的蒸馏损失在训练中动态调整两者权重,再更新 Maverick。公开材料描述的是 codistillation(协同蒸馏)机制,但没有公开教师 Checkpoint 与完整损失配方。01
监督当前样本的真实下一个 Token,信息明确但只有一个目标。
携带教师对相似概念、候选答案与不确定性的细粒度判断。
硬目标像老师只在答题卡上写“B”;软目标还会说“B 很可能,C 有一点道理,A 基本不可能”。后者把答案之间的相似关系和犹豫程度也传给学生。
类比的边界是:Maverick 不会因此成为 Behemoth 的完整复制品。学生容量、专家结构和预算更小,蒸馏只能帮助它在自身容量内逼近教师行为,不能继承教师全部能力。
对 Llama 4 做再训练时,公开 checkpoint 可以复用,但原始教师目标不可得;复现实验应明确自己使用的是普通 SFT、离线蒸馏还是在线教师。
Meta 用模型 Judge(判分模型)移除超过 50% 的容易 SFT 数据,在更难样本上轻量 SFT;在线 RL 过程中又不断用更新后的策略模型重估难度,只保留仍有优势信号的中高难 Prompt,最后以轻量 DPO 修整表达边角。这里是发布团队披露的流程摘要,不是可复现的完整训练配方。01
大量移除,避免 GPU 反复练熟题。
答案有区分度,奖励能指导策略更新。
需要改题、分步或换更合适阶段。
像备考时把已经连续答对的基础题移出练习册,让新题难度随着学生水平一起升级。题目适度困难时,不同答案才有可比较的得分,学生也能知道下一步该改什么。
类比的边界是:越难不一定越有效。模型若几乎永远失败,所有轨迹同样低分,奖励仍然没有方向;动态筛题追求的是“当前策略刚好还能学”的窄区间。
RL 数据管线必须记录 Prompt 难度随策略版本的漂移;一次离线打标不能长期代表更新后模型的学习价值。
多张图片与文字问题进入同一 Early Fusion 序列,跨模态 Attention 需要解析“右下角、红色、按钮”等约束,在视觉 Token 中定位相应区域,再把证据带回文本回答。发布博客、训练观察与模型卡的图像理解测试分别使用过不同图片数量,不能合并成统一服务上限。0102
Grounding 像让读者不仅说“页面上有一个按钮”,还要用“右下角、红色、提交”三条线索把手指准确放到目标区域。多图时还要先分清证据来自哪一页。
类比的边界是:模型输出通常是文本判断,不等于一个专用检测器提供像素级可信坐标。小字、低清、遮挡、切块边缘和相似物体都会让定位与引用产生幻觉。
多图验收应拆成 OCR、图表数值、空间关系、跨图身份一致性、区域引用与图片数量退化,不能只评价描述是否流畅。
Meta 模型卡的公开评测使用 BF16;量化 Checkpoint、Provider、Prompt Template(提示模板)和 Harness(评测脚手架)变化后都需要重测。发布博客中 1417 Arena 还明确属于“实验性聊天版本”,不能自动转移给公开 Maverick Instruct。0102
左侧为 Scout,右侧为 Maverick;不同 Benchmark 量纲不同,不能横向求平均。完整 Shots、Metric 与数据集版本见官方模型卡。02
Benchmark 像标准化考试,能帮助筛选候选人;Checkpoint、精度、Prompt 和工具像考生、笔、题型说明与辅助设备。换其中任何一个,成绩都可能变化。
类比的边界是:生产系统不是考场。长输入延迟、并发、工具参数、中文稳定性、图片数量与安全策略都可能不在榜单里;官方成绩也没有替你承担量化后的退化。
采购记录必须保存完整 Harness 快照;Arena 实验系统、官方 BF16 表格、第三方 API 和自建量化模型应分成不同证据层。
Scout 官方 BF16 可在加载时做 INT4;Maverick 提供 BF16 与 FP8,FP8 是单台 H100 DGX 主机级口径。无论自建还是 MaaS(Model as a Service,模型即服务),都要同时处理框架、并行、Provider 生命周期、Llama 4 自定义许可与系统级 Guard。0203
图文 Processor、Flex Attention、量化与 CPU Offload;适合先验证协议和质量。08
官方仓库的完整 BF16 参考运行至少 4 GPU当前两套引擎都列出 Llama 4 支持;仍要从 128K 起逐级压测,并按真实硬件配置 Tensor、Expert 与 Context Parallel。1628
记录权重、KV、Prefill 与并发窗口、输出、地域、工具和生命周期各不相同;不要拿模型卡替代 Endpoint 文档。
准备 Provider 退役与迁移预案Groq 的 Maverick 端点已于 2026-03-09 下线;其条目没有限定为开发者层。Scout 的公布下线日是 2026-07-17,且官方明确这次退役只适用于免费/开发者层,已有承诺消费合同的企业客户不受影响。Together Serverless 的 Scout 与 Maverick FP8 分别于 2026-02-06、2026-03-31 下线;Fireworks 当前仍把 Scout 标为 Ready,但只提供 On-demand。三种状态只描述各自端点,不改变开放权重本身。252627
开放权重像把发动机和图纸交给你:你能研究、改装和装车,但车库、电路、刹车、驾驶规则与牌照仍要自己负责。云平台只是替你管理一部分发动机房,不会自动统一窗口、价格或合规。
类比的边界是:许可证与安全责任不是普通技术配置。主体所在地、分发关系、终端用户、工具权限和数据治理都可能改变结论;专题页只能提示检查项,不能替代法务和业务风险评审。
上线清单要同时有模型版本、Provider 退役、许可、输入防护、输出防护、工具执行与审计 Owner;只部署一个 Endpoint 不是完整交付。
本页以 Meta 官方公告、模型卡、代码、Checkpoint 配置和许可为事实底座;框架与托管状态来自各项目或平台自己的当前文档。动态状态统一核查于 2026-07-17。Meta 曾把 Llama API 公布为 limited preview,官方 Python SDK 仓库仍在,但公开 GA(General Availability,正式商用)、统一价格与长期 SLA(Service Level Agreement,服务等级协议)仍不能从这两项证据推出。1529
发布状态、MoE、Early Fusion、iRoPE、训练与蒸馏
参数、模态、训练、评测、量化与安全
当前型号目录、下载、原生运行与量化入口
分发、署名、命名与 7 亿 MAU 条款
使用边界与欧盟多模态主体限制
Scout 权重、上下文、处理器与示例
Maverick BF16 / FP8 与部署信息
公开配置、Flex Attention、量化与 Offload
iRoPE、分块注意力与工程解释
Attention、温度缩放与层级实现
共享专家、Router 与 Top-1 数据流
视觉 Transformer、Adapter 与投影
缩放、补边、切块与图片 Token
消息边界、图片 Token 与工具调用格式
Llama API limited preview 的官方口径
Scout / Maverick 图文服务支持
托管上下文、输出与地域
托管能力、工具与地域
模型 ID、实际窗口、地域与 EULA
Azure 当前型号与服务限制
图文输入输出策略分类
Prompt Guard、Code Shield 与系统防护
48 层、16 专家、10M 与注意力配置
48 层、128 专家、Dense/MoE 交替
第三方 Endpoint 生命周期
Serverless Llama 4 下线记录
当前 On-demand 服务状态
当前 Llama 4 引擎支持状态
官方端点与 SDK 仍存在的证据
Scout 更广目录的 128K 输入与 8K 输出服务口径
Checkpoint 精确参数计数快照
Checkpoint 精确参数计数快照
完整数据配比、去重阈值与阶段级训练超参数
Behemoth 最终状态、权重日期与正式模型卡
10M 多类复杂推理的完整质量与吞吐曲线
不同后端是否真实淘汰局部 KV 及量化逐项损失
Meta Llama API 的公开 GA、统一价格与长期 SLA
所有 Provider 后续窗口、地域与退役时间
Llama 4 的核心不是某一张榜单,而是三种结构共同工作:Early Fusion 让图文提前共用主干;共享专家 + Top-1 路由让总容量变大而每步约激活 17B;三层局部 RoPE + 一层全局 NoPE 把长上下文成本从“每层全局”改为“周期性全局”。它开放了权重,却没有消除总权重、全局 KV、许可和安全系统的工程门槛。