选开放模型不是抄一张榜而是签下六份长期工程合同
Checkpoint 能下载,只说明制品可取得;它能否合法使用、目标 GPU 能否承载、工具协议是否正确、真实任务是否达标、服务尾延迟是否稳定,以及版本变化后谁来复评,仍是六个不同问题。本文把六个当前家族放进同一套可审计漏斗,但不制造未经同协议复现的“总冠军”。
开放权重是一类制品状态,不是对整个 AI 系统的万能认证
Open-weight(开放权重)通常指你能取得训练后的参数并自行运行;许可证决定你能怎样使用、修改和再分发这份制品;能否复现训练,还取决于数据资料和完整代码。OSI 的 Open Source AI Definition(开放源码 AI 定义)把使用、研究、修改、分享四项自由,以及 Data Information、Code、Parameters 三类“首选修改形式”一起纳入要求。O01
先锁具体 checkpoint
记录完整 repo ID、revision、Base / Instruct、精度、量化衍生来源、tokenizer 与 config hash。“Qwen”或“Llama”只是家族名,不能成为发布 manifest。
逐版本读许可原文
Gemma 3 受 Gemma Terms 管理,而 Gemma 4 官方模型卡与专页明确改为 Apache-2.0;同一品牌的旧认知不能套到新 checkpoint。O14O17
权重不是托管系统
安全过滤、身份、对象授权、配额、内容政策、监控与补丁都由部署者补齐。gpt-oss 模型卡也明确把它称为 model card,而不是一个已封装的 system card。O09
Qwen3.6-35B-A3B
本页抽查的是该官方仓库,不替其他 Qwen 尺寸、衍生量化或微调版背书。O03
Mistral Small 4
官方权重卡与发布说明都标注 Apache-2.0;二次分发仍须保留许可与归属要求。O05
gpt-oss 20b / 120b
OpenAI 同时给出 gpt-oss usage policy;组织应把许可、发布方政策与自身用途合规分栏记录。O08
Llama 4
不是 Apache-2.0。含再分发标识、衍生模型命名、AUP,以及发布日之前月活超过 7 亿时需另行申请的条款。O12
Gemma 4
以 Gemma 4 专用许可页为准;不要把 Gemma Terms 页底部的网站内容许可,也不要把旧代条款,误当新权重许可。
DeepSeek-V4 Preview
官方模型卡声明 repository 与 model weights 适用 MIT License;仓库 LICENSE 文件是标准 MIT 条款。仍要另外处理数据、输出和适用行业义务。O18O19
本页只把官方条款转成工程核查项,不替代适用法域的专业判断。法务要看到的是具体 checkpoint、使用方式、是否再分发、目标地区、下游用户和完整发布链,而不是一列“允许商用:是”。
截至 2026-07-17,六个家族已经不再是半年前那六个型号
Qwen3.5、Gemma 3 和 DeepSeek-V3 仍可用,但已不适合作为“当前代表型号”。本页选择各家当前开放权重主线做候选地图;所有上下文、效率和 benchmark 数字首先是发布方声明,真正选型要在同一 manifest 下复跑。
Qwen3.6-35B-A3B
架构40 层,10 组“3× Gated DeltaNet + 1× Gated Attention”,每层接 MoE;256 routed experts,8 routed + 1 shared 激活。
模态 / 长度Causal Language Model + Vision Encoder;原生 262,144 Token,官方称可扩到 1,010,000。
进入候选中文、多语言、图文 / 视频理解、长文档和代码 Agent;混合注意力、视觉编码与 tool parser 必须在目标 runtime 实测。
证据边界这是首个 Qwen3.6 开放权重变体。模型卡给出 vLLM / SGLang 等动态版本建议;厂商 benchmark 不与其他家表格直接拼榜。O02
Mistral Small 4
gpt-oss-20b / 120b
架构MoE;20b 为 3.6B active,120b 为 5.1B active,均每 Token 激活 4 个专家;128K 上下文。
模态 / 协议当前是 text-only reasoning models(纯文本推理模型),支持低 / 中 / 高 reasoning effort,面向工具和结构化输出。
进入候选本地文本推理、工具 Agent、私有数据与需要可检查推理轨迹的研究;需要图像输入时直接排除。
证据边界原生 MXFP4 发布口径为 20b 约 16GB、120b 约 80GB;它们不出现在 OpenAI API 或 ChatGPT,第三方托管另立合同。O07
Scout / Maverick
E2B / E4B / 12B / 26B A4B / 31B
架构E2B/E4B 用 Per-Layer Embeddings;12B Unified 取消独立多模态 encoder;26B A4B 为 25.2B total / 3.8B active MoE;31B 为 Dense。
模态 / 长度全家族支持图像,并可把视频作为帧序列处理;E2B/E4B/12B 额外支持音频。E2B/E4B 为 128K,其余 256K。
进入候选单机 / 边缘、轻量图文与音频、消费级 GPU、需要官方 QAT(Quantization-Aware Training,量化感知训练)发布包的场景。
证据边界2026-03-31 首发四款,04-16 补 MTP,06-03 加 12B Unified;不要用“Gemma 4”替代具体尺寸和模态。O16
Flash / Pro
架构文本 MoE;Flash 为 13B active,Pro 为 49B active。混合 Compressed Sparse Attention 与 Heavily Compressed Attention,并加入 mHC。
模态 / 长度两款均发布 1M 上下文;Instruct checkpoint 为 MoE experts FP4、其余主要参数 FP8 的混合精度。
进入候选中文、代码、推理与超长文本,且有大规模多卡 / 多机工程能力的团队;普通单卡不应因 13B active 就误入候选。
证据边界官方名称仍是 Preview。所谓 1M 下相对 V3.2 的 FLOPs / KV 降幅和“领先”结论都属于 DeepSeek 自报,需用目标负载复现。O18O20
纯文本与原生多模态、21B 与 1.6T、Apache / MIT 与自定义许可、16GB 与多机部署不是同一问题。先按约束分候选池,再在同一任务、模板、精度、runtime 和硬件下比较,才有可解释的优劣。
MoE 的 active 参数解释每 Token 经过多少专家,不代表只需加载这些权重
Mixture of Experts(MoE,混合专家)把每个 Token 路由到少数专家,因此 per-token 计算可远小于总参数;但为快速服务,整份专家权重通常仍要驻留在 GPU、CPU 或分层存储中。显存第一笔账必须从 total parameters(总参数)开始,而不是从 active parameters(激活参数)开始。
bytes ≈ P_total × bits / 8只估裸权重。量化 scales、metadata、padding、embedding 精度与混合格式都会让实际 checkpoint 偏离。
weights + KV + workspace + activations再加 allocator 碎片、CUDA Graph、视觉 encoder、并行通信 buffer、runtime 与操作系统保留。
quality × SLO-goodput / total cost能加载只证明启动成功;稳定并发要在目标输入 / 输出长度、到达率和 P99 约束下测量。
35B × 4 / 8 = 17.5 GB 裸权重下限
不能按 3B active 算成 1.5 GB。17.5 GB 也不是“24GB 卡一定能跑 262K”:量化元数据、视觉模块、KV、workspace 与 runtime 还没入账。
109B × 4 / 8 ≈ 54.5 GB 裸权重下限
这与官方“on-the-fly INT4 可装单张 80GB H100”的量级相符,但不代表任意社区量化、任意上下文和并发都能复现。
Q4_0:2.9 / 4.5 / 6.7 / 14.4 / 17.5 GB
按 E2B、E4B、12B、26B A4B、31B 排列。Google 表格已含约 20% 加载 overhead,却明确不含支持软件和上下文 KV;这是很好的“可装候选”,不是生产容量承诺。O15
先找“能留下 KV 与运行余量”的候选,不找算术上刚好塞满的模型
优先做最小样例Gemma 4 E4B / 12B,以及 gpt-oss-20b 原生 MXFP4;它们有官方内存口径,但仍要按目标上下文复测。
条件候选Gemma 4 26B A4B / 31B Q4_0;Qwen3.6 的 4-bit 衍生量化只有在锁定具体制品、量化格式与 revision,并在目标机器实测后才能进入。短上下文可能可行,长上下文或高并发会快速吃掉余量。
默认排除Mistral Small 4、Llama 4、DeepSeek-V4 全量 checkpoint。CPU offload 可以做实验,不应假装没有带宽和尾延迟代价。
未知项先变成待办,不要被一条“支持”文案悄悄放行
把六个家族放进同一张表时,只问硬门和证据,不先问喜好。许可、模态、协议和硬件不合格就淘汰;留下 2~3 个候选后,才值得构造业务集、跑负载和做灰度。
Checkpoint 是哪一个?
完整 repo、commit、Base / Instruct、精度与量化来源;能否拿到 tokenizer、config、许可与安全说明。
法律和治理能否通过?
使用、修改、再分发、Hosted Service、Notice、品牌、AUP、地域与行业限制;由谁签字确认。
输入输出合同是否匹配?
文本、图像、视频、音频、JSON、工具调用、reasoning mode、system role 与多轮模板逐项核对。
目标机器和 runtime 真能跑吗?
冷启动最小样例、目标量化、最大输入 / 输出、batch、并行、kernel、parser 与 OOM 余量;不是“框架列表里有名字”。
真实任务是否过门?
按业务占比分层抽样,保存逐样本输出、失败类型、人工争议与置信区间;厂商自报只帮助选候选。
质量—SLO—成本能否同时成立?
在真实到达率下测 TTFT、TPOT、P99、goodput、显存、功耗、错误、人工审核、回退和运维成本。
先排除 text-only,再测文档证据链
Qwen3.6、Mistral Small 4、Llama 4 与 Gemma 4 可进入;测试要包含 OCR、表格、跨页引用、无答案拒答和多图上限。gpt-oss 与 DeepSeek-V4 当前不是原生图像候选。
评测完整轨迹,不评一段函数
Qwen3.6、Mistral Small 4、gpt-oss、DeepSeek-V4 可进入;固定工具 schema、容器、测试、最大步数、重试与最终 diff,另计副作用和未完成状态。
家族标签不能替代具体尺寸
Gemma 4 全尺寸可把视频作为帧序列处理,音频只由 E2B/E4B/12B 支持;26B A4B/31B 不支持音频,但并非“只有图像”。Qwen3.6 也有视觉 / 视频路径,仍须在型号与 runtime 层实测。
窗口上限只是容量声明
用真实长度分布测 needle、跨段推理、引用、首尾偏置、KV 与 P99;不要把 Scout 10M、DeepSeek 1M、Qwen 扩展 1.01M 自动翻译为“任意位置都可靠”。
真正可比较的单位不是“模型名”,而是一份不可变 manifest 下的完整系统
同一权重换了 chat template、thinking mode、runtime、量化、上下文截断或工具 parser,就不再是同一实验。lm-evaluation-harness 明确把任务 YAML 与代码 commit 作为复现材料,并保存 chat template;它适合标准任务,但业务 Agent、RAG 与多模态仍要自建任务和环境。O22O23
repo@commit · tokenizer hash · license/AUP/policy snapshot · chat template · reasoning mode · quant · runtime image · hardware · dataset/task/rubric hash · eval harness@commit · grader/judge version · generation config 任何字段变化都另建 run_id,不覆盖旧结果。供应商 API 还要加 model ID、provider、region、日期和响应元数据;同名 alias 不视为同一制品。条款快照与评测协议身份同样属于实验输入。
按任务桶,不按平均分
中文知识、代码、图文、工具、长上下文、结构化输出、拒答与高风险分别看。可确定判定的题优先用 verifier;主观 judge 要冻结版本、rubric、盲化顺序并人工复核分歧。
同一条样本成对比较
保存每个 task_id 的两个输出和差值,用配对 bootstrap 或合适区间表达不确定性;平均高 0.6 分但关键安全桶下降,不是自动上线。
固定并发与开放到达分开
先用 closed loop 找饱和曲线,再用独立 arrival-rate 验证队列稳定和尾延迟。MLPerf Server 场景以 Poisson 到达、99% 尾延迟约束寻找可承载吞吐,提供了可借鉴的负载思想。O24
失败和取消留在分母里
OOM、429、5xx、超时、断流、格式错误、工具失败与用户取消都要记录。只对成功请求算平均延迟,会把不稳定模型伪装成更快。
发布方自报
用于发现候选和理解协议;必须保留硬件、prompt、scaffold、judge、输出预算与脚注。不能删掉归因后改写成“模型普遍更强”。
第三方同协议
确认制品、模板和日期;榜单修复、任务污染与 provider 后端会变化。只在协议一致的行内比较。
目标工作负载复现
真实样本、真实硬件、真实到达率与风险门,直接决定发布。标准 benchmark 只是旁证,不替代这一层。
模型会更新,运行时会更新,许可证和 API alias 也会过期
一次通过不是永久认证。稳定基线必须保留到新版本完成 shadow、canary 与 ramp;变化发生时做“差异复评”,不要把半年前的全量结论无条件复制到新 checkpoint。
权重或条款变化
重做许可、参数、模态、安全与质量;不得只跑性能回归。
引擎、kernel 或精度变化
重做数值质量、格式、工具调用、显存、延迟、吞吐与错误。
提示协议或风险策略变化
重做对话、thinking、拒答、越权、注入、结构化输出与人工裁决。
流量或机器变化
重做 arrival-rate、长度分布、KV、并行、P99、goodput、功耗与单位成本。
短名单、manifest、三本账、失败样本、灰度 owner 与回滚目标同时存在
最终结论应能读成:“在 repo@commit、指定量化 / 模板 / runtime / 硬件和数据集下,候选 A 在关键任务桶达到门槛,并在目标到达率下满足 P99 与 goodput;许可和剩余风险由 owner 接受;若任一守门指标失败,回滚到稳定版本 B。”少一个限定词,就多一处无法复现的责任空洞。
一手来源与证据边界
优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。
开放 AI 的四项自由,以及 preferred form 必须包含 Data Information、Code 与 Parameters 的定义边界。
35B/3B active、混合注意力、MoE、上下文、模态与当前 runtime 建议;benchmark 仅视为发布方自报。
该具体 checkpoint 的 Apache License 2.0 原文。
版本、119B/6.5B active、256K、权重入口与官方能力说明。
128 experts / 4 active、图文输入、Apache-2.0 与当前 vLLM 等运行入口。
发布日期、许可、最低基础设施与厂商性能声明的原始边界。
21B/3.6B active 与 117B/5.1B active、128K、原生 MXFP4 及 16GB/80GB 发布口径。
Apache-2.0、usage policy、文本模态、自托管、微调及不在 OpenAI API / ChatGPT 提供的动态说明。
开放权重模型与完整托管系统的安全责任边界。
Scout 109B/17B、16 experts、10M 上限声明、模态、量化与模型限制。
Maverick 400B/17B、128 experts、1M 上限声明及 checkpoint 入口。
再分发、Built with Llama、衍生模型命名、AUP 与 700M MAU 额外商业条款。
Llama 4 early-fusion 多模态与 MoE 的发布方架构说明;跑分只作厂商自报。
五种尺寸、Dense/MoE、模态、上下文、架构与 Apache-2.0 许可。
官方推理加载内存估算、20% overhead、QAT 格式,以及不含 KV/runtime 的边界。
2026-03-31 Gemma 4 首发、2026-04-16 MTP 与 2026-06-03 12B Unified 的版本时间线。
Gemma 4 的具体许可原文;用于区分旧 Gemma Terms。
V4 Preview 的 Pro/Flash 总参数、激活参数、1M 上下文、混合注意力与混合精度发布包。
仓库中的标准 MIT 条款;权重适用 MIT 的范围声明另见官方模型卡。
Preview 状态、开放权重、API 型号、1M 服务声明及旧别名退役计划。
当前 deepseek-v4-pro / flash 型号和 2026-07-24 旧别名变更示例。
用任务 YAML 与代码 commit 复现实验配置。
chat template、tokenizer identity 与评测缓存必须同版的边界。
Server 场景的独立到达、尾延迟约束与吞吐测量方法参考。