跳到正文
2026 LANDSCAPE · OPEN-WEIGHT MODELS

选开放模型不是抄一张榜而是签下六份长期工程合同

Checkpoint 能下载,只说明制品可取得;它能否合法使用、目标 GPU 能否承载、工具协议是否正确、真实任务是否达标、服务尾延迟是否稳定,以及版本变化后谁来复评,仍是六个不同问题。本文把六个当前家族放进同一套可审计漏斗,但不制造未经同协议复现的“总冠军”。

六种不同形态的模型制品进入透明选型台,依次经过许可文件、模态棱镜、硬件机架、证据显微镜和生产仪表,右侧留下两个候选与一条回滚支线
直觉总览:先过许可、模态和硬件硬门,再用业务证据与服务 SLO 收窄候选;黄色 canary 只表达灰度发布的直觉,精确流程见后文 SVG。
01 · DEFINE “OPEN” BEFORE COMPARING MODELS

开放权重是一类制品状态,不是对整个 AI 系统的万能认证

Open-weight(开放权重)通常指你能取得训练后的参数并自行运行;许可证决定你能怎样使用、修改和再分发这份制品;能否复现训练,还取决于数据资料和完整代码。OSI 的 Open Source AI Definition(开放源码 AI 定义)把使用、研究、修改、分享四项自由,以及 Data Information、Code、Parameters 三类“首选修改形式”一起纳入要求。O01

开放模型边界图:OSI 四项自由位于上层,完整可修改形式由训练数据资料、训练运行代码和参数配置组成;下层区分常见开放权重 checkpoint 与可上线系统还需补齐的运行时、资源、评测和发布合同。
Apache-2.0 或 MIT 可以是某份权重制品的许可,但若训练数据资料或完整训练代码没有提供,不能只凭许可证名称推断整个机器学习系统满足 OSAID。 查看原图 ↗
ARTIFACT

先锁具体 checkpoint

记录完整 repo ID、revision、Base / Instruct、精度、量化衍生来源、tokenizer 与 config hash。“Qwen”或“Llama”只是家族名,不能成为发布 manifest。

LICENSE

逐版本读许可原文

Gemma 3 受 Gemma Terms 管理,而 Gemma 4 官方模型卡与专页明确改为 Apache-2.0;同一品牌的旧认知不能套到新 checkpoint。O14O17

SYSTEM

权重不是托管系统

安全过滤、身份、对象授权、配额、内容政策、监控与补丁都由部署者补齐。gpt-oss 模型卡也明确把它称为 model card,而不是一个已封装的 system card。O09

APACHE-2.0

Qwen3.6-35B-A3B

本页抽查的是该官方仓库,不替其他 Qwen 尺寸、衍生量化或微调版背书。O03

APACHE-2.0

Mistral Small 4

官方权重卡与发布说明都标注 Apache-2.0;二次分发仍须保留许可与归属要求。O05

APACHE-2.0 + POLICY

gpt-oss 20b / 120b

OpenAI 同时给出 gpt-oss usage policy;组织应把许可、发布方政策与自身用途合规分栏记录。O08

CUSTOM LICENSE

Llama 4

不是 Apache-2.0。含再分发标识、衍生模型命名、AUP,以及发布日之前月活超过 7 亿时需另行申请的条款。O12

APACHE-2.0

Gemma 4

以 Gemma 4 专用许可页为准;不要把 Gemma Terms 页底部的网站内容许可,也不要把旧代条款,误当新权重许可。

MIT

DeepSeek-V4 Preview

官方模型卡声明 repository 与 model weights 适用 MIT License;仓库 LICENSE 文件是标准 MIT 条款。仍要另外处理数据、输出和适用行业义务。O18O19

不是法律意见

本页只把官方条款转成工程核查项,不替代适用法域的专业判断。法务要看到的是具体 checkpoint、使用方式、是否再分发、目标地区、下游用户和完整发布链,而不是一列“允许商用:是”。

02 · CURRENT FAMILY SNAPSHOT

截至 2026-07-17,六个家族已经不再是半年前那六个型号

Qwen3.5、Gemma 3 和 DeepSeek-V3 仍可用,但已不适合作为“当前代表型号”。本页选择各家当前开放权重主线做候选地图;所有上下文、效率和 benchmark 数字首先是发布方声明,真正选型要在同一 manifest 下复跑。

SNAPSHOT · 2026-07-17

稳定字段:checkpoint、架构、模态、参数与许可。动态字段:runtime 版本、provider、API 型号、地区、价格与配额。后者必须在部署日重查。

QWEN · CURRENT OPEN 3.6

Qwen3.6-35B-A3B

35B total · 3B active

架构40 层,10 组“3× Gated DeltaNet + 1× Gated Attention”,每层接 MoE;256 routed experts,8 routed + 1 shared 激活。

模态 / 长度Causal Language Model + Vision Encoder;原生 262,144 Token,官方称可扩到 1,010,000。

进入候选中文、多语言、图文 / 视频理解、长文档和代码 Agent;混合注意力、视觉编码与 tool parser 必须在目标 runtime 实测。

证据边界这是首个 Qwen3.6 开放权重变体。模型卡给出 vLLM / SGLang 等动态版本建议;厂商 benchmark 不与其他家表格直接拼榜。O02

MISTRAL · v26.03

Mistral Small 4

119B total · 6.5B active

架构MoE,128 experts、每 Token 激活 4 个;把 Instruct、Reasoning 与 agentic coding 合进同一模型。

模态 / 长度文本与图像输入、文本输出;256K 上下文,可按请求选择不推理或高推理强度。

进入候选企业图文文档、代码 Agent、需要可调推理的私有云;active 小不消除 119B 总权重和专家通信。

证据边界官方发布给出的最低基础设施是 4×HGX H100、2×HGX H200 或 1×DGX B200;这是发布方建议,不是所有量化实现的硬定律。O04O06

OPENAI · TEXT REASONING

gpt-oss-20b / 120b

21B / 117B total

架构MoE;20b 为 3.6B active,120b 为 5.1B active,均每 Token 激活 4 个专家;128K 上下文。

模态 / 协议当前是 text-only reasoning models(纯文本推理模型),支持低 / 中 / 高 reasoning effort,面向工具和结构化输出。

进入候选本地文本推理、工具 Agent、私有数据与需要可检查推理轨迹的研究;需要图像输入时直接排除。

证据边界原生 MXFP4 发布口径为 20b 约 16GB、120b 约 80GB;它们不出现在 OpenAI API 或 ChatGPT,第三方托管另立合同。O07

META · LLAMA 4

Scout / Maverick

109B / 400B total · 17B active

架构early fusion(早融合)原生多模态 MoE;Scout 16 experts,Maverick 128 experts。

模态 / 长度文本与图像输入;模型卡给 Scout 10M、Maverick 1M 上下文上限,同时只在最多 5 张图像上完成官方图像理解测试。

进入候选已有 Llama 生态、图文理解和超长上下文研究;中文不是模型卡列出的 12 种正式支持语言,须单列验证。

证据边界上限不等于任意位置质量或低成本。Scout 官方称 on-the-fly INT4 可装单张 H100;Maverick FP8 是整台 H100 DGX 量级。O10O11O13

GOOGLE · GEMMA 4

E2B / E4B / 12B / 26B A4B / 31B

Dense + MoE · 5 sizes

架构E2B/E4B 用 Per-Layer Embeddings;12B Unified 取消独立多模态 encoder;26B A4B 为 25.2B total / 3.8B active MoE;31B 为 Dense。

模态 / 长度全家族支持图像,并可把视频作为帧序列处理;E2B/E4B/12B 额外支持音频。E2B/E4B 为 128K,其余 256K。

进入候选单机 / 边缘、轻量图文与音频、消费级 GPU、需要官方 QAT(Quantization-Aware Training,量化感知训练)发布包的场景。

证据边界2026-03-31 首发四款,04-16 补 MTP,06-03 加 12B Unified;不要用“Gemma 4”替代具体尺寸和模态。O16

DEEPSEEK · V4 PREVIEW

Flash / Pro

284B / 1.6T total

架构文本 MoE;Flash 为 13B active,Pro 为 49B active。混合 Compressed Sparse Attention 与 Heavily Compressed Attention,并加入 mHC。

模态 / 长度两款均发布 1M 上下文;Instruct checkpoint 为 MoE experts FP4、其余主要参数 FP8 的混合精度。

进入候选中文、代码、推理与超长文本,且有大规模多卡 / 多机工程能力的团队;普通单卡不应因 13B active 就误入候选。

证据边界官方名称仍是 Preview。所谓 1M 下相对 V3.2 的 FLOPs / KV 降幅和“领先”结论都属于 DeepSeek 自报,需用目标负载复现。O18O20

为什么没有平均总分

纯文本与原生多模态、21B 与 1.6T、Apache / MIT 与自定义许可、16GB 与多机部署不是同一问题。先按约束分候选池,再在同一任务、模板、精度、runtime 和硬件下比较,才有可解释的优劣。

03 · TOTAL WEIGHTS, ACTIVE COMPUTE, RUNTIME STATE

MoE 的 active 参数解释每 Token 经过多少专家,不代表只需加载这些权重

Mixture of Experts(MoE,混合专家)把每个 Token 路由到少数专家,因此 per-token 计算可远小于总参数;但为快速服务,整份专家权重通常仍要驻留在 GPU、CPU 或分层存储中。显存第一笔账必须从 total parameters(总参数)开始,而不是从 active parameters(激活参数)开始。

RAW WEIGHT LOWER BOUNDbytes ≈ P_total × bits / 8

只估裸权重。量化 scales、metadata、padding、embedding 精度与混合格式都会让实际 checkpoint 偏离。

RUNTIME FOOTPRINTweights + KV + workspace + activations

再加 allocator 碎片、CUDA Graph、视觉 encoder、并行通信 buffer、runtime 与操作系统保留。

SERVICE CAPACITYquality × SLO-goodput / total cost

能加载只证明启动成功;稳定并发要在目标输入 / 输出长度、到达率和 P99 约束下测量。

QWEN3.6 · 4-BIT THOUGHT EXPERIMENT

35B × 4 / 8 = 17.5 GB 裸权重下限

不能按 3B active 算成 1.5 GB。17.5 GB 也不是“24GB 卡一定能跑 262K”:量化元数据、视觉模块、KV、workspace 与 runtime 还没入账。

LLAMA 4 SCOUT · 4-BIT THOUGHT EXPERIMENT

109B × 4 / 8 ≈ 54.5 GB 裸权重下限

这与官方“on-the-fly INT4 可装单张 80GB H100”的量级相符,但不代表任意社区量化、任意上下文和并发都能复现。

GEMMA 4 · OFFICIAL LOAD ESTIMATE

Q4_0:2.9 / 4.5 / 6.7 / 14.4 / 17.5 GB

按 E2B、E4B、12B、26B A4B、31B 排列。Google 表格已含约 20% 加载 overhead,却明确不含支持软件和上下文 KV;这是很好的“可装候选”,不是生产容量承诺。O15

CASE · 24 GB SINGLE GPU

先找“能留下 KV 与运行余量”的候选,不找算术上刚好塞满的模型

优先做最小样例Gemma 4 E4B / 12B,以及 gpt-oss-20b 原生 MXFP4;它们有官方内存口径,但仍要按目标上下文复测。

条件候选Gemma 4 26B A4B / 31B Q4_0;Qwen3.6 的 4-bit 衍生量化只有在锁定具体制品、量化格式与 revision,并在目标机器实测后才能进入。短上下文可能可行,长上下文或高并发会快速吃掉余量。

默认排除Mistral Small 4、Llama 4、DeepSeek-V4 全量 checkpoint。CPU offload 可以做实验,不应假装没有带宽和尾延迟代价。

04 · THE AUDITABLE SELECTION FUNNEL

未知项先变成待办,不要被一条“支持”文案悄悄放行

把六个家族放进同一张表时,只问硬门和证据,不先问喜好。许可、模态、协议和硬件不合格就淘汰;留下 2~3 个候选后,才值得构造业务集、跑负载和做灰度。

六阶段开放模型选型漏斗:依次检查制品与许可、模态与协议、硬件与运行时、业务任务质量、系统 SLO 与成本、灰度与回滚;未知的硬门证据会阻断候选。
能力位于第四关。许可证、目标量化或 runtime 实装等硬门仍未知时,候选只能标“待验证”;只有已识别、非硬门的剩余风险才可由 owner 限期接受。 查看原图 ↗
01

Checkpoint 是哪一个?

完整 repo、commit、Base / Instruct、精度与量化来源;能否拿到 tokenizer、config、许可与安全说明。

02

法律和治理能否通过?

使用、修改、再分发、Hosted Service、Notice、品牌、AUP、地域与行业限制;由谁签字确认。

03

输入输出合同是否匹配?

文本、图像、视频、音频、JSON、工具调用、reasoning mode、system role 与多轮模板逐项核对。

04

目标机器和 runtime 真能跑吗?

冷启动最小样例、目标量化、最大输入 / 输出、batch、并行、kernel、parser 与 OOM 余量;不是“框架列表里有名字”。

05

真实任务是否过门?

按业务占比分层抽样,保存逐样本输出、失败类型、人工争议与置信区间;厂商自报只帮助选候选。

06

质量—SLO—成本能否同时成立?

在真实到达率下测 TTFT、TPOT、P99、goodput、显存、功耗、错误、人工审核、回退和运维成本。

企业图文文档

先排除 text-only,再测文档证据链

Qwen3.6、Mistral Small 4、Llama 4 与 Gemma 4 可进入;测试要包含 OCR、表格、跨页引用、无答案拒答和多图上限。gpt-oss 与 DeepSeek-V4 当前不是原生图像候选。

代码修复 Agent

评测完整轨迹,不评一段函数

Qwen3.6、Mistral Small 4、gpt-oss、DeepSeek-V4 可进入;固定工具 schema、容器、测试、最大步数、重试与最终 diff,另计副作用和未完成状态。

音频 / 视频本地理解

家族标签不能替代具体尺寸

Gemma 4 全尺寸可把视频作为帧序列处理,音频只由 E2B/E4B/12B 支持;26B A4B/31B 不支持音频,但并非“只有图像”。Qwen3.6 也有视觉 / 视频路径,仍须在型号与 runtime 层实测。

超长上下文

窗口上限只是容量声明

用真实长度分布测 needle、跨段推理、引用、首尾偏置、KV 与 P99;不要把 Scout 10M、DeepSeek 1M、Qwen 扩展 1.01M 自动翻译为“任意位置都可靠”。

05 · REPRODUCIBLE EVALUATION

真正可比较的单位不是“模型名”,而是一份不可变 manifest 下的完整系统

同一权重换了 chat template、thinking mode、runtime、量化、上下文截断或工具 parser,就不再是同一实验。lm-evaluation-harness 明确把任务 YAML 与代码 commit 作为复现材料,并保存 chat template;它适合标准任务,但业务 Agent、RAG 与多模态仍要自建任务和环境。O22O23

开放模型评测和发布闭环:先冻结权重、条款快照、模板、运行环境、数据任务与评测器身份,再并列建立任务质量、服务系统、许可风险三本账;全部通过发布门后依次经过 shadow、canary、ramp 到稳定版,任何变更都返回 manifest 做差异复评。
质量、系统和风险三本账不能互相替代。最终证据必须能从候选结论追到逐样本输出、负载 trace、条款快照、运行命令和回滚目标。 查看原图 ↗
MINIMUM MANIFEST repo@commit · tokenizer hash · license/AUP/policy snapshot · chat template · reasoning mode · quant · runtime image · hardware · dataset/task/rubric hash · eval harness@commit · grader/judge version · generation config

任何字段变化都另建 run_id,不覆盖旧结果。供应商 API 还要加 model ID、provider、region、日期和响应元数据;同名 alias 不视为同一制品。条款快照与评测协议身份同样属于实验输入。

QUALITY

按任务桶,不按平均分

中文知识、代码、图文、工具、长上下文、结构化输出、拒答与高风险分别看。可确定判定的题优先用 verifier;主观 judge 要冻结版本、rubric、盲化顺序并人工复核分歧。

PAIRING

同一条样本成对比较

保存每个 task_id 的两个输出和差值,用配对 bootstrap 或合适区间表达不确定性;平均高 0.6 分但关键安全桶下降,不是自动上线。

SYSTEM

固定并发与开放到达分开

先用 closed loop 找饱和曲线,再用独立 arrival-rate 验证队列稳定和尾延迟。MLPerf Server 场景以 Poisson 到达、99% 尾延迟约束寻找可承载吞吐,提供了可借鉴的负载思想。O24

FAILURES

失败和取消留在分母里

OOM、429、5xx、超时、断流、格式错误、工具失败与用户取消都要记录。只对成功请求算平均延迟,会把不稳定模型伪装成更快。

L1 · VENDOR

发布方自报

用于发现候选和理解协议;必须保留硬件、prompt、scaffold、judge、输出预算与脚注。不能删掉归因后改写成“模型普遍更强”。

L2 · THIRD PARTY

第三方同协议

确认制品、模板和日期;榜单修复、任务污染与 provider 后端会变化。只在协议一致的行内比较。

L3 · YOUR WORKLOAD

目标工作负载复现

真实样本、真实硬件、真实到达率与风险门,直接决定发布。标准 benchmark 只是旁证,不替代这一层。

06 · SHIP, ROLLBACK, RECERTIFY

模型会更新,运行时会更新,许可证和 API alias 也会过期

一次通过不是永久认证。稳定基线必须保留到新版本完成 shadow、canary 与 ramp;变化发生时做“差异复评”,不要把半年前的全量结论无条件复制到新 checkpoint。

DYNAMIC FACT WITH AN EXPIRY DATE

DeepSeek 的旧 API alias 说明了为什么“当前可用”必须带日期

在本页核查日 2026-07-17,官方文档写明 deepseek-chatdeepseek-reasoner 计划于 2026-07-24 15:59 UTC 退役,并映射到 V4-Flash 的不同模式。这不是模型架构事实,而是一条一周内就会改变的路由状态;发布 manifest 应直接使用当前 model ID,并在到期后重新核验。O20O21

CHECKPOINT / LICENSE

权重或条款变化

重做许可、参数、模态、安全与质量;不得只跑性能回归。

RUNTIME / QUANT

引擎、kernel 或精度变化

重做数值质量、格式、工具调用、显存、延迟、吞吐与错误。

TEMPLATE / POLICY

提示协议或风险策略变化

重做对话、thinking、拒答、越权、注入、结构化输出与人工裁决。

WORKLOAD / HARDWARE

流量或机器变化

重做 arrival-rate、长度分布、KV、并行、P99、goodput、功耗与单位成本。

SHIP ONLY IF

短名单、manifest、三本账、失败样本、灰度 owner 与回滚目标同时存在

最终结论应能读成:“在 repo@commit、指定量化 / 模板 / runtime / 硬件和数据集下,候选 A 在关键任务桶达到门槛,并在目标到达率下满足 P99 与 goodput;许可和剩余风险由 owner 接受;若任一守门指标失败,回滚到稳定版本 B。”少一个限定词,就多一处无法复现的责任空洞。

RESEARCH LEDGER

一手来源与证据边界

优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

O01
The Open Source AI Definition 1.0Open Source Initiative · 2024

开放 AI 的四项自由,以及 preferred form 必须包含 Data Information、Code 与 Parameters 的定义边界。

O02
Qwen3.6-35B-A3B Model CardQwen · 核查于 2026-07-17

35B/3B active、混合注意力、MoE、上下文、模态与当前 runtime 建议;benchmark 仅视为发布方自报。

O03
Qwen3.6-35B-A3B LicenseQwen · 核查于 2026-07-17

该具体 checkpoint 的 Apache License 2.0 原文。

O04
Mistral Small 4 Model CardMistral AI · v26.03

版本、119B/6.5B active、256K、权重入口与官方能力说明。

O05
Mistral-Small-4-119B-2603Mistral AI · 核查于 2026-07-17

128 experts / 4 active、图文输入、Apache-2.0 与当前 vLLM 等运行入口。

O06
Introducing Mistral Small 4Mistral AI · 2026-03-16

发布日期、许可、最低基础设施与厂商性能声明的原始边界。

O07
Introducing gpt-ossOpenAI · 2025-08-05

21B/3.6B active 与 117B/5.1B active、128K、原生 MXFP4 及 16GB/80GB 发布口径。

O08
OpenAI open-weight models (gpt-oss)OpenAI Help Center · 核查于 2026-07-17

Apache-2.0、usage policy、文本模态、自托管、微调及不在 OpenAI API / ChatGPT 提供的动态说明。

O09
gpt-oss-120b & gpt-oss-20b Model CardOpenAI · 2025-08-05

开放权重模型与完整托管系统的安全责任边界。

O10
Llama 4 Scout Model CardMeta · 2025-04-05

Scout 109B/17B、16 experts、10M 上限声明、模态、量化与模型限制。

O11
Llama 4 Maverick Model CardMeta · 2025-04-05

Maverick 400B/17B、128 experts、1M 上限声明及 checkpoint 入口。

O12
Llama 4 Community License AgreementMeta · 2025-04-05

再分发、Built with Llama、衍生模型命名、AUP 与 700M MAU 额外商业条款。

O13
The Llama 4 HerdMeta · 2025-04-05

Llama 4 early-fusion 多模态与 MoE 的发布方架构说明;跑分只作厂商自报。

O14
Gemma 4 Model CardGoogle DeepMind · updated 2026-07-16

五种尺寸、Dense/MoE、模态、上下文、架构与 Apache-2.0 许可。

O15
Gemma 4 Model OverviewGoogle · updated 2026-07-08

官方推理加载内存估算、20% overhead、QAT 格式,以及不含 KV/runtime 的边界。

O16
Gemma ReleasesGoogle · updated 2026-07-02

2026-03-31 Gemma 4 首发、2026-04-16 MTP 与 2026-06-03 12B Unified 的版本时间线。

O17
Gemma 4 — Apache License 2.0Google · 2026-04-01

Gemma 4 的具体许可原文;用于区分旧 Gemma Terms。

O18
DeepSeek-V4-Pro Model CardDeepSeek-AI · 2026-04

V4 Preview 的 Pro/Flash 总参数、激活参数、1M 上下文、混合注意力与混合精度发布包。

O19
DeepSeek-V4-Pro LicenseDeepSeek-AI · 2026-04

仓库中的标准 MIT 条款;权重适用 MIT 的范围声明另见官方模型卡。

O20
DeepSeek V4 Preview ReleaseDeepSeek · 2026-04-24

Preview 状态、开放权重、API 型号、1M 服务声明及旧别名退役计划。

O21
DeepSeek API Quick Start / Current Model IDsDeepSeek · 核查于 2026-07-17

当前 deepseek-v4-pro / flash 型号和 2026-07-24 旧别名变更示例。

O22
lm-evaluation-harness Task ConfigurationEleutherAI · 核查于 2026-07-17

用任务 YAML 与代码 commit 复现实验配置。

O23
lm-evaluation-harness Model GuideEleutherAI · 核查于 2026-07-17

chat template、tokenizer identity 与评测缓存必须同版的边界。

O24
MLPerf Inference Rules — Scenarios and LoadGenMLCommons · 核查于 2026-07-17

Server 场景的独立到达、尾延迟约束与吞吐测量方法参考。