跳到正文
模型专题 · DeepSeek-V4

1.6T MoE,怎样把百万上下文做成可部署系统

DeepSeek-V4-Pro 不是简单把上下文窗口拉长。它让 61 层在两种压缩注意力之间交错,用四路残差稳住训练,再让 384 位专家每次只上场 6 位。结果是:历史很长,但每层不必把整段历史原样重读。

先记住

49B active 不等于 49B 模型。每个 Token 只激活部分专家,但部署仍要让约 1.6T 总权重可被 GPU 集群访问。

CONTEXT TAPE1,048,576 tokens
当前问题Q
128 最近原文 1,024 精选压缩条目 8,192 全历史摘要*
HCAHCACSAHCACSA… × 61
FLOPs 27%KV 10%官方 1M 估算 · vs V3.2,不是 wall-clock
同一枚 Query 同时保留近处原文、稀疏精选历史和粗粒度完整历史。*8,192 是 1M / 128 的近似条目数。
1.6T / 49B总参数 / 每 Token 激活
61Transformer 主层
1,048,576配置上下文
384 → 6路由专家 → 每次选中
33TPro 预训练 Token
01 · 版本地图

先把名字摆正:Pro、Flash、Max 和 DSpark 不是一回事

选择 V4 前,先分清“能力模型”“推理模式”和“加速模块”。否则很容易把 Pro-Max 当成新权重,或把 49B active 误读成单卡模型。

V4 Preview 于 2026-04-24 发布。Max 是 Pro 的推理强度;DSpark 是 Pro 加 Draft 模块,二者都不是新的基础能力模型。查看原图 ↗
能力优先

V4-Pro

1.6T 总参 / 49B 激活。面向复杂知识、难代码、长链 Agent;对话权重主要是 FP4 Experts + FP8 其余部分。

API:deepseek-v4-pro
速度与成本优先

V4-Flash

284B 总参 / 13B 激活。适合抽取、分类、简单工具流和高并发;同样支持 1M 配置窗口。

旧 chat / reasoner 暂时指向它
三个名称,一句话拆开 Pro-Max = 同一 Pro 权重,把推理预算开到最大 Pro-DSpark = Pro + 猜后续 Token 的 Draft 模块 Pro-Base = 未做完整对话后训练的基础 checkpoint
白话理解

把 Pro 想成一所拥有 384 个专业科室的大医院。49B active 只表示一次会诊真正叫来的医生数量,不表示其余科室可以从楼里消失;自部署时仍要让全部权重有地方常驻和被访问。

02 · 完整架构

一枚 Token,怎样穿过 61 层 V4-Pro

V4 的创新不是孤立模块堆叠,而是一条端到端数据流:Attention 管“去哪里找历史”,MoE 管“请哪些专家加工”,mHC 管“信息怎样安全地跨层流动”。

主路径:Embedding → 61 个 Block → LM Head。前两层 HCA,之后 CSA/HCA 交替,合计 31 层 HCA + 30 层 CSA;MTP depth=1 先作为训练辅助目标,也可由支持的自部署运行时复用为 speculative draft(投机草稿),但不是普通逐 Token Decode 的固定串行层。查看原图 ↗
01 · 进门

Token 变成 7168 维主向量

Embedding 把 Token ID 变成模型能计算的向量。mHC 虽维护四条残差流,但真正送进 Attention 与 MoE 的主向量仍是 hidden size 7168。

02 · 逐层加工

找历史,再找专家

每个 Block 先通过 CSA 或 HCA 读取历史,再让 1 个共享专家和 6 个路由专家加工。mHC 把结果稳妥地送往下一层。

03 · 出门

LM Head 预测下一枚 Token

61 层后,LM Head 给词表中的候选打分。生成时不断重复这条链;训练时 MTP 还会辅助预测更远的未来 Token。

层序HCA · HCA · CSA · HCA · CSA …不是“第 1 层 CSA”
每个 BlockmHC → Attention → MoE残差、记忆、专家协同
训练 / 可选服务辅助MTP depth = 1可被 runtime 复用,不等于托管 API 必然启用
03 · 百万上下文的核心

CSA + HCA + SWA:不是少看历史,而是换三种分辨率看

当前 Query 不再对 1M 条原始 KV 逐一做核心 Attention。它一边完整看最近 128 Token,一边让 CSA 精选较细的历史摘要,同时让 HCA 浏览更粗但覆盖完整历史的摘要。

两条主线都保留 Query → Core MQA,也都把最近 128 Token 的未压缩 SWA KV 拼进来;区别在于 CSA“细压缩后挑重点”,HCA“重压缩后全部看”。查看原图 ↗
白话类比 · 在百万页档案里回答问题

桌面、检索员和目录册同时工作

SWA 是桌面上最近翻过的 128 页,原文最清楚;CSA 是检索员先把旧档案每 4 页做成重叠摘要,再挑出最相关的 1,024 条;HCA 是全库目录册,每 128 页压成一条,虽然更粗,但整本档案都覆盖。

128最近原文 · 最清楚
1,024相关摘要 · 精读
≈ 8,192全历史摘要 · 鸟瞰
可交互 · Context Budget Lab

拖动上下文长度,看每条路径要读多少

下面是按公开配置做的教学近似。它能帮助理解数量级,但不包含压缩器、Indexer、MoE、通信、工作区与调度,因此不能直接换算成吞吐。

CSA 压缩步幅按 4、Top-k 上限 1,024;HCA 压缩率按 128;SWA 按最近 128。
原始历史1,048,576
CSA 压缩池262,144
CSA 真正选中1,024 + 128
HCA 全部摘要8,192 + 128
V4 BF16 KV 粗算9.62 GiB混合低精度约 4.80 GiB
为什么要交错两种层?

CSA 给固定预算的“相关历史”更细粒度;HCA 用更粗的摘要换取完整覆盖。二者一起避免只看近处,也避免每层都全量扫描 1M 原始 KV。

27% / 10% 到底是什么?

官方估算 1M 下,Pro 单 Token 等效 FP8 FLOPs 为 V3.2 的 27%,累计 KV 为 10%。这是结构估算,不是“真实延迟缩短 73%”。

04 · 层内系统工程

Attention 负责找资料,mHC 和 MoE 负责把 1.6T 模型跑稳、跑开

百万上下文只是第一层问题。更大的难点是:61 层信息不能越传越失控,384 个专家又要分散在多张 GPU 上高效协同。

04A · mHC

把一条残差高速公路,扩成四条受控车道

普通 Transformer 只有一条 residual stream。mHC 维护四条通道,让不同信息有更多传递路径;但每次混合都被限制成“双随机矩阵”,每行、每列权重和为 1,避免某条通道无边界放大。

初学者只需记:四条通道是层与层之间的运输系统,不是把每层 Attention 和 MoE 的 hidden size 从 7168 直接变成四倍。
展开 mHC 的数学边界20 次 Sinkhorn · 非扩张
BlM={MM1=1, 1M=1, M0}Bl21B_l\in\mathcal{M}=\{M\mid M\mathbf{1}=\mathbf{1},\ \mathbf{1}^{\top}M=\mathbf{1}^{\top},\ M\ge 0\}\quad\Rightarrow\quad\lVert B_l\rVert_2\le 1

约束后的混合矩阵谱范数不超过 1,因此这一步本身不会放大残差流。它是稳定性条件,不是对任意训练过程的绝对保证。技术报告给出的实现开销约为普通 residual 的 6.7%。

普通单路残差与 mHC 四路残差对比:四条通道通过双随机矩阵受控混合,再向内部 7168 维 Attention 与 MoE 提供主向量
四路残差负责跨层运输,核心计算仍接收 7168 维主向量。原图 ↗
DeepSeekMoE 将每个 Token 路由给 384 个路由专家中的 6 个,并始终经过 1 个共享专家;专家分布在 GPU Mesh 上,通过 Dispatch、Expert Compute、Combine 和 Wave Overlap 完成计算
每次只请 6 位路由专家 + 1 位共享专家,但所有专家权重仍需分布在集群中。原图 ↗
04B · DeepSeekMoE

384 位专家,每题只请 6 位,再加一位全科医生

Router 根据当前 Token 选择 6 个 routed experts,shared expert 始终参与。前 3 个 MoE 层采用基于 Token ID 的 Hash Routing,后续层再用学习到的亲和度分配。

工程重点:专家分散在不同 GPU,Token 要先 Dispatch、算完再 Combine。Wave overlap 与 MegaMoE 的价值,是把通信和计算交叠起来,减少“GPU 等网络”的空档。
6 / 384选中的路由专家比例
49B / 1.6T激活参数 / 总参数

这两个比例分母不同,不能把“选了 1.56% 专家”直接等同于“只激活 1.56% 参数”。

05 · 训练配方

先把阅读长度一档档拉长,再让十多位“老师”合成一个 Pro

V4-Pro 的训练可以分成两条连续故事:预训练解决“读得长且不崩”,后训练解决“会推理、会工具、会统一不同领域能力”。

DeepSeek-V4-Pro 33T Token 预训练时间线:上下文从 4K 逐步扩展到 16K、64K 与 1M,Attention 从稠密预热、Indexer 预热切到稀疏,并以 Muon、Anticipatory Routing 和 SwiGLU Clamp 保持训练稳定
长度课程不是一开始就把 1M Token 塞进训练:模型先学短文本,再逐步延长,并为稀疏选择单独预热。查看原图 ↗
白话 · 像训练长跑

不是第一天就跑马拉松

模型先在 4K 上学会稳定阅读,再到 16K、64K,最终进入 1M。CSA 也不是突然开始“挑资料”:先用稠密 Attention 打基础,再让 Indexer 学会打分,最后才真正按 Top-k 稀疏读取。

33TPro 预训练阶段处理的 Token;不含未披露的后训练 Token,也不等于 33T 个互不重复 Token
Muon + AdamW大部分二维权重用 Muon;Embedding、输出头、Norm 等保留 AdamW
10 次 NSMuon 的混合 Newton–Schulz 正交化:8 次快速 + 2 次精修
DeepSeek-V4 后训练从 Base 开始,经领域 SFT、GRPO、十多位 Specialist 与 Teacher,再以全词表 Reverse-KL On-Policy Distillation 合成统一 Pro;QAT 横跨 Teacher、Reference 与 Student
OPD 负责把十多位教师的能力蒸馏回统一模型;QAT 横跨后训练链路,不是最后才做一次简单量化。查看原图 ↗
先分科

SFT → GRPO → Specialists

不同领域先分别训练,数学、代码、工具等“专科老师”各自把能力练深;这一阶段没有被 OPD 全部替代。

再会诊

10+ Teachers → OPD

统一 Student 在自己的 On-policy 轨迹上,学习多个 Teacher 的完整词表分布,而不只模仿最终答案。

边练边适应低精度

QAT 贯穿后训练

Teacher、Reference、Student 都考虑量化路径,让 FP4 Experts 和低精度 Indexer 不至于在部署时突然变脸。

展开 OPD、FP4 与 MTP 的技术边界Reverse-KL · QAT · depth=1
LOPD(θ)=i=1NwiDKL ⁣(πθπEi)\mathcal{L}_{\mathrm{OPD}}(\theta)=\sum_{i=1}^{N}w_i\,D_{\mathrm{KL}}\!\left(\pi_\theta\,\Vert\,\pi_{E_i}\right)

Reverse-KL 更偏向跟随 Teacher 的高概率区域。它替换的是最终 mixed-RL consolidation 路径,不代表“所有 RL 都被蒸馏取代”。

FP4 的“无损”只到哪里?

论文只说明满足 Scale 条件时,已经量化的 FP4 值可被 FP8 精确表示;不表示 FP32 → FP4 整体没有误差。QAT 正是让模型适应这部分误差。CSA Indexer 的 Q–K 路径同样进入 FP4;Index score 再由 FP32 降为 BF16,论文报告 Top-k Selector 提速 2×、KV 条目召回率 99.7%。

MTP 与 DSpark

Pro checkpoint 本身含一层 MTP 参数,vLLM 可选把它复用为 speculative draft;DSpark 则附带更大的独立 Draft 模块。两者都不是普通 Decode 必经层,公开资料也没有证明托管 API 使用哪条投机路径。

10+ 位教师怎样不把显存与 I/O 撑爆?

教师权重按需从集中式分布存储加载,并做类似 ZeRO 的参数分片;前向只缓存最后一层 hidden state,训练时再逐个装入对应 prediction head 重建完整词表 logits。样本按教师排序,单个 mini-batch 同时最多驻留一个教师输出头;权重与 hidden state 异步搬运,最终由专用 TileLang kernel 计算精确 KL。这里的“教师数量近乎不受限”是调度能力,不表示所有教师同时常驻 GPU。

06 · 推理模式与 Agent

Non-think、High、Max:同一副大脑,分配不同思考预算

Pro-Max 不是更大的模型。模式切换改变的是推理长度、工具链行为和成本,而不是换了一套参数。

API 普通请求默认

常规复杂推理

适合代码、知识问答、工具调用与大多数 Agent 任务。通常是质量、时延和成本之间的默认平衡点。

Thinking 默认开启;low / medium 会映射到 High。
DeepSeek API 时序:首次固定前缀建立 best-effort Context Cache,后续完整匹配才可能命中;Thinking 工具轮次返回 reasoning_content 与 tool_calls,编排器执行工具后必须在下一次请求中完整回传 reasoning_content
缓存和 Thinking 都是“跨请求状态”。缓存命中要完整匹配持久化前缀;工具轮次则必须把 reasoning_content 随 Assistant 工具消息回传。查看原图 ↗
Agent 最容易漏掉的一条规则

如果模型在 Thinking 中发出 Tool Call,下一次 API 请求必须完整带回那条 Assistant 消息的 reasoning_content;缺失会返回 400。没有 Tool Call 的旧 reasoning 可以省略。模型提出工具调用后,仍应由编排器做 Schema 与权限校验,再进受限 Sandbox。

07 · 证据中心

官方成绩告诉你上限,独立评测告诉你能复现多少

把两类证据并排看,比只盯一张排行榜更接近真实选型。下面保留具体数字,也把评测脚手架、Token 预算和统计口径写在旁边。

DeepSeek 技术报告

同一 Pro,模式越深,复杂任务提升越明显

Non High Max
GPQA Diamond研究生级科学问答
72.9
89.1
90.1
SWE-bench Verified真实代码仓修复
73.6
79.4
80.6
MRCR 1MTable 7 聚合分
44.7
83.3
83.5
Humanity’s Last Exam高难综合题
7.7
34.5
37.7

这些是官方自测。MRCR 83.5 是 Table 7 覆盖至 1M 设置的聚合分,不是精确 1024K 端点。

独立评测 · NIST CAISI / 2026-05

强,但 held-out 任务显示仍有明显缺口

CAISI 在 H200/B200 上按开发者推荐设置服务 Max 模式,并先复现官方 GPQA 结果以排除明显配置错误;只有 Agentic(智能体式)评测使用 Inspect 内置 ReAct,其中 PortBench 与 CTF-Archive-Diamond(Capture the Flag,网络夺旗赛)的预算各为 1M weighted tokens(加权 Token),SWE-bench 为 500K。其 IRT(Item Response Theory,项目反应理论)聚合方法估计 V4-Pro 约处在此前沿 8 个月前的能力位置;数学和 GPQA 接近强闭源模型,但 PortBench、ARC-AGI-2 半私有集与网络安全任务仍有差距。

74%SWE-bench Verified*
90%GPQA Diamond
44%PortBench
46%ARC-AGI-2 Semi-private**
800 ± 28IRT Elo · 95% 置信区间

* CAISI 提醒 SWE 分数会受 System Prompt、脚手架与 Token 预算影响。** 46% 是任务均值,不是 ARC-AGI-2 官方聚合分。

Artificial Analysis 动态快照44Intelligence Index v4.1
输出速度观测62.3 tok/sDeepSeek 官方 API
TTFT 观测约 1.8 s2026-07-16 页面快照
这轮评测输出≈ 180M输出 Token,明显偏长
最可靠的使用方式:先看官方上限,再用独立 Held-out 结果校准,最后把自己的 Prompt、工具、预算和超时固定下来做回归。Artificial Analysis 属于动态服务观测;上面一行是 2026-07-16 抓取快照,不应当作长期 SLA。
08 · 权重与 KV

“每次只算 49B”为什么仍然需要大型 GPU 集群

MoE 省的是每个 Token 的计算,不会让未激活专家的权重自动消失。真正部署时,要同时规划权重常驻、专家通信、每请求 KV、工作区和并发余量。

DeepSeek-V4-Pro 的 64 个权重分片约 864.7GB,经主机内存与格式准备后分布到 TP/EP GPU Mesh;每个 Token 只路由到 6 个专家,但完整专家权重仍要常驻集群
权重体积与激活参数是两本账:Pro 对话权重约 864.7 GB / 805.3 GiB;49B active 只描述一次前向真正参与的参数量。查看原图 ↗
Pro Instruct 权重864.7 GB约 805.3 GiB · 64 shards
Pro-DSpark 权重892.7 GB66 shards · 比普通 Pro 多约 28.0 GB Draft
Pro-Base 权重1.606 TBFP8 Mixed,和对话权重不是同一体积
vLLM Recipe 元数据960 GB规划字段,不是 DeepSeek 的普适最低显存
DeepSeek-V4 每请求 KV 分为最近 128 Token 与压缩尾部的状态缓存、30 层 CSA 与 31 层 HCA 的块缓存,以及可选磁盘前缀缓存;1M BF16 V4 KV 约 9.62GiB,对比 V3.2 风格约 83.9GiB
V4 的 KV 不是一块同构张量,而是短状态 + CSA/HCA 压缩块的异构组合。托管 API Context Cache 与论文的磁盘 SWA 策略是两条不同产品/研究路径。查看原图 ↗
白话

把“整本书的逐页复印件”换成“最近原文 + 历史索引卡”

V3.2 风格的 KV 更像每层都保存厚厚的逐页复印件;V4 只完整保留最近窗口与压缩器尾部,其余历史按 CSA/HCA 的格式存成可检索摘要。于是 1M 单序列 BF16 KV 的公开算术约为 9.62 GiB,而 V3.2-style 约 83.9 GiB

混合低精度约 4.8 GiB / 1M 是根据 vLLM“约再减半”做的粗估,RoPE 维仍保留 BF16。它不能直接拿来做“剩余 HBM ÷ 4.8 = 并发数”,因为还有状态缓存、碎片、工作区、图捕获与 Prefill 峰值。
09 · API 与成本

先让 API 验证价值,再决定是否承担 1.6T 私有化工程

托管入口的正式 ID 是 deepseek-v4-pro。官方 API 文档以 1M 总上下文、最高 384K 输出描述合同,并明确输入与生成 Token 共享窗口;开放 checkpoint 的机器配置则是 1,048,576。二者不要在容量校验里偷偷混成一个精确数字。

正式模型 IDdeepseek-v4-pro

OpenAI Base:https://api.deepseek.com
Anthropic Base:/anthropic

1M总 Context
384K最大总输出
500默认账户并发
High普通 Thinking 默认

本页成本实验的校验口径:按官方 DeepSeek Agent 集成仓库给出的整数配置,使用 context_window=1,000,000max_tokens=384,000;本页前半段的 1,048,576 仅用于开放 checkpoint 配置与 KV 教学算术。

可交互 · API Cost Lab

缓存命中和 reasoning 长度,会怎样改变一单成本?

价格快照:2026-07-16,USD / 1M Token。输出包含 reasoning + final answer;不含重试和后续工具轮次。

本次估算$0.095700
未命中输入
$0.087000
命中输入
$0.000000
reasoning + final
$0.008700
Pro:hit $0.003625 · miss $0.435 · output $0.87 / 1M
怎样提高缓存复用

把稳定的 System Prompt、工具定义和公共资料放前面,把变化内容放后面。缓存是 Best-effort,完整命中已持久化 Prefix Unit 才可能生效。

何时从 Flash 升级 Pro

默认把抽取、分类、简单 Agent 放在 Flash;遇到复杂知识、长链推理或高难代码再路由到 Pro High,失败或低置信时才升级 Max。

连接层要处理什么

超并发会返回 429;等待 10 分钟仍未开始推理会断开。流式与非流式客户端都应正确处理 keepalive、重试和幂等。

迁移提醒:deepseek-chat / deepseek-reasoner 过渡期映射的是 V4-Flash,并计划于 2026-07-24 15:59 UTC 停用;它们不是 Pro 的别名。FIM 走单独 Beta 接口,仅 Non-thinking,当前最大 4K。
10 · 生产部署

正确的生产拓扑:GPU 负责推理,控制面负责权限与工具

真正上线时,模型池只是系统中的一个部件。鉴权、限流、模型路由、工具策略、Sandbox、缓存和审计都应在模型外形成清晰控制面。

生产请求从客户端进入 Gateway,再经 Orchestrator 与 Policy 到 Model Router,分流至 V4-Flash 或 V4-Pro GPU 池;Pro 可选 Prefill/Decode 分离和分层缓存;工具调用必须回编排器校验后进入受限 Sandbox,并作为新消息重新请求模型
工具结果不应从 Expert Parallel GPU Mesh 直接塞回 Decode;它先回控制面,经校验、审计后作为新一轮消息重新进入 Serving。查看原图 ↗
路径 A · 托管 API

最快验证产品价值

不用承担权重驻留、跨机 EP、Kernel 与弹性伸缩。代价是底层硬件、量化路径、服务 checkpoint 和延迟 SLA 不公开。

适合:试点、波动负载、先做能力验证
路径 B · vLLM / SGLang

控制数据与运行栈

从框架的“已验证 Recipe”开始,而不是从理论显存下限反推机器。需要团队能维护 TP/EP、网络、缓存与版本矩阵。

适合:稳定大流量、合规隔离、深度定制
路径 C · Reference

先验证结构正确

官方参考实现最接近 checkpoint 结构,适合正确性和研究;它不替代生产 Serving 的健康检查、调度、扩缩容与 SLA。

适合:研究、对齐输出、Kernel 验证
展开已验证的框架与硬件路线vLLM 与 SGLang 分轨看
vLLM

Recipe 要求 ≥ 0.20;核查日稳定版 0.25.1

  • 官方 Pro Quickstart:8× B200/B300、DP8 + EP、FP8 KV、FP4 Indexer。
  • Recipe 标注验证 H200、B200、GB200、B300、GB300、MI355X;960GB 是规划字段。
  • 当前 H200 YAML 实际参数是 200K,注释/Guide 写 800K,内部存在不一致。
  • DSpark Recipe 需要 0.25 / nightly,不应套用普通 Pro 的版本结论。
SGLang

V4 自 0.5.12;核查日稳定版 0.5.15.post1

  • B200/B300:Native FP4,TP8 单机;GB300:TP4。
  • H200 Native FP4:TP8 单机;转换 FP8:TP16 / 2 节点。
  • H100 Native FP4:TP16 / 2 节点;GB200:TP8 / 2 节点。
  • MI355X:Native FP4 或 Converted FP8,TP8 已验证。

Transformers 5.14.0(核查日稳定版)能加载和研究 checkpoint,不等于能高效服务约 865GB 的多机 MoE。FlashMLA 的独立 README 主要明确 V3/V3.2;运行 V4 应优先使用已集成 V4 Backend 的 vLLM / SGLang 路径。DSpark recipe 虽要求 vLLM ≥ 0.25.0,当前 YAML 仍标记 nightly_required: true,部署应以 recipe 实测而非版本号推断。

上线前五件事

  1. 路由:简单任务先 Flash,复杂任务进 Pro,Max 只在失败/低置信时升级。
  2. 权限:工具白名单、参数 Schema、网络/文件最小权限和高风险动作确认。
  3. 容量:分别压测 Prefill、Decode、长上下文 KV、Expert All-to-All 与故障重建。
  4. 可观测:记录 TTFT、TPOT、缓存 Hit/Miss、reasoning Token、工具成功率与 429。
  5. 回归:固定 Prompt、Parser、工具版本、Token 预算和评测集,再比较模型或框架版本。
11 · 能力边界

它已经很强,但“1M、开放、Preview”各有自己的边界

这些不是论文勘误,而是产品选型要同时看到的三张标签:能做什么、需要什么、公开资料还没有告诉我们什么。

现在很适合

长文档、代码、数学与工具型 Agent

  • 需要百万级配置窗口和较低长上下文 KV 成本
  • 希望使用 MIT 开放权重做研究或私有化
  • 能按任务在 Flash / Pro / High / Max 之间路由
  • 有外部 Sandbox、权限与审计系统承接工具动作
它不是

一台工作站上的 49B 全能模型

  • 当前是纯文本输入/输出,不是 Omni 多模态模型
  • 支持 1M 不等于精确 1M 端点仍保持满分检索
  • 开放权重不等于开放完整数据、训练代码与集群配方
  • 模型内置拒答不替代生产权限控制和内容安全
尚未公开

训练数据截止日期、完整来源比例、预训练芯片/数量/时长/成本、总 FLOPs 与能耗。

尚未公开

托管 API 的 GPU、checkpoint hash、量化路径、是否启用 MTP/DSpark,以及明确延迟/吞吐 SLA。

仍会变化

Preview 架构的框架支持、Recipe 参数、价格、旧别名与第三方动态榜单;生产前需重新核查。

独立安全压力测试 · FAR.AI / 2026-05

“直接拒答”不等于“对抗条件下守得住”

FAR.AI 通过 DeepSeek 官方 API 测试 CBRN(Chemical, Biological, Radiological and Nuclear,化学/生物/放射/核)、网络攻击与恐怖主义相关高风险提示。未经操纵的直接请求全部被拒;加入三种低门槛攻击后,跨领域攻击成功率达到 98–100%。这是特定红队集的结果,不代表所有安全场景,但足以说明生产系统不能把模型内置拒答当作权限边界。

100%直接高风险请求被阻断
98–100%三类对抗攻击跨领域成功率
旧攻击复用V3.2 公开 jailbreak 无需修改即生效
一句话结论

DeepSeek-V4-Pro 的真正突破,不是“把窗口写成 1M”,而是把历史表示、层间运输、专家计算和训练/服务基础设施一起重做。它把百万上下文从暴力扫描改成多分辨率读取,但 1.6T 总权重仍让私有化成为大型系统工程。最务实的落地顺序是:API 验证 → 自有任务回归 → 容量与安全压测 → 再决定是否自部署。

12 · 资料来源

这篇专题依赖什么证据

架构和训练优先采用官方技术报告、模型配置与权重索引;API/价格使用核查日官方文档;能力边界再用 NIST、Artificial Analysis 与 FAR.AI 的独立材料校准。

核查日期:2026-07-16。价格、别名、并发限制、框架版本、Recipe 与第三方榜单属于动态信息;用于生产采购或容量规划前,请重新打开对应一手链接。第三方服务观测标明快照日,不伪装成固定 SLA。