V4-Pro
1.6T 总参 / 49B 激活。面向复杂知识、难代码、长链 Agent;对话权重主要是 FP4 Experts + FP8 其余部分。
API:deepseek-v4-proDeepSeek-V4-Pro 不是简单把上下文窗口拉长。它让 61 层在两种压缩注意力之间交错,用四路残差稳住训练,再让 384 位专家每次只上场 6 位。结果是:历史很长,但每层不必把整段历史原样重读。
49B active 不等于 49B 模型。每个 Token 只激活部分专家,但部署仍要让约 1.6T 总权重可被 GPU 集群访问。
选择 V4 前,先分清“能力模型”“推理模式”和“加速模块”。否则很容易把 Pro-Max 当成新权重,或把 49B active 误读成单卡模型。
1.6T 总参 / 49B 激活。面向复杂知识、难代码、长链 Agent;对话权重主要是 FP4 Experts + FP8 其余部分。
API:deepseek-v4-pro284B 总参 / 13B 激活。适合抽取、分类、简单工具流和高并发;同样支持 1M 配置窗口。
旧 chat / reasoner 暂时指向它Pro-Max = 同一 Pro 权重,把推理预算开到最大 Pro-DSpark = Pro + 猜后续 Token 的 Draft 模块 Pro-Base = 未做完整对话后训练的基础 checkpoint 把 Pro 想成一所拥有 384 个专业科室的大医院。49B active 只表示一次会诊真正叫来的医生数量,不表示其余科室可以从楼里消失;自部署时仍要让全部权重有地方常驻和被访问。
V4 的创新不是孤立模块堆叠,而是一条端到端数据流:Attention 管“去哪里找历史”,MoE 管“请哪些专家加工”,mHC 管“信息怎样安全地跨层流动”。
Embedding 把 Token ID 变成模型能计算的向量。mHC 虽维护四条残差流,但真正送进 Attention 与 MoE 的主向量仍是 hidden size 7168。
每个 Block 先通过 CSA 或 HCA 读取历史,再让 1 个共享专家和 6 个路由专家加工。mHC 把结果稳妥地送往下一层。
61 层后,LM Head 给词表中的候选打分。生成时不断重复这条链;训练时 MTP 还会辅助预测更远的未来 Token。
当前 Query 不再对 1M 条原始 KV 逐一做核心 Attention。它一边完整看最近 128 Token,一边让 CSA 精选较细的历史摘要,同时让 HCA 浏览更粗但覆盖完整历史的摘要。
SWA 是桌面上最近翻过的 128 页,原文最清楚;CSA 是检索员先把旧档案每 4 页做成重叠摘要,再挑出最相关的 1,024 条;HCA 是全库目录册,每 128 页压成一条,虽然更粗,但整本档案都覆盖。
下面是按公开配置做的教学近似。它能帮助理解数量级,但不包含压缩器、Indexer、MoE、通信、工作区与调度,因此不能直接换算成吞吐。
CSA 压缩步幅按 4、Top-k 上限 1,024;HCA 压缩率按 128;SWA 按最近 128。CSA 给固定预算的“相关历史”更细粒度;HCA 用更粗的摘要换取完整覆盖。二者一起避免只看近处,也避免每层都全量扫描 1M 原始 KV。
官方估算 1M 下,Pro 单 Token 等效 FP8 FLOPs 为 V3.2 的 27%,累计 KV 为 10%。这是结构估算,不是“真实延迟缩短 73%”。
百万上下文只是第一层问题。更大的难点是:61 层信息不能越传越失控,384 个专家又要分散在多张 GPU 上高效协同。
普通 Transformer 只有一条 residual stream。mHC 维护四条通道,让不同信息有更多传递路径;但每次混合都被限制成“双随机矩阵”,每行、每列权重和为 1,避免某条通道无边界放大。
约束后的混合矩阵谱范数不超过 1,因此这一步本身不会放大残差流。它是稳定性条件,不是对任意训练过程的绝对保证。技术报告给出的实现开销约为普通 residual 的 6.7%。
Router 根据当前 Token 选择 6 个 routed experts,shared expert 始终参与。前 3 个 MoE 层采用基于 Token ID 的 Hash Routing,后续层再用学习到的亲和度分配。
这两个比例分母不同,不能把“选了 1.56% 专家”直接等同于“只激活 1.56% 参数”。
V4-Pro 的训练可以分成两条连续故事:预训练解决“读得长且不崩”,后训练解决“会推理、会工具、会统一不同领域能力”。
模型先在 4K 上学会稳定阅读,再到 16K、64K,最终进入 1M。CSA 也不是突然开始“挑资料”:先用稠密 Attention 打基础,再让 Indexer 学会打分,最后才真正按 Top-k 稀疏读取。
不同领域先分别训练,数学、代码、工具等“专科老师”各自把能力练深;这一阶段没有被 OPD 全部替代。
统一 Student 在自己的 On-policy 轨迹上,学习多个 Teacher 的完整词表分布,而不只模仿最终答案。
Teacher、Reference、Student 都考虑量化路径,让 FP4 Experts 和低精度 Indexer 不至于在部署时突然变脸。
Reverse-KL 更偏向跟随 Teacher 的高概率区域。它替换的是最终 mixed-RL consolidation 路径,不代表“所有 RL 都被蒸馏取代”。
论文只说明满足 Scale 条件时,已经量化的 FP4 值可被 FP8 精确表示;不表示 FP32 → FP4 整体没有误差。QAT 正是让模型适应这部分误差。CSA Indexer 的 Q–K 路径同样进入 FP4;Index score 再由 FP32 降为 BF16,论文报告 Top-k Selector 提速 2×、KV 条目召回率 99.7%。
Pro checkpoint 本身含一层 MTP 参数,vLLM 可选把它复用为 speculative draft;DSpark 则附带更大的独立 Draft 模块。两者都不是普通 Decode 必经层,公开资料也没有证明托管 API 使用哪条投机路径。
教师权重按需从集中式分布存储加载,并做类似 ZeRO 的参数分片;前向只缓存最后一层 hidden state,训练时再逐个装入对应 prediction head 重建完整词表 logits。样本按教师排序,单个 mini-batch 同时最多驻留一个教师输出头;权重与 hidden state 异步搬运,最终由专用 TileLang kernel 计算精确 KL。这里的“教师数量近乎不受限”是调度能力,不表示所有教师同时常驻 GPU。
Pro-Max 不是更大的模型。模式切换改变的是推理长度、工具链行为和成本,而不是换了一套参数。
适合摘要、改写、分类、简单抽取和短问答。减少 reasoning Token,也减少等待与输出费用。
不是“弱模型”,只是少走显式推理路径。适合代码、知识问答、工具调用与大多数 Agent 任务。通常是质量、时延和成本之间的默认平衡点。
Thinking 默认开启;low / medium 会映射到 High。适合难数学、复杂代码和长时 Agent。它可能生成大量 reasoning Token,因此更强不等于每次请求都更划算。
xhigh 会映射到 Max;自部署建议为它保留至少 384K 长度。如果模型在 Thinking 中发出 Tool Call,下一次 API 请求必须完整带回那条 Assistant 消息的 reasoning_content;缺失会返回 400。没有 Tool Call 的旧 reasoning 可以省略。模型提出工具调用后,仍应由编排器做 Schema 与权限校验,再进受限 Sandbox。
把两类证据并排看,比只盯一张排行榜更接近真实选型。下面保留具体数字,也把评测脚手架、Token 预算和统计口径写在旁边。
这些是官方自测。MRCR 83.5 是 Table 7 覆盖至 1M 设置的聚合分,不是精确 1024K 端点。
CAISI 在 H200/B200 上按开发者推荐设置服务 Max 模式,并先复现官方 GPQA 结果以排除明显配置错误;只有 Agentic(智能体式)评测使用 Inspect 内置 ReAct,其中 PortBench 与 CTF-Archive-Diamond(Capture the Flag,网络夺旗赛)的预算各为 1M weighted tokens(加权 Token),SWE-bench 为 500K。其 IRT(Item Response Theory,项目反应理论)聚合方法估计 V4-Pro 约处在此前沿 8 个月前的能力位置;数学和 GPQA 接近强闭源模型,但 PortBench、ARC-AGI-2 半私有集与网络安全任务仍有差距。
* CAISI 提醒 SWE 分数会受 System Prompt、脚手架与 Token 预算影响。** 46% 是任务均值,不是 ARC-AGI-2 官方聚合分。
MoE 省的是每个 Token 的计算,不会让未激活专家的权重自动消失。真正部署时,要同时规划权重常驻、专家通信、每请求 KV、工作区和并发余量。
V3.2 风格的 KV 更像每层都保存厚厚的逐页复印件;V4 只完整保留最近窗口与压缩器尾部,其余历史按 CSA/HCA 的格式存成可检索摘要。于是 1M 单序列 BF16 KV 的公开算术约为 9.62 GiB,而 V3.2-style 约 83.9 GiB。
托管入口的正式 ID 是 deepseek-v4-pro。官方 API 文档以 1M 总上下文、最高 384K 输出描述合同,并明确输入与生成 Token 共享窗口;开放 checkpoint 的机器配置则是 1,048,576。二者不要在容量校验里偷偷混成一个精确数字。
deepseek-v4-pro OpenAI Base:https://api.deepseek.com
Anthropic Base:/anthropic
本页成本实验的校验口径:按官方 DeepSeek Agent 集成仓库给出的整数配置,使用 context_window=1,000,000、max_tokens=384,000;本页前半段的 1,048,576 仅用于开放 checkpoint 配置与 KV 教学算术。
价格快照:2026-07-16,USD / 1M Token。输出包含 reasoning + final answer;不含重试和后续工具轮次。
把稳定的 System Prompt、工具定义和公共资料放前面,把变化内容放后面。缓存是 Best-effort,完整命中已持久化 Prefix Unit 才可能生效。
默认把抽取、分类、简单 Agent 放在 Flash;遇到复杂知识、长链推理或高难代码再路由到 Pro High,失败或低置信时才升级 Max。
超并发会返回 429;等待 10 分钟仍未开始推理会断开。流式与非流式客户端都应正确处理 keepalive、重试和幂等。
deepseek-chat / deepseek-reasoner 过渡期映射的是 V4-Flash,并计划于 2026-07-24 15:59 UTC 停用;它们不是 Pro 的别名。FIM 走单独 Beta 接口,仅 Non-thinking,当前最大 4K。真正上线时,模型池只是系统中的一个部件。鉴权、限流、模型路由、工具策略、Sandbox、缓存和审计都应在模型外形成清晰控制面。
不用承担权重驻留、跨机 EP、Kernel 与弹性伸缩。代价是底层硬件、量化路径、服务 checkpoint 和延迟 SLA 不公开。
适合:试点、波动负载、先做能力验证从框架的“已验证 Recipe”开始,而不是从理论显存下限反推机器。需要团队能维护 TP/EP、网络、缓存与版本矩阵。
适合:稳定大流量、合规隔离、深度定制官方参考实现最接近 checkpoint 结构,适合正确性和研究;它不替代生产 Serving 的健康检查、调度、扩缩容与 SLA。
适合:研究、对齐输出、Kernel 验证Transformers 5.14.0(核查日稳定版)能加载和研究 checkpoint,不等于能高效服务约 865GB 的多机 MoE。FlashMLA 的独立 README 主要明确 V3/V3.2;运行 V4 应优先使用已集成 V4 Backend 的 vLLM / SGLang 路径。DSpark recipe 虽要求 vLLM ≥ 0.25.0,当前 YAML 仍标记 nightly_required: true,部署应以 recipe 实测而非版本号推断。
这些不是论文勘误,而是产品选型要同时看到的三张标签:能做什么、需要什么、公开资料还没有告诉我们什么。
训练数据截止日期、完整来源比例、预训练芯片/数量/时长/成本、总 FLOPs 与能耗。
托管 API 的 GPU、checkpoint hash、量化路径、是否启用 MTP/DSpark,以及明确延迟/吞吐 SLA。
Preview 架构的框架支持、Recipe 参数、价格、旧别名与第三方动态榜单;生产前需重新核查。
FAR.AI 通过 DeepSeek 官方 API 测试 CBRN(Chemical, Biological, Radiological and Nuclear,化学/生物/放射/核)、网络攻击与恐怖主义相关高风险提示。未经操纵的直接请求全部被拒;加入三种低门槛攻击后,跨领域攻击成功率达到 98–100%。这是特定红队集的结果,不代表所有安全场景,但足以说明生产系统不能把模型内置拒答当作权限边界。
DeepSeek-V4-Pro 的真正突破,不是“把窗口写成 1M”,而是把历史表示、层间运输、专家计算和训练/服务基础设施一起重做。它把百万上下文从暴力扫描改成多分辨率读取,但 1.6T 总权重仍让私有化成为大型系统工程。最务实的落地顺序是:API 验证 → 自有任务回归 → 容量与安全压测 → 再决定是否自部署。
架构和训练优先采用官方技术报告、模型配置与权重索引;API/价格使用核查日官方文档;能力边界再用 NIST、Artificial Analysis 与 FAR.AI 的独立材料校准。
发布时间、型号与旧别名变更
架构、训练、效率估算与官方评测
机器可读结构、模式与参考推理
64 个分片与权重体积
开放权重许可
1M 上下文、384K 输出与功能字段
Pro / Flash 当前 Token 单价
High / Max、reasoning_content 与工具轮次
托管缓存的命中条件与生命周期
并发、429、超时与 user_id
Non-thinking Beta 与 4K 限制
异构 KV 算术与 Day-0 支持
版本、并行、显存规划与长度参数
已验证硬件与精度矩阵
研究与加载路径
Draft 模块与推测解码
Agentic 评测的 Inspect ReAct、预算与跨域结果
动态能力、速度与输出长度观测
拒答与越狱测试边界
稳定版与 V4 / NVFP4 支持变更
V4 支持起点与当前补丁版
研究加载路径的当前版本
第三方转换权重的体积与精度口径
1,000,000 / 384,000 的集成配置整数口径