MiniMax-M3
OpenAI、Anthropic 与 Responses 兼容入口;Priority 仍调用同一个模型。
MiniMax M3 的关键,不只是把窗口写成 1M。它用 MSA 把长历史切成一格格“资料盒”,先找出最相关的 16 盒,再让主注意力精读;同时把文本、图像、视频、Coding 和工具调用装进一个约 428B、每 Token 激活约 23B 的开放权重 MoE。
API 很值得先试,自部署则是集群工程。它把长上下文、多模态与 Agent 放进同一个模型,但 23B Active 并不意味着只需装 23B 权重。
Hugging Face 模型 API 的 safetensors metadata 合计 427,040,140,160 个参数;“约 428B”是官方模型卡口径。
同一套 M3 能以托管 API、BF16、MXFP8、NVFP4 权重出现。先把“模型、服务档位、量化权重”分开,后面的性能和成本才不会串线。
把 M3 想成一部电影:模型架构是影片本身,BF16 / MXFP8 / NVFP4 是不同压缩规格,API 是电影院,Standard / Priority 是普通通道和优先入场。它们相关,但不是同一个东西。
OpenAI、Anthropic 与 Responses 兼容入口;Priority 仍调用同一个模型。
59 个分片约 854.176 GB,适合作为质量基线,不是“23B 模型”。
31 个分片约 443.749 GB;权重精度与 KV Cache 精度要分别配置。
88 个分片约 250.104 GB,面向 Blackwell;量化会带来小幅任务波动。
max_position_embeddings 的本地配置上限。
官方 API 总览明确按两者合计计入上下文;不能把 1M 输入与 512K 输出同时取满。
OpenAI Chat schema 的 M3 合同;产品页另承诺至少 512K 可用上下文。
M3 的前 3 层像统一接待处,使用 Dense MLP 与 Full Attention;后 57 层才进入 MSA + MoE 主舞台。视觉输入先被切成 patch、编码并投影到 6,144 维,再与文本 Token 交错。
文字像直接拿着号码牌进大厅;图片和视频先被切成很多小方格,由“视觉翻译员”读懂,再换成与文字相同尺寸的向量。此后模型不再把它们当“图片”和“字”,而是把它们当作可以一起推理的一串语义 Token。
文本查 Embedding;图像按 14×14 patch 编码,视频再加入时间维度。
MSA 先扫描整个可见上下文,按 128 Token 一块做相关性选择。
每个 Token 从 128 位路由专家中选 4 位,同时经过 1 位共享专家。
LM Head 给出下一个 Token;工具请求交回外部编排器执行。
Dense Attention 会让每个 Query 与所有历史 Token 逐一计算。MSA 增加一条轻量 Index Branch:它仍看完整历史,但先把历史按 128 Token 分块,为每个 GQA 组挑 Top-16;Main Branch 只在入选 Token 集上做标准 scaled-dot-product Softmax Attention。
你在八千多箱档案里找一条线索。传统方法是把每箱都摊开细读;MSA 先用一位速度很快的索引员扫标签,挑出最相关的 16 箱,再让研究员逐页精读。索引员仍要巡视全场,所以它不是“完全不看其他内容”。
每组主分支预算固定为最多 16×128 = 2,048 Token;下方百分比只描述 Main Branch 的候选占比,不等于整层 FLOPs 同比下降。
完整 1M 窗口下的近似档案箱数量。
local block 强制包含在 Top-16 预算里。
这是每个 Query / GQA 组的最大精读量。
如果稀疏索引最后变成大量随机小读取,理论 FLOPs 降了,GPU 仍可能闲着。M3 的内核把视角从“每个 Query 去找 KV”翻成“一个 KV block 把需要它的 Queries 聚到一起”,让同一块 KV 被连续复用。
差的搬法像 100 位同学各自跑仓库拿同一本书,书被重复搬 100 次;KV-outer 像仓库员拿着一本书出来,叫所有需要它的同学一起看。算式没变,但搬运次数、排队方式和矩阵大小都更适合 GPU。
Main Branch 在已选 Token 上得到标准 Softmax 概率;同一 GQA Group 内先跨 Query Heads 平均主支概率,再把整个教师分布 stop-gradient。该 KL 辅助损失只更新 Index Q/K,Main Branch 与主干仍按语言模型目标正常前向和训练。
两代模型规模与架构不同,代表产品代际收益,不应全部归因给 MSA。
H800、109B 总参 / 6B Active;这是受控研究模型,不是 428B M3 端到端服务。
约 140B 长上下文训练后,HELMET Overall:Full 46.53 / MSA 45.93(−0.60);RULER:72.00 / 72.12(+0.12)。
28.4× / 14.2× / 7.6× 是论文在 1M 长度上的 FLOPs、Prefill 与 Decode 效率,不等于完整 1M 能力已同等验证。
官方称 M3 从 Step 0 混合文本、图像与视频训练。公开视觉配置给出 32 层视觉编码器、14×14 patch、2×2 空间合并、temporal patch size 2,再投影进 6,144 维语言主干。
外挂视觉像请翻译临时把图片总结成一句话;原生多模态更像图、视频和文字从小就在同一个班上课。它更有机会把画面细节与代码、指令、时间变化放在同一条推理链里,但效果仍受分辨率、抽帧率和上下文预算影响。
所有专家的知识都存着,但一枚 Token 只叫来 4 位最合适的专科医生,再加 1 位一直在线的全科医生。这样计算量小于让 128 位都上场。
配置确实暴露 7 个 MTP module,但“7”不能直接翻译成官方已上线的 7-Token 推测解码。vLLM 的 EAGLE3 draft head 是另一套外部加速路径。
长程 Agent 需要反复观察环境、思考、调用工具、读回结果、修正计划。MiniMax 披露了交互式用户模拟器与长任务训练;MaxProof 则把 generation、verification、critique-conditioned repair 三类能力合入同一 M3,并在测试时让它按 Prompt 扮演 generator、verifier、refiner 与 ranker。
传统问答像闭卷考试:写完答案就结束。Agent 更像实习工程师:拿到任务后要开终端、看报错、改代码、跑测试,必要时向“用户”追问,再把产物交给验收员。模型聪明只是起点,工作台和验收规则同样重要。
18 commits、23 张实验图;说明可维持长线程,不代表所有论文都能稳定复现。
1,959 次工具调用、147 次提交;利用率从 7.6% 提到 71.3%。
同一 M3 以四种 Prompt 角色参与人口搜索;IMO 2025 的 35/42 不是单次回答分数。
官方榜单说明“训练目标的上限”,独立统一脚手架说明“换一套环境还能剩多少”,真实业务 Eval 决定“对你有没有用”。三者缺一不可。
厂商成绩像运动员自己的最好训练记录;独立榜单像统一场地的邀请赛;你的业务测试才是正式上岗。一个模型可以在 Coding 很强,却在财务建模、长视频细节或超长工具轨迹上暴露另一套问题。
另有 Terminal-Bench 2.1 66.0%、MCP Atlas 74.2%。不同 benchmark 使用不同 scaffold 和超时设置。
统一最小 ReAct、128K、每模型 5 次;Pass@5 67.3%,平均约 689 万 Token / 题。
首方 API 动态实测 92.7 tok/s、TTFT 1.94s(17:29 CST);短请求快照不代表 1M Prefill。
927 道专家审题、统一六工具脚手架;Coding 与浏览能力不会自动变成可靠金融分析。
SWE-rebench 中 M3 约消耗 688.6 万 Token / 题,高于同榜一些模型。低 Token 单价不等于低任务成本;应追踪“每个成功任务花了多少 Token、工具调用和重试”。
M3 支持 Interleaved Thinking:可以先想、调用工具、读回结果、继续想。工程上最重要的规则,是把完整 Assistant 响应连同 reasoning / thinking blocks、tool_calls 一起传回下一轮。
模型像坐在控制室里的调度员,只能写“请查数据库”或“请点击这个按钮”的工单。编排器像值班主管:检查权限、决定是否批准、让沙箱执行,再把结果交回模型。没有这层,Agent 就既不可靠也不安全。
未设置时模板默认 adaptive;这是权重模板的三态。
未传默认 adaptive;reasoning_split 只控制输出格式。
开启用 adaptive;下一轮须原样保留 thinking signature 与内容块。
minimal / low / medium / high 当前都映射为 adaptive,不调节真实深度。
{
"model": "MiniMax-M3",
"thinking": { "type": "adaptive" },
"messages": [ ... ],
"tools": [ ... ]
} 官方当前采用输入长度阶梯价。缓存命中价格更低,但判断是否跨档看总输入 Token,包含 cache-hit 部分。下面按 2026-07-15 美元价格快照估算。
新输入 / 输出 / Cache Read,单位均为每百万 Token。
输入一旦跨档,新输入、输出与缓存读取价格均翻倍。
同一个 MiniMax-M3 的优先调度,不是另一款 Highspeed 模型。
这是 Token 费用估算,不含外部搜索、沙箱、存储、重试或第三方工具成本。Hosted API 要求输入与输出合计不超过 1,000,000。
总长度 105,000 / 1,000,000;输出推荐不超过 131,072,协议最大 524,288。
M3 的被动缓存按前缀匹配,512 个输入 Token 以上才应用。把稳定内容放前面,别每轮重排工具或 System Prompt。
每个 Token 只激活约 23B 参数,但 128 位专家的完整权重仍要常驻 GPU / 主机内存或被卸载搬运。权重装下之后,还要为 KV Cache、通信、CUDA Graph 和并发留空间。
餐厅每天只叫 4 位专科厨师上灶,不代表其他 124 位可以不雇、不安排工位。MoE 省的是每道菜实际参与计算的人数;自部署仍要把整支团队安置好,或接受从外地临时调人的搬运延迟。
59 shards · 十进制字节快照
31 shards · 十进制字节快照
88 shards · 十进制字节快照
vllm serve MiniMaxAI/MiniMax-M3 \
--tensor-parallel-size 8 \
--block-size 128 \
--tool-call-parser minimax_m3 \
--reasoning-parser minimax_m3 \
--enable-auto-tool-choice 不要一上来就开 1M。先按业务设 32K / 128K / 256K,测 TTFT、TPOT 和并发。
MXFP8 只说明权重格式;KV Cache 是否 FP8 是另一项运行时配置。
vLLM、SGLang、CUDA / ROCm、parser 与 MSA kernel 版本必须一起验收。
KTransformers 可大量 CPU 卸载,但仍需要数百 GB 主存和足够内存带宽。
图像和网页可能藏 Prompt Injection;并行工具返回可能串线;电脑操作有真实副作用。生产拓扑要把上下文、权限、沙箱、审计和人类确认放在模型外。
M3 的组合优势很明确:长上下文、原生图像视频、Coding Agent、低价 API 与开放权重同时出现。它的代价也同样具体:巨大的全量权重、复杂 runtime 适配和较高的 Agent Token 消耗。
MiniMax 自己尚未发布 428B M3 的完整分阶段训练 Token、语料与模态比例、完整 RL 预算、约 23B Active 的统一计算边界、7 个 MTP module 的生产接入,以及完整 1M 的独立有效深度。NVIDIA 合作文章的“约 100T interleaved tokens”是合作方口径,仍缺阶段与模态拆分。
优先使用官方配置、论文、API 文档与独立统一评测。动态价格、速度和排行榜均标注核查日期;社区 issue 只作为风险线索,不推导普遍故障率。
完整文字调研已落盘至 architecture/MiniMax/MiniMax-M3深度研究.md。本页是面向学习的可视化版本;许可证摘要不构成法律意见。