跳到正文
MINIMAX M3 · 深度研究 / 2026

先在百万上下文里
找到那几页,
再认真读

MiniMax M3 的关键,不只是把窗口写成 1M。它用 MSA 把长历史切成一格格“资料盒”,先找出最相关的 16 盒,再让主注意力精读;同时把文本、图像、视频、Coding 和工具调用装进一个约 428B、每 Token 激活约 23B 的开放权重 MoE。

一句话判断

API 很值得先试,自部署则是集群工程。它把长上下文、多模态与 Agent 放进同一个模型,但 23B Active 并不意味着只需装 23B 权重。

概念图:红色索引轨道从庞大的文本、图像、视频和代码资料库中选出少量片段,送进只点亮少数专家房间的模型,再生成代码、研究笔记和受保护的电脑操作
先检索,再精读,再行动——这是理解 M3 的主线。概念图用于建立直觉,后文技术图给出精确结构。
≈428B总参数
≈23B每 Token 激活
60 层3 Dense + 57 MoE
1,048,576Checkpoint 窗口
128 → 16Block 候选 → Top-k
2026-06-01正式发布

Hugging Face 模型 API 的 safetensors metadata 合计 427,040,140,160 个参数;“约 428B”是官方模型卡口径。

01 / 身份地图

它不是一个 API 名字,而是一整套交付形态

同一套 M3 能以托管 API、BF16、MXFP8、NVFP4 权重出现。先把“模型、服务档位、量化权重”分开,后面的性能和成本才不会串线。

MiniMax M3 交付地图:同一模型分别分叉到托管 API、官方 BF16 与 MXFP8 权重、NVIDIA NVFP4 合作量化,再进入各自服务或部署路线
托管服务里的 Standard / Priority 是同一模型的调度档位;当前官方没有 MiniMax-M3-highspeed 这个模型 ID。
白话先懂

把 M3 想成一部电影:模型架构是影片本身,BF16 / MXFP8 / NVFP4 是不同压缩规格,API 是电影院,Standard / Priority 是普通通道和优先入场。它们相关,但不是同一个东西。

API

MiniMax-M3

OpenAI、Anthropic 与 Responses 兼容入口;Priority 仍调用同一个模型。

16

BF16 主权重

59 个分片约 854.176 GB,适合作为质量基线,不是“23B 模型”。

8

官方 MXFP8

31 个分片约 443.749 GB;权重精度与 KV Cache 精度要分别配置。

4

NVIDIA NVFP4

88 个分片约 250.104 GB,面向 Blackwell;量化会带来小幅任务波动。

开放 Checkpoint1,048,576

max_position_embeddings 的本地配置上限。

Hosted API输入 + 输出 ≤ 1,000,000

官方 API 总览明确按两者合计计入上下文;不能把 1M 输入与 512K 输出同时取满。

生成长度推荐 128K · 最大 512K

OpenAI Chat schema 的 M3 合同;产品页另承诺至少 512K 可用上下文。

02 / 一枚 Token 的旅行

文本、图片和视频,最后都汇入同一条 60 层主干

M3 的前 3 层像统一接待处,使用 Dense MLP 与 Full Attention;后 57 层才进入 MSA + MoE 主舞台。视觉输入先被切成 patch、编码并投影到 6,144 维,再与文本 Token 交错。

MiniMax M3 总架构:文本嵌入与图像视频视觉塔投影后进入 60 层主干,前三层为 Full Attention 与 Dense MLP,后 57 层为 MSA 与 MoE,最后连接 LM Head 与公开配置中的 MTP 模块
公开 config 能确认层数、头数、专家数、视觉塔与 MTP 字段;发布版完整训练配方尚未全部公开。
白话先懂

文字像直接拿着号码牌进大厅;图片和视频先被切成很多小方格,由“视觉翻译员”读懂,再换成与文字相同尺寸的向量。此后模型不再把它们当“图片”和“字”,而是把它们当作可以一起推理的一串语义 Token。

6,144hidden size
64 Q / 4 KVGQA heads
128head dimension
200,064vocabulary
5,000,000RoPE theta
32 层vision encoder
① 看懂输入

文本查 Embedding;图像按 14×14 patch 编码,视频再加入时间维度。

② 找对历史

MSA 先扫描整个可见上下文,按 128 Token 一块做相关性选择。

③ 找对专家

每个 Token 从 128 位路由专家中选 4 位,同时经过 1 位共享专家。

④ 继续生成

LM Head 给出下一个 Token;工具请求交回外部编排器执行。

03 / 招牌机制

MSA:先在整座图书馆找书架,再精读 16 摞资料

Dense Attention 会让每个 Query 与所有历史 Token 逐一计算。MSA 增加一条轻量 Index Branch:它仍看完整历史,但先把历史按 128 Token 分块,为每个 GQA 组挑 Top-16;Main Branch 只在入选 Token 集上做标准 scaled-dot-product Softmax Attention。

MSA 两支结构:Index Branch 对完整上下文打分并按 128 Token 聚合为块,选择 Top-16 并强制保留当前 local block,Main Branch 收集这些块并执行精确 Softmax Attention
“稀疏”发生在候选选择;Main Branch 对入选集合使用正常的 scaled-dot-product Softmax,但它不是重新计算完整 Dense Attention。
白话先懂

你在八千多箱档案里找一条线索。传统方法是把每箱都摊开细读;MSA 先用一位速度很快的索引员扫标签,挑出最相关的 16 箱,再让研究员逐页精读。索引员仍要巡视全场,所以它不是“完全不看其他内容”。

可交互 / 自己拖一拖

上下文越长,Top-16 的选择比例越小

每组主分支预算固定为最多 16×128 = 2,048 Token;下方百分比只描述 Main Branch 的候选占比,不等于整层 FLOPs 同比下降。

切成8,192个 128-Token blocks
每组精读16Top-k blocks(含 local)
候选比例0.195%Main Branch 视角
1M 上下文预算图:1,048,576 Token 被切为 8,192 个块,Index Branch 扫描全部块,每个 GQA 组选择 16 个块,Main Branch 最多精读 2,048 Token
Index Branch 的系数很小但仍有 N² 项;论文在 109B matched 配置上报告的 1M attention FLOPs 改善是 28.4×,不是 512×。
候选池1,048,576 ÷ 128 = 8,192 块

完整 1M 窗口下的近似档案箱数量。

每组选择16 ÷ 8,192 = 0.195%

local block 强制包含在 Top-16 预算里。

主支预算16 × 128 = 2,048 Token

这是每个 Query / GQA 组的最大精读量。

04 / 算法 × 内核 × 训练

真正的加速,来自“少算”也来自“按 GPU 喜欢的方式搬数据”

如果稀疏索引最后变成大量随机小读取,理论 FLOPs 降了,GPU 仍可能闲着。M3 的内核把视角从“每个 Query 去找 KV”翻成“一个 KV block 把需要它的 Queries 聚到一起”,让同一块 KV 被连续复用。

MSA 内核对比:Query-outer 会让多个 Query 随机读取重复 KV block,KV-outer gather-Q 先按 KV block 聚合命中的 Query,再连续读取并做更饱满的矩阵计算
exp-free TopK、KV-outer gather-Q、持久化动态调度与 LSE 合并,负责把稀疏结构转化为 wall-clock 收益。
白话先懂

差的搬法像 100 位同学各自跑仓库拿同一本书,书被重复搬 100 次;KV-outer 像仓库员拿着一本书出来,叫所有需要它的同学一起看。算式没变,但搬运次数、排队方式和矩阵大小都更适合 GPU。

Index Branch 怎样学会“找得准”

Main Branch 在已选 Token 上得到标准 Softmax 概率;同一 GQA Group 内先跨 Query Heads 平均主支概率,再把整个教师分布 stop-gradient。该 KL 辅助损失只更新 Index Q/K,Main Branch 与主干仍按语言模型目标正常前向和训练。

MSA 训练图:Main Branch 正常前向,在已选 Token 上得到 Softmax 概率;同一 GQA Group 跨 Query Heads 平均后将教师分布整体停止梯度,Index Branch 仅接收 stopgrad(X),KL 只更新 Index Q/K
MSA-PT 与 MSA-CPT 的 Token 账来自 109B / 6B-active 论文模型。MiniMax 未发布 428B M3 的完整阶段账;NVIDIA 合作文章提到约 100T interleaved tokens,但未给模态与阶段拆分。
发布版 M3 vs M2 · 官方1M 下 Prefill >9× · Decode >15×

两代模型规模与架构不同,代表产品代际收益,不应全部归因给 MSA。

109B MSA vs GQA · 论文 matched 实验FLOPs 28.4× · Prefill 14.2× · Decode 7.6×

H800、109B 总参 / 6B Active;这是受控研究模型,不是 428B M3 端到端服务。

能力证据与效率证据分开读
128K · 能力对照

约 140B 长上下文训练后,HELMET Overall:Full 46.53 / MSA 45.93(−0.60);RULER:72.00 / 72.12(+0.12)。

1M · 效率对照

28.4× / 14.2× / 7.6× 是论文在 1M 长度上的 FLOPs、Prefill 与 Decode 效率,不等于完整 1M 能力已同等验证。

05 / 多模态与稀疏专家

“原生多模态”不是末尾接一只眼睛,而是从训练起就让图文视频一起生活

官方称 M3 从 Step 0 混合文本、图像与视频训练。公开视觉配置给出 32 层视觉编码器、14×14 patch、2×2 空间合并、temporal patch size 2,再投影进 6,144 维语言主干。

MiniMax M3 原生多模态数据流:图像和视频切为时空 patch,进入 32 层视觉编码器和空间合并,再投影到 6144 维,与文本 Token 交错进入语言主干
当前 API 接收文本、图片和视频并输出文本;“电脑操作”仍依赖截图、工具协议和外部 Agent scaffold。
白话先懂

外挂视觉像请翻译临时把图片总结成一句话;原生多模态更像图、视频和文字从小就在同一个班上课。它更有机会把画面细节与代码、指令、时间变化放在同一条推理链里,但效果仍受分辨率、抽帧率和上下文预算影响。

MiniMax M3 MoE 与 MTP:每个 Token 从 128 个路由专家中选择 4 个并经过 1 个共享专家;公开配置另列 7 个 MTP module,但官方尚未披露其训练目标与生产推理接入细节
Top-4 / 128 = 3.125% 是路由专家选择率;23B / 428B ≈ 5.4% 是全模型激活参数率,二者分母不同。
MoE 像专家会诊

所有专家的知识都存着,但一枚 Token 只叫来 4 位最合适的专科医生,再加 1 位一直在线的全科医生。这样计算量小于让 128 位都上场。

+
MTP 像提前打草稿

配置确实暴露 7 个 MTP module,但“7”不能直接翻译成官方已上线的 7-Token 推测解码。vLLM 的 EAGLE3 draft head 是另一套外部加速路径。

06 / Coding 与长程 Agent

模型不是只学“答对一问”,还要学会在几小时里持续做事

长程 Agent 需要反复观察环境、思考、调用工具、读回结果、修正计划。MiniMax 披露了交互式用户模拟器与长任务训练;MaxProof 则把 generation、verification、critique-conditioned repair 三类能力合入同一 M3,并在测试时让它按 Prompt 扮演 generator、verifier、refiner 与 ranker。

MiniMax M3 Agent 学习闭环:任务进入长程轨迹,模型多轮调用终端、浏览器和代码工具,交互式用户模拟器补充反馈,环境结果回到下一轮推理
Agent 能力来自模型、工具 scaffold、环境、预算与验收共同作用;不能只用一次聊天体验判断。
白话先懂

传统问答像闭卷考试:写完答案就结束。Agent 更像实习工程师:拿到任务后要开终端、看报错、改代码、跑测试,必要时向“用户”追问,再把产物交给验收员。模型聪明只是起点,工作台和验收规则同样重要。

官方案例 / 论文复现≈12 小时

18 commits、23 张实验图;说明可维持长线程,不代表所有论文都能稳定复现。

官方案例 / CUDA Kernel≈24 小时

1,959 次工具调用、147 次提交;利用率从 7.6% 提到 71.3%。

MaxProof 测试时系统生成 · 验证 · 精修 · 排序

同一 M3 以四种 Prompt 角色参与人口搜索;IMO 2025 的 35/42 不是单次回答分数。

07 / 证据怎么读

它很强,但真正可信的结论来自多层证据交叉

官方榜单说明“训练目标的上限”,独立统一脚手架说明“换一套环境还能剩多少”,真实业务 Eval 决定“对你有没有用”。三者缺一不可。

MiniMax M3 证据阶梯:官方能力分数、109B MSA matched 实验、Artificial Analysis 与 SWE-rebench 独立评测、专业领域反例和真实业务验证
动态榜单按 2026-07-15 快照记录;AA 速度与延迟核查于 17:29 CST。旧版约 55 与当前 v4.1 的 44 属于不同指数版本,不能解释为模型突然退化。
白话先懂

厂商成绩像运动员自己的最好训练记录;独立榜单像统一场地的邀请赛;你的业务测试才是正式上岗。一个模型可以在 Coding 很强,却在财务建模、长视频细节或超长工具轨迹上暴露另一套问题。

MiniMax reported

SWE-Bench Pro 59.0%

另有 Terminal-Bench 2.1 66.0%、MCP Atlas 74.2%。不同 benchmark 使用不同 scaffold 和超时设置。

Independent · SWE-rebench

Resolved 45.6% ±1.27

统一最小 ReAct、128K、每模型 5 次;Pass@5 67.3%,平均约 689 万 Token / 题。

Independent · AA v4.1

Intelligence Index 44

首方 API 动态实测 92.7 tok/s、TTFT 1.94s(17:29 CST);短请求快照不代表 1M Prefill。

Domain boundary · Vals FABv2

Finance Agent 48.269%

927 道专家审题、统一六工具脚手架;Coding 与浏览能力不会自动变成可靠金融分析。

值得注意的成本信号

SWE-rebench 中 M3 约消耗 688.6 万 Token / 题,高于同榜一些模型。低 Token 单价不等于低任务成本;应追踪“每个成功任务花了多少 Token、工具调用和重试”。

08 / API 与工具循环

模型负责提出工具调用,真正执行永远在模型外

M3 支持 Interleaved Thinking:可以先想、调用工具、读回结果、继续想。工程上最重要的规则,是把完整 Assistant 响应连同 reasoning / thinking blocks、tool_calls 一起传回下一轮。

MiniMax M3 工具调用时序:用户请求进入编排器,M3 返回 Thinking 与 tool_calls,权限层批准后在沙箱执行,工具结果与完整 Assistant 状态一起回传,模型继续思考或输出答案
不要把工具能力理解成模型直接访问你的 Shell、数据库或桌面;权限、审批、执行和审计都属于外部系统。
白话先懂

模型像坐在控制室里的调度员,只能写“请查数据库”或“请点击这个按钮”的工单。编排器像值班主管:检查权限、决定是否批准、让沙箱执行,再把结果交回模型。没有这层,Agent 就既不可靠也不安全。

本地 Chat Templateenabled / adaptive / disabled

未设置时模板默认 adaptive;这是权重模板的三态。

OpenAI 兼容 APIadaptive / disabled

未传默认 adaptive;reasoning_split 只控制输出格式。

Anthropic 兼容 API未传默认关闭

开启用 adaptive;下一轮须原样保留 thinking signature 与内容块。

Responses APIeffort=none 默认关闭

minimal / low / medium / high 当前都映射为 adaptive,不调节真实深度。

OpenAI-compatible · 关键字段MiniMax-M3
{
  "model": "MiniMax-M3",
  "thinking": { "type": "adaptive" },
  "messages": [ ... ],
  "tools": [ ... ]
}

工具轮次的三条底线

  1. 完整回传:不要只截取最终文本,保留 reasoning_details / thinking 与 tool_calls。
  2. 结果绑定:用 tool_call_id + 参数摘要校验返回值;官方仓库已有并行结果可能错配的公开 issue。
  3. 副作用审批:发邮件、下单、删数据、控制桌面必须走显式 Policy 与人工确认。
09 / 价格与缓存

跨过 512K,不只是更长,也会进入另一档价格

官方当前采用输入长度阶梯价。缓存命中价格更低,但判断是否跨档看总输入 Token,包含 cache-hit 部分。下面按 2026-07-15 美元价格快照估算。

Standard · ≤512K$0.30 / $1.20 / $0.06

新输入 / 输出 / Cache Read,单位均为每百万 Token。

Standard · >512K$0.60 / $2.40 / $0.12

输入一旦跨档,新输入、输出与缓存读取价格均翻倍。

PriorityStandard × 1.5

同一个 MiniMax-M3 的优先调度,不是另一款 Highspeed 模型。

成本计算器 / USD

算一算这次请求

这是 Token 费用估算,不含外部搜索、沙箱、存储、重试或第三方工具成本。Hosted API 要求输入与输出合计不超过 1,000,000。

总长度 105,000 / 1,000,000;输出推荐不超过 131,072,协议最大 524,288。

本次估算$0.036000
未命中输入
$0.030000
缓存输入
$0.000000
输出
$0.006000
Standard ≤512K:input $0.30 · output $1.20 · cache $0.06 / 1M
缓存怎样更容易命中?
固定 tools固定 System Prompt稳定历史前缀变化的新消息

M3 的被动缓存按前缀匹配,512 个输入 Token 以上才应用。把稳定内容放前面,别每轮重排工具或 System Prompt。

10 / 开放权重与自部署

23B Active 是每步计算账单,不是机房容量账单

每个 Token 只激活约 23B 参数,但 128 位专家的完整权重仍要常驻 GPU / 主机内存或被卸载搬运。权重装下之后,还要为 KV Cache、通信、CUDA Graph 和并发留空间。

MiniMax M3 权重与部署图:854.2GB BF16、443.8GB MXFP8 与 250.1GB NVFP4 经主机存储分发到 TP/EP GPU 集群,运行时还需 KV Cache、通信缓冲和服务余量
仓库体积是磁盘 checkout 快照,不等于完整运行时显存;1M × 并发会进一步扩大 KV 预算。
白话先懂

餐厅每天只叫 4 位专科厨师上灶,不代表其他 124 位可以不雇、不安排工位。MoE 省的是每道菜实际参与计算的人数;自部署仍要把整支团队安置好,或接受从外地临时调人的搬运延迟。

BF16854.176 GB

59 shards · 十进制字节快照

官方 MXFP8443.749 GB

31 shards · 十进制字节快照

NVIDIA NVFP4250.104 GB

88 shards · 十进制字节快照

vLLM 起步命令block-size 必须 128
vllm serve MiniMaxAI/MiniMax-M3 \
  --tensor-parallel-size 8 \
  --block-size 128 \
  --tool-call-parser minimax_m3 \
  --reasoning-parser minimax_m3 \
  --enable-auto-tool-choice
先限制窗口

不要一上来就开 1M。先按业务设 32K / 128K / 256K,测 TTFT、TPOT 和并发。

权重与 KV 分开量化

MXFP8 只说明权重格式;KV Cache 是否 FP8 是另一项运行时配置。

锁死版本矩阵

vLLM、SGLang、CUDA / ROCm、parser 与 MSA kernel 版本必须一起验收。

“单卡启动”不等于高性能

KTransformers 可大量 CPU 卸载,但仍需要数百 GB 主存和足够内存带宽。

11 / 生产系统

长上下文模型只是中间层,可靠 Agent 要靠整套护栏

图像和网页可能藏 Prompt Injection;并行工具返回可能串线;电脑操作有真实副作用。生产拓扑要把上下文、权限、沙箱、审计和人类确认放在模型外。

MiniMax M3 生产拓扑:客户端经 Gateway 和 Agent Orchestrator 进入模型池,文本图片视频先经过输入隔离和注入检测,工具请求经 Policy、RBAC 与人工审批后在桌面或代码沙箱执行,状态、成本和副作用写入审计系统
电脑操作建议使用一次性桌面、域名白名单、凭证代理与动作回放;模型永远不直接持有长期高权限凭证。
上线前最少做完
  1. 多模态隔离:外部图片、视频、网页内容标记为不可信数据。
  2. 工具参数校验:tool_call_id、关键参数和结果摘要三方绑定。
  3. 副作用分级:读取可自动,写入需审批,资金/账号操作强制人工。
  4. 周期 Checkpoint:长任务保存工作区、计划、产物和可恢复状态。
  5. 预算熔断:按 Token、时间、调用次数和美元共同限制。
  6. 任务级观测:追踪每个成功任务成本,而不只看每 Token 单价。
12 / 选型结论

什么时候值得用,什么时候先别被 1M 吸引

M3 的组合优势很明确:长上下文、原生图像视频、Coding Agent、低价 API 与开放权重同时出现。它的代价也同样具体:巨大的全量权重、复杂 runtime 适配和较高的 Agent Token 消耗。

优先试

这些任务很对路

  • 大代码库理解、终端调试与多轮工具链
  • 长文档 + 图表 + 视频共同分析
  • 需要 OpenAI / Anthropic 兼容接口的 Agent
  • 数据驻留明确、且有大显存集群的私有部署
先做验证

这些场景别只看宣传数字

  • 极低延迟的小问答:大模型可能不是最经济选项
  • 完整 1M 深度推理:仍缺独立的全窗口证据
  • 高风险金融、医疗或自动交易:必须领域评测与审批
  • 消费级单机:CPU 卸载可启动,不代表可接受吞吐
截至 2026-07-15 的证据空白

MiniMax 自己尚未发布 428B M3 的完整分阶段训练 Token、语料与模态比例、完整 RL 预算、约 23B Active 的统一计算边界、7 个 MTP module 的生产接入,以及完整 1M 的独立有效深度。NVIDIA 合作文章的“约 100T interleaved tokens”是合作方口径,仍缺阶段与模态拆分。

回到知识底座

想把这一页真正吃透,继续补三块基础

13 / 来源与口径

每个数字都能回到它的出处

优先使用官方配置、论文、API 文档与独立统一评测。动态价格、速度和排行榜均标注核查日期;社区 issue 只作为风险线索,不推导普遍故障率。

R1 MiniMax M3 官方发布MiniMax · 2026-06-01产品定位、效率口径、官方评测与长程案例 R2 MiniMax M3 官方模型页MiniMax · 核查 2026-07-151M 上下文、至少 512K 可用的服务承诺与产品口径 R3 MiniMax-M3 Model CardHugging Face · 核查 2026-07-15权重、评测、部署与生成配置;仓库 lastModified 2026-07-11 R4 MiniMax-M3 config.json官方 Checkpoint60 层、MoE、MSA、视觉塔与 1,048,576 窗口 R5 MiniMax Sparse AttentionarXiv 2606.13392 v2 · 2026-06-12MSA 算法、训练目标、内核与 109B 对照实验 R6 MSA KernelMiniMax-AI · MIT公开 SM100 内核、Top-k 与 block=128 约束 R7 MaxProofarXiv 2606.13473 · 2026-06-11证明生成、验证、修复与测试时搜索 R8 OpenAI-compatible APIMiniMax Platform模型 ID、Thinking、多模态与输出参数 R9 Anthropic-compatible APIMiniMax PlatformThinking 默认值与内容块回传规则 R10 Tool Use & Interleaved ThinkingMiniMax Platform工具轮次、完整 Assistant 状态与连续思考 R11 Pay-as-you-go Pricing价格快照 · 2026-07-15Standard / Priority 与 512K 阶梯价 R12 Prompt CachingMiniMax Platform自动前缀缓存、命中门槛与计费 R13 vLLM MiniMax-M3 RecipevLLM · 更新 2026-07-01TP/EP、block size、KV 与 1M 部署边界 R14 MiniMax M3 on vLLMvLLM · 2026-06-12MSA、多模态、EAGLE3 与验证硬件 R15 SGLang MiniMax-M3 CookbookSGLang · 核查 2026-07-15Blackwell、Hopper 与 AMD 部署矩阵 R16 NVIDIA MiniMax-M3 DeploymentNVIDIA DeveloperNVFP4、vLLM、SGLang 与 TensorRT-LLM R17 MiniMax-M3 NVFP4NVIDIA · 2026-06-23约 250 GB 权重与量化评测 R18 Artificial Analysis · MiniMax M3独立动态快照 · 2026-07-15 17:29 CSTIntelligence Index v4.1、速度、TTFT 与成本 R19 SWE-rebench统一脚手架快照 · 2026-07-15128K ReAct Coding Agent 的独立成绩与 Token 消耗 R20 SWE-rebench MethodologyIndependent Harness题集、五次运行、上下文上限与统计方法 R21 Finance Agent Benchmark v2Vals AI · 核查 2026-07-15927 道专家审题、统一六工具脚手架与领域边界 R22 MiniMax Community License权重许可证商业展示、通知/授权与禁止用途 R23 MiniMax-M3 Issues官方 GitHub · 动态并行工具结果错配等生产风险线索 R24 KTransformers M3 TutorialCPU–GPU 混合卸载MXFP8 混合部署与单卡启动边界 R25 MiniMax-M3 Model API MetadataHugging Face · 核查 2026-07-15精确参数计数、BF16 分片数量与十进制字节体积 R26 OpenAI Chat OpenAPI SchemaMiniMax Platform · 核查 2026-07-15M3 输出推荐 128K、最大 512K 的接口合同 R27 MiniMax API OverviewMiniMax Platform · 核查 2026-07-15上下文上限按输入与输出 Token 合计计算 R28 MiniMax-M3-MXFP8 Model APIHugging Face · 核查 2026-07-15官方 MXFP8 分片数量与十进制字节体积 R29 Responses OpenAPI SchemaMiniMax Platform · 核查 2026-07-15Responses API 的 reasoning effort 默认值与当前映射

完整文字调研已落盘至 architecture/MiniMax/MiniMax-M3深度研究.md。本页是面向学习的可视化版本;许可证摘要不构成法律意见。