跳到正文
MINIMAX SIGNAL LAB · M1
模型专题 · MiniMax / 稀疏长推理实验

七层压缩记忆,
一层完整检索

MiniMax-M1 用 70 层 Lightning Attention(闪电注意力)把更早历史压进固定状态,每八层再用一次完整 Softmax Attention(软最大注意力)回看全部上下文;同一枚 Token 还会从 32 名专家中请 2 名处理。它把 456B MoE(Mixture of Experts,混合专家)、1M 输入与 40K/80K 长思考放进同一套系统。M101M103

2026 判断

研究价值仍然很高,但不再是 MiniMax 当前 API 主线。开放权重与 Apache-2.0 仍在;国际和中国大陆当前模型目录都不含 M1,中国大陆另有历史接口与价格留档。M111M112

MiniMax-M1 总览插画:一条超长信息流反复穿过成组的压缩记忆板和周期性完整检索门,并把部分信号分流给两名专家后重新汇合。
直觉总览:多数层持续压缩历史,周期性的完整注意力重新寻址;每层的稀疏路由再挑两名专家加工当前 Token。精确的 7:1、80 层与缓存公式以正文 SVG 为准。查看原图 ↗
TOTAL456B公开几何约 456.09B
ACTIVE45.9B每枚 Token 激活
LAYERS8070 Lightning + 10 Softmax
MOE32 → 2每层 32 名专家选 2 名
INPUT1M官方训练与能力口径
OUTPUT RL40K / 80K最大生成训练预算
01 · 身份与当前状态

论文、开放权重、历史 API、当前产品,不是同一个对象

M1 在 2025 年 6 月发布,今天仍可下载;但“权重还在”不等于“官方现在仍按首发价卖 API”。先把发布、开放权重、当前模型目录与历史接口四条线拆开,后面的架构和部署才不会读错。M108M113

MiniMax-M1 状态图:时间线从 2025-06-16 技术报告经过 40K、80K 开放 Checkpoint 到后续 M2 全注意力复盘;截至 2026-07-17,开放权重仍可下载,国际和中国大陆当前目录均不含 M1,中国大陆只保留 deprecated 旧接口和 2025 首发价格资料
截至 2026-07-17,国际和中国大陆当前目录均不含 M1;中国大陆历史接口与 2025 首发价格资料仍留档,但本文没有用付费新账户实测。 查看原图 ↗
开放权重

仍可下载

40K 与 80K 两个 Checkpoint 仍在,模型几何相同,许可为 Apache-2.0。M105M107M118

确定 · 静态事实
国际一方 API

当前目录不含 M1

GET /v1/models 的当前示例只列 M3、M2.7 与 M2.5;没有找到专门的 M1 退役公告。M111

核查于 2026-07-17
中国大陆一方 API

当前清单排除,历史资料留档

当前接口概览列 M3 与 M2.x,不含 M1;标为 deprecated 的旧版文档仍列 M1 接口,2025 中国大陆发布文章保留当时的阶梯价格。M112M113M114

历史资料 · 未实测新账户
白话先懂

把 M1 想成一本已经公开印刷的大部头:PDF 和印刷文件仍能下载,所以研究者仍可自己架服务器阅读;但出版社今天的在线书店已经把主推位换成 M2/M3。

国内站还留着一个“历史馆”入口,不代表所有新账号一定能买到。页面因此不放立即调用按钮,也不把首发价格包装成当前报价。

02 · 80 层完整架构

一枚 Token 要经过 80 次“先找信息,再请专家”

每层先用 Attention 混合序列信息,再用 Router(路由器)从 32 名 FFN(Feed-Forward Network,前馈网络)专家中选 2 名加工。不同层的主要差别,是 Attention 用 Lightning 压缩历史,还是用 Softmax 完整回看。M103M104

一枚 Token 从 200064 词表 Embedding 进入 MiniMax-M1 的 80 层主干,每八层包含七层 Lightning Attention 和一层 Softmax GQA,每层再经过 32 选 2 MoE,最后由 LM Head 输出
70 个 Lightning 层 + 10 个 Softmax 层组成同一条 80 层网络,不是两套模型。 查看原图 ↗
01

Embedding

200,064 → 6,144

Token ID 先变成 6,144 维隐藏向量。

02

Attention

读当前与历史

七层读压缩状态,第八层完整检索。

03

MoE

32 选 2

Router 给每枚 Token 派两位专家。

04

重复 80 层

再到 LM Head

最终变成下一个 Token 的概率分布。

MiniMax-M1 的 80 层纸带按 7 个 Lightning 层加 1 个 Softmax 层分成十组,完整注意力位于零起始层号 7、15 到 79
完整 Softmax 位于 0-based 层号 7、15、23、31、39、47、55、63、71、79。 查看原图 ↗
Attention Projection64 heads × 128

6,144 维投影为 8,192 维 Q;Softmax K/V 为 8×128。

Expert FFN9,216 hidden

每层 32 个 Routed Expert,没有 Shared Expert。

Softmax-only RoPE64 / 128 dims

仅 10 个 Softmax 层使用;Lightning 路径不调用 RoPE。

模型模态Text → Text

没有视觉或音频编码器;工具调用是结构化文本。

03 · Lightning Attention

当前小块精细计算,更早历史压成一份固定大小的工作记忆

Lightning 没有把历史丢掉。它在当前 Block(分块)内计算带因果约束和按头指数衰减的 Attention,同时把前面 Block 累积到一个递归 KV State(键值状态);下一块直接读这份状态,不再逐 Token 重扫全部旧历史。M104M109

Lightning Attention 数据流:当前 Q K V 小块执行带因果指数衰减的块内注意力,按位置衰减的 Query 同时读取前一块压缩状态,按位置衰减的 K 转置乘 V 更新下一块状态,两个输出相加后经过归一化和门控
它减少的是跨块历史的存储和搬运;当前 Block 内仍做矩阵乘,并显式应用每个 Head 的指数衰减。 查看原图 ↗
白话先懂

你边读一本超长侦探小说,桌面只摊开当前一小叠页面;更早章节不会整本重读,而是写进一张固定大小的“案件状态表”。当前页里的每个细节仍逐项比较,需要旧线索时就查询状态表。

这样越往后读,桌上旧页不会无限堆高。但状态表终究是压缩信息,可能丢掉某些精确位置,所以 M1 每八层安排一次 Softmax,像定期打开完整索引重新检索。

再深一层:Block 内与 Block 间怎样相加
当前块内Dᵢⱼ = e^(−sₕ(i−j)) · 𝟙[i≥j]
O_intra = [(QₜKₜᵀ) ⊙ D]Vₜ

因果 Mask 和距离衰减合进矩阵 D;越远的块内 Key 权重越小。

+
更早历史O_inter = (Qₜ ⊙ d_q)Sₜ₋₁

当前 Query 先按块内位置衰减,再读取前一块末尾的固定状态。

更新状态Sₜ = e^(−sₕB)Sₜ₋₁ + (Kₜ ⊙ d_k)ᵀVₜ

旧状态衰减一个 Block;本块 K 也按离块尾距离衰减后写入。

t 是当前 Block,B 是完整块长,sₕ 是每个 Head 的衰减斜率;位置向量 d_q 从块首到块尾继续衰减旧状态,d_k 则让越靠近块尾的 Key 写入得越新。最后一个不足 B 的块按实际长度 m 计算。这里把实现中的 query、key、diagonal 与 block decay 都保留了。M104

官方后验 · 2025-10

MiniMax 后来解释 M2 为什么回到 Full Attention(完整注意力):复杂 Multi-hop(多跳)验证、低精度 State、Prefix Cache(前缀缓存)、Speculative Decoding(推测解码)与内核生态都暴露了额外风险。这不抹去 M1 的研究价值,但说明线性注意力不是“免费午餐”。M110

04 · Context Cache

1M Token 时,70 层状态不随长度增长,10 层 KV Cache 仍会增长

混合架构省下的是大多数层的逐 Token KV。它不是“零缓存”:十个完整 Softmax 层仍要为每个历史 Token 保存 K 和 V;下面的数值由公开配置和推理实现逐项复算。M103M104

MiniMax-M1 缓存增长图:70 层 Lightning 使用约 293.6MB 固定 FP32 状态,10 层 Softmax BF16 KV 随上下文线性增长,在 1M Token 约 40.96GB;80 层全 GQA 对照约 327.68GB
数字按公开配置、Batch 1、Softmax KV BF16、Lightning State FP32 推算,不是官方容量承诺。 查看原图 ↗
交互 · 缓存量级估算

上下文变长,状态占多少?

假设:10 层 Softmax KV = BF16;70 层 Lightning State = FP32;不含权重、分页元数据与工作区。

混合状态合计41.25 GB配置推算 · 非官方承诺
10 层 Softmax KV
40.96 GB
70 层 Lightning State
293.60 MB
80 层全 GQA 对照
327.68 GB
相对全 GQA
节省 87.4%
05 · 稀疏专家 MoE

32 名专家都要存着,但每枚 Token 只请 2 名上场

456B 描述整个模型的容量,45.9B 描述每枚 Token 实际激活的主干规模。MoE 省的是计算路径,不是把其余专家从硬盘和显存里删除;Hugging Face 当前元数据统计 456,089,655,296 个参数。M101M106

MiniMax-M1 每层 MoE 数据流:6144 维 Token 进入 Router 得到 32 个专家分数,Top-2 选择两名 9216 维 SwiGLU 专家,Token 分发到可能位于不同 GPU 的专家,计算后按路由权重合并
专家分散到多张 GPU 时会产生 Dispatch / Combine 和 All-to-All;负载均衡直接影响吞吐。 查看原图 ↗
容量456B

全部专家、Attention、Embedding 与 LM Head 都算在总参数里。

每 Token 计算45.9B active

每层只走两位 Routed Experts,但 80 层都会执行。

存储≈ 912GB

414 个公开权重分片合计的数量级,不含运行时缓冲。

白话先懂

医院有 32 个专科,病人每到一层都由分诊台选两科会诊。一次不会叫 32 位医生全来,所以计算省;但医院仍要雇齐所有医生、准备办公室和排班。

如果两位专家分散在不同 GPU,Token 还要跨卡“转诊”。因此 MoE 的上限不仅由算力决定,也由专家热点、All-to-All 网络和 Batch 中的路由分布决定。

06 · 继续预训练与 SFT

先追加 7.5T Token 打地基,再把上下文从 32K 平滑拉到 1M

7.5T 是 M1 在 Text-01 之后新增的 Continual Pre-Training(继续预训练)量,不是模型生命周期总量。长上下文采用四阶段课程,因为 Lightning 不同层的衰减状态对突然扩窗很敏感。M101

MiniMax-M1 训练地基:在 Text-01 上继续预训练 7.5T Token,前 2.5T 学习率恒定 8e-5,后 5T 衰减到 8e-6;数据中 STEM 代码书籍推理占 70%,上下文分四阶段从 32K 到 1M,再进入长思考 SFT 和 RL
两个中间 Context 长度、各阶段 Token、SFT 样本量与教师模型均未披露。 查看原图 ↗
前 2.5TLR 8e-5

继续预训练的恒定学习率阶段。

后 5T8e-5 → 8e-6

逐步衰减;合计新增 7.5T。

数据重心70%

STEM、代码、书籍、推理合计占比。

Long-CoT SFT数学 + 代码 ≈60%

再覆盖 STEM、写作、QA 与多轮对话。

“避免合成数据”只属于自然 QA 的继续预训练管线。后面的逻辑 RL 明确使用约 53K SynLogic 合成题,80K 阶段还会下采样 Synthetic Reasoning;不能写成“M1 从未使用合成数据”。
07 · CISPO 强化学习

限制一枚 Token 的“发言权重”,但不把它赶出课堂

长推理会靠少量低概率 Token 改变方向,比如 “Wait” 或 “Recheck”。传统 Clip(裁剪)可能让这些越界 Token 后续梯度归零;CISPO(Clipped Importance-Sampling Policy Optimization,裁剪重要性采样权重的策略优化)只裁 IS Weight,仍保留每枚 Token 的学习梯度。M101

CISPO 更新流程:旧策略快照生成多条长推理轨迹并计算组内相对优势;每个 Token 比较新旧策略重要性权重,越界与否都把裁剪后的权重乘优势和 log probability 梯度;一次昂贵采样可供 16 轮 off-policy 更新复用
CISPO 的目标是保住推理分叉 Token 的学习信号;权重裁剪仍会带来轻微 Bias。 查看原图 ↗
白话先懂

一名平时很少发言的学生突然说“等等,前面算错了”。因为这句话让解题路线变化太大,旧规则可能把这份作业直接排除在后续批改外;模型也就不再学习这种关键回头。

CISPO 仍然批改它,只把这句话对总成绩的影响限制在合理范围。这样既不会让单个异常 Token 主宰更新,也不会把难得的反思信号彻底清零。

保留全部 Token 的 ∇logπ

越过 IS 上界仍参与学习。

限制IS Weight

作为 Stop-gradient 权重,不让异常比率放大。

训练16× Off-policy

每个生成 Batch 重复更新 16 轮。

没有KL Penalty

另用 Dynamic Sampling 与 Length Penalty。

“约 2×”

只指 Qwen2.5-32B Zero-RL 受控实验中,用约一半 Training Steps 达到 DAPO 相当的 AIME 2024 avg@32。它不是 M1 墙钟、吞吐、GPU 利用率或成本快 2×。

08 · RL Infra 与稳定性

一个概率小数点的偏差,也能让 512 张 GPU 白跑

Rollout Engine(轨迹生成引擎)生成 Token,Training Kernel(训练内核)再计算它们的概率。两边只要略有系统偏差,Importance Ratio(重要性比率)就会失真,奖励可能长期不增长。M101

MiniMax-M1 强化学习稳定性图:概率不一致、极小梯度和高置信重复三个问题,分别对应 LM Head 改用 FP32、AdamW epsilon 设为 1e-15、连续 3000 个高置信 Token 后早停;右侧列出相关系数 0.987319 到 0.997135、512 张 H800、三周与 534700 美元租赁估算
新 Attention、MoE、长 Rollout 与低精度 Kernel 互相耦合;稳定性是端到端系统问题。 查看原图 ↗
LM Head FP320.987319 → 0.997135

Figure 3 的概率相关系数,不是模型准确率。

AdamWβ₁ .9 · β₂ .95 · ε 1e-15

梯度多数小于 1e-14,默认 epsilon 会淹没信号。

Loop Detector3,000 × p>.99

连续高置信重复就 Early Stop,避免长尾放大负梯度。

成功 RL Run512 × H800
×
时间3 周
发布方租赁估算$534,700

约 258,048 GPU-hours、反推约 $2.07/GPU-hour。这只足以代表发布方披露的一次完整 RL 训练周期 GPU 租赁口径;Base、7.5T CPT 与 SFT 在该 RL 阶段之外,数据、GenRM、失败实验和人力是否计入并未披露,不能把它当成全项目成本。M101

09 · RL 数据与奖励

不同题目要进入不同“验收车间”,不能都交给一个 Judge

数学看最终答案,代码跑测试,软件工程在容器里编译和回归;开放写作才交给 GenRM(Generative Reward Model,生成式奖励模型)。可验证任务先学稳,再逐渐混入 General-domain(通用领域)数据。M101

MiniMax-M1 强化学习数据分流图:近 50K 数学、53K 逻辑、30K 竞赛编程和数千软件工程任务进入答案、规则、编译或容器回归验证;25K 通用任务进入五档 GenRM 或成对 Judge;课程先用可验证任务,再混入通用任务并在 80K 阶段重筛
公开桶不能简单相加成最终训练集;80K 阶段会重新筛难题并下采样合成长推理。 查看原图 ↗
数学近 50K

保留强模型 0<pass@10<.9 的题,最终答案 + 格式规则验收。

逻辑约 53K / 41 类

SynLogic 生成器与任务专用 Verifier,训练后期提高难度。

竞赛编程30K

运行 Test;缺测试时由 Text-01 生成 Test Suite。

软件工程数千

真实 GitHub Issue/PR,容器内编译、执行与回归。

General RL25K

五档 GenRM 或与参考答案 Pairwise 比较,奖励 -1/0/1。

Reward Model 也会作弊

GenRM 会偏爱更长的 CoT,Policy 于是学会“多写就得分”。MiniMax 需要在线监控长度与成功率,一旦质量没涨就重新校准 Reward,再配合 Shaping、Value Clipping 与 Normalization。

10 · 40K → 80K 长思考

不是把上限翻倍,而是每 8K 走一段台阶

80K Checkpoint(检查点)从 40K 继续训练,按 48K、56K、64K、72K、80K 逐级扩窗。每次先等 Perplexity(困惑度)收敛和输出长度 P99(第 99 百分位)接近当前上限,再迈下一步。M101

MiniMax-M1 最大生成训练预算从 40K 经过 48K、56K、64K、72K 逐级扩到 80K;下方同设置比较显示 AIME 2025 和 Zebra 上升,而 MRCR 4-needle 的 128K、1M 以及 TAU Retail 回落
40K 是 80K 训练的中间 Checkpoint;两个版本参数规模和网络结构完全相同。 查看原图 ↗
交互 · 同一架构,两段训练

40K 与 80K 到底差在哪里?

共同点:456B / 45.9B active、80 层、7:1 Attention、32 选 2 MoE、1M 输入。

当前查看

MiniMax-M1-40K

80K 训练的中间阶段;架构与 80K 完全相同。

AIME 202483.3比 80K ↓ 2.7
LiveCodeBench · 24/08–25/0562.3比 80K ↓ 2.7
MRCR 128K · 4-needle76.1比 80K ↑ 2.7
MRCR 1M · 4-needle58.6比 80K ↑ 2.4
TAU Retail67.8比 80K ↑ 4.3
SWE Verified · 486题55.6比 80K ↓ 0.4
1M 输入与 80K 输出是两个不同口径。论文没有说明二者能否同时取满,也没有给 input + output 的统一总序列上限;配置中的 10.24M Position 字段更不是已验证能力。
11 · Benchmark 与证据

分数测的是“模型 + 预算 + Prompt + 工具 + Judge”

官方数字能说明训练方向,但不能脱离 Harness(评测脚手架)阅读。这里的 LiveCodeBench 冻结在 2024-08 至 2025-05,MRCR 是 4-needle 设置;M1-80K 也不是每项都更高,MRCR 两档与 TAU-retail 都是 40K 领先。M102

MiniMax-M1 评测证据图分三列:官方配置、技术报告和许可部署文档可直接确认;AIME、GPQA、LiveCodeBench、FullStack 和 SWE Verified 必须携带采样次数、题目排除与 Harness;TAU 和 MultiChallenge 还依赖用户模型、最大步数或 Judge,独立复测仍不完整
官方所有任务用 temperature 1.0、top_p 0.95;AIME 和 GPQA 各采样 32 次。 查看原图 ↗
数学采样AIME 2024 · 86.0

M1-80K,每题 32 次采样的平均通过率,不是 Pass@32。

软件工程SWE Verified · 56.0

只跑基础设施兼容的 486 / 500 题,并用 Agentless Localization。

长上下文反例MRCR 4-needle · 1M · 56.2

低于 M1-40K 的 58.6,窗口更长不代表每项更强。

证据层级仍以发布方为主

本页列出的分数来自论文和官方仓库;没有把第三方聚合估算当成独立完整复测。

比较前对齐六件事
  • 精确 Checkpoint
  • 40K / 80K 预算
  • Temperature 与采样次数
  • Prompt 与 Answer Extractor
  • 工具、环境与最大步数
  • Judge、分母与置信区间
12 · API 与历史价格

一张图分清国际当前目录、国内当前清单与历史留档

这里不做“当前价格计算器”:国际站和中国大陆当前模型清单都不含 M1;中国大陆只保留标为 deprecated 的旧版接口文档和 2025 首发阶梯价资料。生产采购前必须用真实账户和官方商务渠道再次确认。M111M112M113M114

MiniMax-M1 API 状态分流:国际站和中国大陆当前模型目录都不含 M1;中国大陆历史 ChatCompletion v2 与 2025 首发资料仍列 M1,但新账户未实测;开放权重可用 Transformers 或发布期 vLLM 配方自托管。
页面状态核查于 2026-07-17;没有找到官方专门的 M1 下线日期公告。 查看原图 ↗
国内旧版端点POST https://api.minimaxi.com/v1/text/chatcompletion_v2

标为 deprecated 的页面保留模型 ID MiniMax-M1;它属于旧版 ChatCompletion v2,不是当前支持清单。M113

不要误读

History ≠ Current SLA

文档仍在,不等于新账户、每个地区或所有套餐当前都可用。本文未用付费 Key 实测。

中国大陆 2025 首发价¥ / 1M Token
输入长度0–32K输入 ¥0.8输出 ¥8
输入长度32–128K输入 ¥1.2输出 ¥16
输入长度128K–1M输入 ¥2.4输出 ¥24

中国大陆三档价格来自 MiniMax 的 2025 发布文章,只作首发历史记录,不代表当前报价。M114 国际首发价(2025-06-16)为输入 $0.4/M(0–200K)、$1.3/M(200K–1M),输出 $2.2/M;同样不是当前报价。M108

13 · 开放权重与私有部署

最先压过来的,是约 912GB 权重和 8 卡通信

45.9B Active 只说明一次计算走多少参数,不说明存储只要约 92GB。Hugging Face API 当前统计 456.089655296B 参数,414 个实际 safetensors 分片合计约 912.2119GB;索引 JSON 自己的 total_size 字段与实际文件清单不一致,因此这里采用逐文件求和。所有专家仍要放到 GPU、CPU 或分层存储中。M106

MiniMax-M1 部署图:414 个公开权重分片合计 912211851456 字节并采用 Apache 2.0;2025 发布期 vLLM 参考路径使用 8 张 H800 或 H20、Tensor Parallel 8、BF16 计算和 experts_int8;另一条路径是当前 Transformers 加 HF 兼容仓库,并在上线前验证权重、KV、激活和运行时容量
2025 发布期官方示例要求 vLLM 0.9.2+;其 max_model_len 4096 是启动示例,不是 1M 生产容量验证,当前版本仍应重新做兼容与容量测试。 查看原图 ↗
实际分片合计912.2119 GB

约 849.56 GiB;按当前 414 个公开文件尺寸求和。

发布期 vLLM 示例8× H800 / H20

TP8 + BF16 主精度 + experts_int8;不是所有后端的最低门槛。M115

理论 4-bit 下限≈ 228 GB

不是官方量化包,也没有长推理质量保证。

放得下

权重、KV / State、NCCL Buffer、临时张量和 Engine Workspace。

跑得动

Prefill、Decode、MoE 跨卡通信(TP 常见 All-Reduce;EP 常见 All-to-All)、负载均衡和内核兼容。

服务得住

长输出占槽、排队、超时、失败重试、并发和成本监控。

Apache License 2.0

允许使用、修改、再分发与商业服务;分发时保留许可证和归属,修改需标明,不授予 MiniMax 商标权,包含专利授权与无担保条款。权重许可不替代数据、隐私、内容和托管服务合规。当前 Transformers 也已有原生 MiniMax 架构文档,但“能加载”仍不等于长上下文生产可用。M116M118

14 · Function Calling

模型只写“行动申请单”,真正执行在 Orchestrator 外部

M1 能生成结构化 Tool Call(工具调用),但它不会自动获得 Shell、数据库、邮件或支付权限。Orchestrator(编排器)必须校验参数、权限、预算与副作用,再把结果送回模型继续推理。发布期官方配方使用专用 Chat Template 与 minimax parser;当前框架升级后仍需重做协议测试。M117

MiniMax-M1 工具调用闭环:用户任务进入模型,模型生成结构化 Tool Call 或直接回答;minimax Parser 解析名称与参数,外部 Agent Runtime 完成 allowlist、Schema 和 Secret 校验后执行 API、搜索、代码或数据库工具;Observation 回填模型并由完成判断决定继续调用还是输出最终回答
官方 vLLM 指南使用专用 Chat Template 与 --tool-call-parser minimax;框架版本变化时需重做兼容测试。 查看原图 ↗
白话先懂

模型像控制室里的调度员,只能填一张“请查库存”或“请运行测试”的工单。值班主管先检查它有没有权限、参数是否完整、会不会删数据,再让隔离环境真正执行。

工具返回的网页、日志和文件也可能藏恶意指令,所以结果只能当不可信数据。长思考能规划更多步骤,也给 Prompt Injection 更长的传播链,权限反而要收得更紧。

01白名单 + 最小权限

模型只能看见当前任务真正需要的工具。

02Schema + 参数验证

拒绝越权路径、危险命令与超预算请求。

03Sandbox + 网络隔离

Secret、文件、出口和进程边界都在模型外。

04确认 + 审计

高副作用操作人工确认,完整记录调用链。

15 · 适用边界与选择

今天选 M1,要有明确的研究或私有化理由

它仍是理解混合线性注意力、超长 RL 与系统耦合的优秀样本;但新业务若只想获得当前 SLA、原生多模态或轻量部署,M1 通常不是默认起点。

适合

研究、复现、强许可

  • 研究 Lightning / Hybrid Attention
  • 复现 CISPO 与 40K/80K 长推理
  • 需要 Apache-2.0 开放权重
  • 有 8 卡高显存与 MoE 运维能力
  • 愿意自己维护 Kernel、Eval 与安全护栏
谨慎

当前 API、轻量、强实时

  • 只想接 MiniMax 当前主线 API
  • 没有多卡服务器和框架维护能力
  • 任务主要是低延迟短对话
  • 需要原生图片、音频或视频输入
  • 想用 1M 代替检索、权限和数据治理
仍未披露

SFT 规模与教师

CISPO Group size 与 IS 上界

RL 总 Step、Token、Rollout

GenRM 规模与校准频率

论文 / 开放权重的 1M 输入 + 80K 输出总约束

独立 M1 System Card / 红队报告

最终判断

M1 的真正价值不是证明“线性注意力已经解决一切”,而是展示长上下文与长推理必须端到端共同设计:架构、缓存、低精度 Kernel、MoE 通信、CISPO、Verifier、Reward、Sandbox 和线上调度,任何一环都可能成为瓶颈。

16 · 来源与研究方法

配置讲几何,论文讲训练,当前文档讲产品

本文优先使用技术报告、固定版本配置与实现、官方部署指南和当前 API 文档;发布方 Benchmark 与外部证据分层展示,所有推导值都写明假设。

M101
MiniMax-M1 Technical Report

架构、7.5T 继续预训练、CISPO、RL 数据、40K/80K 课程与官方评测

M102
MiniMax-M1 官方仓库

两个 Checkpoint、采样参数、评测脚手架、部署与函数调用入口

M103
固定版本 config.json

80 层、7:1 层型、GQA、MoE、RoPE 与精确几何

M104
固定版本模型实现

Lightning 递归状态、完整 GQA、Top-2 MoE 与推理 Cache

M105
MiniMax-M1-40K 模型卡

40K 开放 Checkpoint 与 Apache-2.0 元数据

M106
MiniMax-M1-80K 文件清单

414 个权重分片的文件尺寸、dtype 参数统计与仓库更新时间

M107
MiniMax-M1-80K HF 兼容仓库

当前 Transformers 原生格式、配置与模型卡

M108
MiniMax-M1 发布文章

2025-06-16 发布、发布方算力主张与首发国际价格

M109
MiniMax-01 Technical Report

Hybrid Lightning 主干的前身、长上下文训练与检索实验

M110
为什么 M2 回到 Full Attention

MiniMax 对复杂多跳、低精度状态、Prefix Cache 与推测解码的官方后验

M111
国际站当前模型列表

截至核查日只列 M3、M2.7 与 M2.5,不含 M1

M112
中国大陆当前接口概览

当前文本模型清单列 M3 与 M2.x,不含 M1

M113
中国大陆旧版 ChatCompletion v2 文档

标注 deprecated,保留 POST /v1/text/chatcompletion_v2 与 MiniMax-M1 参数说明

M114
MiniMax-M1 中国大陆发布文章

2025-06-16 发布与中国大陆三档首发 Token 价格

M115
MiniMax-M1 vLLM 发布期部署指南

8×H800/H20、TP8、experts_int8 与 4096 Token 启动示例

M116
Transformers MiniMax 文档

当前原生架构支持与公开配置字段解释

M117
MiniMax-M1 Function Call 指南

专用 Chat Template、minimax parser 与手动解析路径

M118
Apache-2.0 LICENSE

商业使用、修改、再分发、专利、归属和无担保条款

研究底稿:architecture/MiniMax/MiniMax-M1深度研究.md。API、价格、框架和第三方服务会变化,生产使用前请重新打开官方文档。