仍可下载
40K 与 80K 两个 Checkpoint 仍在,模型几何相同,许可为 Apache-2.0。M105M107M118
确定 · 静态事实MiniMax-M1 用 70 层 Lightning Attention(闪电注意力)把更早历史压进固定状态,每八层再用一次完整 Softmax Attention(软最大注意力)回看全部上下文;同一枚 Token 还会从 32 名专家中请 2 名处理。它把 456B MoE(Mixture of Experts,混合专家)、1M 输入与 40K/80K 长思考放进同一套系统。M101M103
M1 在 2025 年 6 月发布,今天仍可下载;但“权重还在”不等于“官方现在仍按首发价卖 API”。先把发布、开放权重、当前模型目录与历史接口四条线拆开,后面的架构和部署才不会读错。M108M113
40K 与 80K 两个 Checkpoint 仍在,模型几何相同,许可为 Apache-2.0。M105M107M118
确定 · 静态事实GET /v1/models 的当前示例只列 M3、M2.7 与 M2.5;没有找到专门的 M1 退役公告。M111
当前接口概览列 M3 与 M2.x,不含 M1;标为 deprecated 的旧版文档仍列 M1 接口,2025 中国大陆发布文章保留当时的阶梯价格。M112M113M114
历史资料 · 未实测新账户把 M1 想成一本已经公开印刷的大部头:PDF 和印刷文件仍能下载,所以研究者仍可自己架服务器阅读;但出版社今天的在线书店已经把主推位换成 M2/M3。
国内站还留着一个“历史馆”入口,不代表所有新账号一定能买到。页面因此不放立即调用按钮,也不把首发价格包装成当前报价。
每层先用 Attention 混合序列信息,再用 Router(路由器)从 32 名 FFN(Feed-Forward Network,前馈网络)专家中选 2 名加工。不同层的主要差别,是 Attention 用 Lightning 压缩历史,还是用 Softmax 完整回看。M103M104
Token ID 先变成 6,144 维隐藏向量。
七层读压缩状态,第八层完整检索。
Router 给每枚 Token 派两位专家。
最终变成下一个 Token 的概率分布。
6,144 维投影为 8,192 维 Q;Softmax K/V 为 8×128。
每层 32 个 Routed Expert,没有 Shared Expert。
仅 10 个 Softmax 层使用;Lightning 路径不调用 RoPE。
没有视觉或音频编码器;工具调用是结构化文本。
Lightning 没有把历史丢掉。它在当前 Block(分块)内计算带因果约束和按头指数衰减的 Attention,同时把前面 Block 累积到一个递归 KV State(键值状态);下一块直接读这份状态,不再逐 Token 重扫全部旧历史。M104M109
你边读一本超长侦探小说,桌面只摊开当前一小叠页面;更早章节不会整本重读,而是写进一张固定大小的“案件状态表”。当前页里的每个细节仍逐项比较,需要旧线索时就查询状态表。
这样越往后读,桌上旧页不会无限堆高。但状态表终究是压缩信息,可能丢掉某些精确位置,所以 M1 每八层安排一次 Softmax,像定期打开完整索引重新检索。
Dᵢⱼ = e^(−sₕ(i−j)) · 𝟙[i≥j]
O_intra = [(QₜKₜᵀ) ⊙ D]Vₜ因果 Mask 和距离衰减合进矩阵 D;越远的块内 Key 权重越小。
O_inter = (Qₜ ⊙ d_q)Sₜ₋₁当前 Query 先按块内位置衰减,再读取前一块末尾的固定状态。
Sₜ = e^(−sₕB)Sₜ₋₁ + (Kₜ ⊙ d_k)ᵀVₜ旧状态衰减一个 Block;本块 K 也按离块尾距离衰减后写入。
t 是当前 Block,B 是完整块长,sₕ 是每个 Head 的衰减斜率;位置向量 d_q 从块首到块尾继续衰减旧状态,d_k 则让越靠近块尾的 Key 写入得越新。最后一个不足 B 的块按实际长度 m 计算。这里把实现中的 query、key、diagonal 与 block decay 都保留了。M104
MiniMax 后来解释 M2 为什么回到 Full Attention(完整注意力):复杂 Multi-hop(多跳)验证、低精度 State、Prefix Cache(前缀缓存)、Speculative Decoding(推测解码)与内核生态都暴露了额外风险。这不抹去 M1 的研究价值,但说明线性注意力不是“免费午餐”。M110
混合架构省下的是大多数层的逐 Token KV。它不是“零缓存”:十个完整 Softmax 层仍要为每个历史 Token 保存 K 和 V;下面的数值由公开配置和推理实现逐项复算。M103M104
假设:10 层 Softmax KV = BF16;70 层 Lightning State = FP32;不含权重、分页元数据与工作区。
456B 描述整个模型的容量,45.9B 描述每枚 Token 实际激活的主干规模。MoE 省的是计算路径,不是把其余专家从硬盘和显存里删除;Hugging Face 当前元数据统计 456,089,655,296 个参数。M101M106
全部专家、Attention、Embedding 与 LM Head 都算在总参数里。
每层只走两位 Routed Experts,但 80 层都会执行。
414 个公开权重分片合计的数量级,不含运行时缓冲。
医院有 32 个专科,病人每到一层都由分诊台选两科会诊。一次不会叫 32 位医生全来,所以计算省;但医院仍要雇齐所有医生、准备办公室和排班。
如果两位专家分散在不同 GPU,Token 还要跨卡“转诊”。因此 MoE 的上限不仅由算力决定,也由专家热点、All-to-All 网络和 Batch 中的路由分布决定。
7.5T 是 M1 在 Text-01 之后新增的 Continual Pre-Training(继续预训练)量,不是模型生命周期总量。长上下文采用四阶段课程,因为 Lightning 不同层的衰减状态对突然扩窗很敏感。M101
继续预训练的恒定学习率阶段。
逐步衰减;合计新增 7.5T。
STEM、代码、书籍、推理合计占比。
再覆盖 STEM、写作、QA 与多轮对话。
长推理会靠少量低概率 Token 改变方向,比如 “Wait” 或 “Recheck”。传统 Clip(裁剪)可能让这些越界 Token 后续梯度归零;CISPO(Clipped Importance-Sampling Policy Optimization,裁剪重要性采样权重的策略优化)只裁 IS Weight,仍保留每枚 Token 的学习梯度。M101
一名平时很少发言的学生突然说“等等,前面算错了”。因为这句话让解题路线变化太大,旧规则可能把这份作业直接排除在后续批改外;模型也就不再学习这种关键回头。
CISPO 仍然批改它,只把这句话对总成绩的影响限制在合理范围。这样既不会让单个异常 Token 主宰更新,也不会把难得的反思信号彻底清零。
越过 IS 上界仍参与学习。
作为 Stop-gradient 权重,不让异常比率放大。
每个生成 Batch 重复更新 16 轮。
另用 Dynamic Sampling 与 Length Penalty。
只指 Qwen2.5-32B Zero-RL 受控实验中,用约一半 Training Steps 达到 DAPO 相当的 AIME 2024 avg@32。它不是 M1 墙钟、吞吐、GPU 利用率或成本快 2×。
Rollout Engine(轨迹生成引擎)生成 Token,Training Kernel(训练内核)再计算它们的概率。两边只要略有系统偏差,Importance Ratio(重要性比率)就会失真,奖励可能长期不增长。M101
Figure 3 的概率相关系数,不是模型准确率。
梯度多数小于 1e-14,默认 epsilon 会淹没信号。
连续高置信重复就 Early Stop,避免长尾放大负梯度。
约 258,048 GPU-hours、反推约 $2.07/GPU-hour。这只足以代表发布方披露的一次完整 RL 训练周期 GPU 租赁口径;Base、7.5T CPT 与 SFT 在该 RL 阶段之外,数据、GenRM、失败实验和人力是否计入并未披露,不能把它当成全项目成本。M101
数学看最终答案,代码跑测试,软件工程在容器里编译和回归;开放写作才交给 GenRM(Generative Reward Model,生成式奖励模型)。可验证任务先学稳,再逐渐混入 General-domain(通用领域)数据。M101
保留强模型 0<pass@10<.9 的题,最终答案 + 格式规则验收。
SynLogic 生成器与任务专用 Verifier,训练后期提高难度。
运行 Test;缺测试时由 Text-01 生成 Test Suite。
真实 GitHub Issue/PR,容器内编译、执行与回归。
五档 GenRM 或与参考答案 Pairwise 比较,奖励 -1/0/1。
GenRM 会偏爱更长的 CoT,Policy 于是学会“多写就得分”。MiniMax 需要在线监控长度与成功率,一旦质量没涨就重新校准 Reward,再配合 Shaping、Value Clipping 与 Normalization。
80K Checkpoint(检查点)从 40K 继续训练,按 48K、56K、64K、72K、80K 逐级扩窗。每次先等 Perplexity(困惑度)收敛和输出长度 P99(第 99 百分位)接近当前上限,再迈下一步。M101
共同点:456B / 45.9B active、80 层、7:1 Attention、32 选 2 MoE、1M 输入。
80K 训练的中间阶段;架构与 80K 完全相同。
官方数字能说明训练方向,但不能脱离 Harness(评测脚手架)阅读。这里的 LiveCodeBench 冻结在 2024-08 至 2025-05,MRCR 是 4-needle 设置;M1-80K 也不是每项都更高,MRCR 两档与 TAU-retail 都是 40K 领先。M102
M1-80K,每题 32 次采样的平均通过率,不是 Pass@32。
只跑基础设施兼容的 486 / 500 题,并用 Agentless Localization。
低于 M1-40K 的 58.6,窗口更长不代表每项更强。
本页列出的分数来自论文和官方仓库;没有把第三方聚合估算当成独立完整复测。
这里不做“当前价格计算器”:国际站和中国大陆当前模型清单都不含 M1;中国大陆只保留标为 deprecated 的旧版接口文档和 2025 首发阶梯价资料。生产采购前必须用真实账户和官方商务渠道再次确认。M111M112M113M114
POST https://api.minimaxi.com/v1/text/chatcompletion_v2标为 deprecated 的页面保留模型 ID MiniMax-M1;它属于旧版 ChatCompletion v2,不是当前支持清单。M113
文档仍在,不等于新账户、每个地区或所有套餐当前都可用。本文未用付费 Key 实测。
中国大陆三档价格来自 MiniMax 的 2025 发布文章,只作首发历史记录,不代表当前报价。M114 国际首发价(2025-06-16)为输入 $0.4/M(0–200K)、$1.3/M(200K–1M),输出 $2.2/M;同样不是当前报价。M108
45.9B Active 只说明一次计算走多少参数,不说明存储只要约 92GB。Hugging Face API 当前统计 456.089655296B 参数,414 个实际 safetensors 分片合计约 912.2119GB;索引 JSON 自己的 total_size 字段与实际文件清单不一致,因此这里采用逐文件求和。所有专家仍要放到 GPU、CPU 或分层存储中。M106
约 849.56 GiB;按当前 414 个公开文件尺寸求和。
TP8 + BF16 主精度 + experts_int8;不是所有后端的最低门槛。M115
不是官方量化包,也没有长推理质量保证。
权重、KV / State、NCCL Buffer、临时张量和 Engine Workspace。
Prefill、Decode、MoE 跨卡通信(TP 常见 All-Reduce;EP 常见 All-to-All)、负载均衡和内核兼容。
长输出占槽、排队、超时、失败重试、并发和成本监控。
M1 能生成结构化 Tool Call(工具调用),但它不会自动获得 Shell、数据库、邮件或支付权限。Orchestrator(编排器)必须校验参数、权限、预算与副作用,再把结果送回模型继续推理。发布期官方配方使用专用 Chat Template 与 minimax parser;当前框架升级后仍需重做协议测试。M117
模型像控制室里的调度员,只能填一张“请查库存”或“请运行测试”的工单。值班主管先检查它有没有权限、参数是否完整、会不会删数据,再让隔离环境真正执行。
工具返回的网页、日志和文件也可能藏恶意指令,所以结果只能当不可信数据。长思考能规划更多步骤,也给 Prompt Injection 更长的传播链,权限反而要收得更紧。
模型只能看见当前任务真正需要的工具。
拒绝越权路径、危险命令与超预算请求。
Secret、文件、出口和进程边界都在模型外。
高副作用操作人工确认,完整记录调用链。
它仍是理解混合线性注意力、超长 RL 与系统耦合的优秀样本;但新业务若只想获得当前 SLA、原生多模态或轻量部署,M1 通常不是默认起点。
SFT 规模与教师
CISPO Group size 与 IS 上界
RL 总 Step、Token、Rollout
GenRM 规模与校准频率
论文 / 开放权重的 1M 输入 + 80K 输出总约束
独立 M1 System Card / 红队报告
M1 的真正价值不是证明“线性注意力已经解决一切”,而是展示长上下文与长推理必须端到端共同设计:架构、缓存、低精度 Kernel、MoE 通信、CISPO、Verifier、Reward、Sandbox 和线上调度,任何一环都可能成为瓶颈。
本文优先使用技术报告、固定版本配置与实现、官方部署指南和当前 API 文档;发布方 Benchmark 与外部证据分层展示,所有推导值都写明假设。
架构、7.5T 继续预训练、CISPO、RL 数据、40K/80K 课程与官方评测
两个 Checkpoint、采样参数、评测脚手架、部署与函数调用入口
80 层、7:1 层型、GQA、MoE、RoPE 与精确几何
Lightning 递归状态、完整 GQA、Top-2 MoE 与推理 Cache
40K 开放 Checkpoint 与 Apache-2.0 元数据
414 个权重分片的文件尺寸、dtype 参数统计与仓库更新时间
当前 Transformers 原生格式、配置与模型卡
2025-06-16 发布、发布方算力主张与首发国际价格
Hybrid Lightning 主干的前身、长上下文训练与检索实验
MiniMax 对复杂多跳、低精度状态、Prefix Cache 与推测解码的官方后验
截至核查日只列 M3、M2.7 与 M2.5,不含 M1
当前文本模型清单列 M3 与 M2.x,不含 M1
标注 deprecated,保留 POST /v1/text/chatcompletion_v2 与 MiniMax-M1 参数说明
2025-06-16 发布与中国大陆三档首发 Token 价格
8×H800/H20、TP8、experts_int8 与 4096 Token 启动示例
当前原生架构支持与公开配置字段解释
专用 Chat Template、minimax parser 与手动解析路径
商业使用、修改、再分发、专利、归属和无担保条款
研究底稿:architecture/MiniMax/MiniMax-M1深度研究.md。API、价格、框架和第三方服务会变化,生产使用前请重新打开官方文档。