跳到正文
MINIMAX SIGNAL LAB · H3
模型专题 · Omni-modal Audio-Video Generation

先理解一切,再同时造画面
和声音

MiniMax H3 把文字、图片、视频和音频参考放进同一个上下文,让一条 33B 稠密 Transformer 主干联合预测视频与立体声音频潜变量。但最重要的第一课是:开放权重只覆盖 768p 的 H3-Base,不等于官方完整三段式系统。H301

一句话判断

API 适合先验证工作流,本地权重适合有明确数据或研究诉求的团队。H3 的统一能力很新,但首发全注意力、百 GiB 级权重和定制许可都不是“消费卡一键跑”的条件。

概念图:文字、图片、视频和音频素材进入统一的多模态生成引擎,同时形成视频胶片和左右两条音频波形,再带着原上下文循环到更大画幅
直觉总览:多种参考先汇成一个上下文,视频与立体声在同一生成主干中协同形成,再用原上下文参与 2K 重生成。精确模块以正文 SVG 为准。查看原图 ↗
33BOmni Transformer
≈13BAdaLN 分支参数
4–15 sAPI / SGLang / vLLM
24 FPS固定帧率
32 kHz原生立体声
2026-07-31产品 / API 官宣

产品 / API 于 2026-07-31 官宣;开放权重许可证日期为 2026-08-02。Diffusers main 当前本地合同为 5–15 秒;动态 API、价格和框架状态快照为 2026-08-10。

01 / 系统边界

下载到的 H3-Base,只是完整系统的中间发动机

官方完整 H3 先用 H3-Context-IR(Context Intermediate Representation,上下文中间表示)理解复杂素材,再由 H3-Base 生成 768p 音视频,最后让 H3-Regenerate-2K 带着原上下文重生成 2K。首版开放的是中间这一段。H301

MiniMax H3 完整系统与开放范围:托管 Context-IR 进入开放 H3-Base,再进入托管 Regenerate-2K;下载范围包括 FL2VA、共享编码器与 VAE、Ref2VA
“开放权重 H3”精确指向 H3-Base;Context-IR 与 2K 重生成模块仍是托管能力。
白话先懂

把完整 H3 想成电影制片厂:Context-IR 是把散乱素材整理成分镜的导演组,H3-Base 是拍出 768p 画面与同期声的摄影棚,Regenerate-2K 是拿着原分镜重拍高分辨率版本。现在可以搬回家的,是摄影棚的机器,不是整个制片流程。

Hosted / 托管

H3-Context-IR

多阶段解析文本、图片、视频、音频之间的角色、时间和意图关系;官方称其对最终质量关键,但内部多模型流程不开放。

Open weights / 开放权重

H3-Base

包含两个任务 Transformer、Qwen3-VL Encoder、Visual VAE 与 Audio VAE;本地目标是 768p 联合音视频生成。

Hosted / 托管

H3-Regenerate-2K

不是固定像素插值,而是把 768p 成片与原始上下文再次送入 H3,让模型重新生成高分辨率细节。

02 / 任务入口

两套 Transformer,覆盖三类任务;“参考”不是随便塞文件

FL2VA(First/Last-frame-to-Video-and-Audio,首/尾帧到音视频)同时承担纯文字和关键帧控制;Ref2VA(Reference-to-Video-and-Audio,参考素材到音视频)处理更复杂的图像、视频与音频关系。两者共享 Encoder 与 VAE,但使用不同生成 Transformer。H307

H3-Base-FL2VA0 / 1 / 2 图

文本、首帧、尾帧或首尾帧

零张图是 T2VA(Text-to-Video-and-Audio,文生音视频);一张图可作为首帧或尾帧;两张图锁定首尾两端。

  • 任务值:t2va / fl2va
  • 适合镜头生成与起终态控制
  • 单独下载约 134.2 GiB Blob
H3-Base-Ref2VA≤ 12 文件

角色、动作、声音与视频编辑参考

最多 9 张图、3 段视频和 3 段音频;视频与音频各自总时长不超过 15 秒。音频不能单独作为唯一参考,必须搭配图像或视频。

  • 任务值:ref2va
  • 每段视频 / 音频 2–15 秒
  • 所有媒体文件合计最多 12 个
6 类常用比例21:9、16:9、4:3、1:1、3:4、9:16;Ref2VA 还可用 Auto。
768 px 短边H3-Base 的原生本地画布;宽高通常取 32 的倍数。
11 种稳定对话语言含中英日韩、法德意、西葡俄与阿拉伯语。
请求体 ≤ 64 MB托管 API 的整体限制;大素材优先 URL,而非内嵌 Base64。
03 / 联合架构

读输入的模块各不相同,真正生成时汇入同一条单流主干

文本由 H3 Encoder 编码;图片和视频同时走 Encoder 与 Visual VAE(Variational Autoencoder,变分自编码器);参考音频走 Audio VAE。条件表示与噪声潜变量统一打包,加上 MM-RoPE(Multimodal Rotary Position Embedding,多模态旋转位置编码)的时间、高度、宽度坐标,再交给一条 33B 稠密单流 Transformer。H301

H3-Base 架构:文本、图像视频和参考音频分别编码后打包,带三维位置进入 33B 单流 Transformer,联合预测视频与音频潜变量,再经两个 VAE 解码
“Omni”发生在打包与联合预测层;Attention 和 FFN 本身不为每种模态另做一套结构。
白话先懂

不同素材先各自找翻译:图片要同时保留“这是什么”和“像素怎么动”,音频要保留左右声道的节奏与音色。翻译完以后,它们都坐到同一张长桌上;一位总导演同时决定下一小段画面和声音,而不是先拍无声片再后期配音。

Encoder

完整 Qwen3-VL-32B

官方使用完整预训练权重,并把第 50 层隐藏状态送入 Omni Transformer;专用 Tokenizer 还增加了对白等特殊标记。

Omni Transformer

50 主层 + 2 Refiner

56 个注意力头、每头 128 维,hidden size 5,376,FFN 14,336;公开配置可复核这些几何。

AdaLN

约 13B 可预计算分支

AdaLN(Adaptive Layer Normalization,自适应层归一化)承担模态调制;官方称其输出可缓存,纯推理无需加载这部分参数。

Attention

首发仍是 Full Attention

训练末期已引入原生稀疏注意力,但首个开放版本只提供全注意力推理;长参考序列仍会快速放大成本。

公开组件几何 / 配置它改变什么
H3 EncoderQwen3-VL-32B · 64 层 · hidden 5,120 · 第 50 层输出先理解文字与视觉语义,不直接产生最终像素。
Omni Transformer33B Dense · 50 + 2 层 · 56 heads · head dim 128同一去噪主干联合更新视频与音频潜变量。
位置系统3D MM-RoPE:(t, h, w)在打包序列里保留时间和二维空间关系。
推理引导CFG-distilled · 官方 recipe 50 stepsCFG(Classifier-Free Guidance,无分类器引导)已蒸馏,运行时只走一条去噪分支。
04 / 潜变量账本

1344×768 的 5 秒画面,进入主干前约是 3 万个视频 Token

Visual VAE 先把空间缩 16×、时间缩 4×,再用 1×2×2 Patch 继续压空间,所以送进 Transformer 的有效空间缩放是 32×,时间仍是 4×。Audio VAE 则把每声道 32,000 Hz 波形压到 40 Hz 潜变量序列。H305H306

H3 潜变量预算:1344×768 五秒视频经时间四倍、空间三十二倍压缩得到约 30240 个视频 Token;每声道 32kHz 音频经 800 倍压缩得到 200 个潜变量时间步
3 万是课堂估算:实际公开复现用 124 帧生成约 5.167 秒,因果 VAE 边界和条件素材还会改变最终打包长度。
时间格帧数 ÷ 4
×
空间格⌈W/32⌉ × ⌈H/32⌉
=
视频 Token不含条件素材
可交互 / 潜变量估算

换一个画幅和时长,看看序列怎样长

计算器按 24 FPS、时间 4×、空间 32×估算,不包含文本、参考图/视频/音频与实现边界 Token。

原始帧数120
视频 Token(估算)30,240
每声道音频步200
相对 5 秒 1344×7681.00×
05 / 2K 不是超分按钮

H3 用“带着原题重做一遍”代替“猜像素放大”

传统超分常只看低清结果猜回纹理;H3-Regenerate-2K 同时读取 768p 成片与最初的多模态上下文,再用生成能力重建细节。理论上它能利用原始文字、角色和参考素材找回小字与细节,但这一模块目前未开放权重,只能通过 API 验证。H312

H3 三种使用路线:直接托管 API 生成 768P 或 2K;也可由 Context-IR 增强提示、本地 H3-Base 生成 768p,再调用 Regenerate-2K API 重生成 2K
混合路线能把 Base 推理留在本地,却仍依赖官方 Context-IR / Regenerate-2K 才能贴近完整 2K 工作流。
工程含义

“2K”是一条系统路线,不只是宽高参数。如果合规要求禁止上传原始素材或本地成片,托管 Context-IR 与重生成都可能不可用;这时应该把验收目标写成“本地 768p H3-Base”,而不是暗示已经复现完整云端质量。

Base video / 成片合同

必须是合规 H3 768P 输出

带音轨;宽高都能被 32 整除;面积不超过 768×1344;107–362 帧,并满足 (帧数 − 5) mod 17 = 0

Inputs / 输入合同

重交生成时完全相同的素材

不是“相似参考”或原始 Prompt。文本必须是 H3-Context-IR 返回后实际送进 Base 的最终 Prompt,媒体顺序与内容也要相同。

Task / 任务合同

优先直接传 base_video

source_task_id 路线需要白名单,且源任务受 7 日查询窗口约束;生产应保存可访问的成片 URL 与完整输入 manifest。

06 / 证据账

规格公开得很细,质量结论却还在发布早期

截至 2026-08-10,固定配置、权重、示例脚本和框架复现已经足够分析系统;但官方技术报告仍标为“后续发布”,模型卡没有给统一测试集、对照模型、样本数与置信区间组成的质量表。厂商演示可以证明“能做”,不能单独证明“在你的业务里最好”。H302

可直接复核

配置、权重与 I/O 合同

固定 commit 能复核层数、头数、VAE 压缩、Blob 体积、任务目录与专用 Tokenizer;API 文档能复核时长、画幅与输入限制。

发布方披露

训练流水线的相对收益

MiniMax 称大多数素材理解消耗约 10 万推理 Token、平均生成约 4,000 Token 描述;H3-VAE 带来约 4× 序列长度优势,异构训练吞吐提升近 30%。这些缺少完整实验配置,应保留“发布方称”。

框架复现

特定硬件上的可运行性

SGLang 为 H200、B300 与 RTX 5090 披露了可对照的工作负载、延迟和峰值显存;H100 小节未披露完整工作负载,只适合做该小节内的拓扑比较。它们验证部署路线,不等于内容质量 Benchmark。

仍缺失

独立、同口径的质量比较

还需要冻结 Prompt / 素材 / 种子 / 时长,盲评角色一致性、动作正确、音画同步、对白可懂度、文本渲染、失败率与单位合格成本。

不要写成:“H3 已被证明是最强 2K 音视频模型”或“开放权重即可复现官方完整质量”。
可以写成:“H3 首发提供少见的开放权重联合音视频主干,官方给出可复现 768p 流程;完整 2K 工作流和跨模型质量优势仍需托管模块与独立评测验证。”
框架 / 硬件固定工作负载公开结果正确读法
SGLang · 4× H2001344×768 · 约 5 秒 · 50 steps · warmup 后Ulysses 4:74.38 s · 94,290 MB/GPU数据中心吞吐参考;不是 15 秒或 Ref2VA 的通用延迟。
SGLang · 8× B3001344×768 · 124 帧 / 5.167 秒 · 50 steps · 单请求 + 1 次 warmupFL2VA BF16 / fold:19.04 s · 83,578 MB/GPU只代表该版本、精度和 Encoder 放置;Ref2VA 与 FP8 是另外的行。
SGLang · 2× RTX 50901344×768 · 约 5 秒 · 50 steps · layerwise offload559.67 s · 26.3 GiB/GPU · 384 GiB-class host证明工作站可跑,不代表交互式速度或低主存。
07 / API 与单位经济

按秒价格很好算,真正容易漏的是输入视频和二次素材费

2026-08-10 的官方按量价:768P 输出 $0.08/秒,2K 输出 $0.13/秒;输入音频免费,前 5 张输入图免费、之后每张 $0.04;输入视频按输出分辨率的每秒费率计费。Context-IR 另按输入 / 输出 Token 收 $0.90 / $3.60 每百万。H313

可交互 / 直接生成估价

先估输出,再把参考素材加回来

只计算直接 H3 API 的已公布项目,不含 Context-IR、重生成、存储、网络或失败重试。

输出费$0.80
素材费$0.00
单次估算合计$0.80

前 5 张图免费;输入视频按 768P 每秒 $0.08 计。

POST /v2/video_generation · 最小合同示意
{
  "model": "MiniMax-H3",
  "content": [{ "type": "text", "text": "..." }],
  "duration": 10,
  "resolution": "768P",
  "ratio": "16:9"
}
生产提醒

创建接口返回 task_id,不是视频本体;客户端需要轮询查询任务、处理失败与超时,并在下载 URL 过期前把结果转存到自己的对象存储。文字是每个请求的必选项,图生视频与参考生视频模式不能混用。

08 / 本地部署

单任务约 134 GiB 只是下载账,不是显存答案

按固定 Hugging Face commit 的 Blob 求和:一个自包含 FL2VA 目录约 134.2 GiB;共享组件加两个任务 Transformer 约 195.9 GiB。运行时还要放激活、长序列 Attention、VAE 解码、通信缓冲和框架余量,所以“权重装得下”远未等于“工作负载跑得稳”。H309

H3 部署与许可边界:左侧列出单任务与双任务权重体积、数据中心及双 RTX 5090 路线;右侧列出许可证地域、商业授权、分发展示和模型训练限制
资源门与法律门必须分别过:能加载权重,不代表拥有目标地区和业务形态的许可。
SGLang / 首选复现

数据中心并行路线

官方仓库把 SGLang 作为示例;4 卡用 Ulysses 序列并行、TP 或 FSDP,适合保留 50-step 质量基线并做容量测试。

vLLM-Omni / 服务化

OpenAI-compatible 视频入口

当前 H3 走 vLLM-Omni 而非普通文本 vLLM;双 DiT 默认共享 Encoder/VAE,内存紧张时只加载 FL2VA 或 Ref2VA。

Diffusers / ComfyUI

main / source install 与节点工作流

H3 采用 Modular Diffusers;当前支持位于 main,不能假设任意稳定版都包含。生产应从源码安装并锁 commit。Diffusers 本地文档约束 5–15 秒,与 API / SGLang / vLLM 的 4–15 秒合同分开;ComfyUI 需 0.30.0+。

SGLang · 4 GPU FL2VA 服务示意
sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 --ulysses-degree 4 \
  --performance-mode speed \
  --model-variant fl2va \
  --host 0.0.0.0 --port 30010
09 / 许可证与选型

它是开放权重,但不是“下载后全球随便商用”

MiniMax H3 Community License 的适用区域明确排除美国、欧盟、英国与韩国;排除地区需要另行申请。商业产品 / 服务年收入超过 2,000 万美元要事先书面授权;商业 UI 有展示要求,公开生成内容要标注机器生成,也不得用 H3 Works 或其 Outputs 改进其他 AI 模型(H3 及其衍生除外)。H308

LEGAL GATE / 法务门

向第三方提供 H3 Works 或相关产品 / 服务时要提供协议副本,修改文件要显著说明;NOTICE 文件只适用于非 Hosted Services 的第三方分发。许可证还包含可接受使用与高风险场景限制。这里是工程摘要,不是法律意见;跨区域产品、模型微调、输出再训练或商业分发,都应让法务按实际主体与流量路径复核原文。

优先 API

先验任务价值

  • 需要完整 2K 与 Context-IR
  • 用量不稳定,先按秒付费
  • 没有多卡与 384 GiB 级主存
  • 希望少维护前沿框架分支
考虑本地

数据与研究理由明确

  • 素材不能离开内网
  • 要研究或微调 H3-Base
  • 有多卡、存储和媒体流水线
  • 能接受先以 768p 为合同
暂缓

许可或证据不闭环

  • 目标地区落在排除范围
  • 想用输出训练另一模型
  • 没有业务盲评与失败率数据
  • 把厂商 Demo 当上线验收
最终判断

H3 最有价值的创新,是把“理解混合参考”和“联合生成画面与立体声”放进一个可下载的 33B 主干;最容易误判的地方,是把这台主干当成完整 H3 产品。正确的验证顺序是:先用 API 冻结样本做音画盲评与成本账,再判断是否有足够强的数据、定制或研究理由承担本地 768p、全注意力和许可证门槛。

10 / 来源与核查口径

固定配置讲结构,当前文档讲产品,框架实测讲可运行性

本文把模型卡与配置锁定到 commit 6818f6c,避免仓库更新后数字漂移;API、价格、框架与许可证按 2026-08-10 单独核查。发布方流程数字保留发布方属性,未发现的独立质量证据明确留空。

H301
MiniMax H3 Model Card(固定版本)Hugging Face · commit 6818f6c · 2026-08-09

完整系统、任务输入、架构、开放边界与复现流程

H302
MiniMax H3 官方发布博客MiniMax · 2026-07-31

产品定位、训练系统披露、Contextual Omni Representation 与技术报告状态

H303
H3 Omni Transformer config官方 Checkpoint · commit 6818f6c

50+2 层、56 头、5,376 hidden、14,336 FFN 与 1×2×2 Patch

H304
H3 Encoder configQwen3-VL-32B · commit 6818f6c

64 层、5,120 hidden、视觉塔与 262,144 位置配置

H305
H3 Visual VAE config官方 Checkpoint · commit 6818f6c

24 潜变量通道、空间 16×、时间 4× 与 ViT Decoder

H306
H3 Audio VAE config官方 Checkpoint · commit 6818f6c

32 kHz、32 潜变量通道与 800× 时间压缩

H307
H3 Diffusers model_index官方 Checkpoint · commit 6818f6c

共享组件、FL2VA / Ref2VA 双 Transformer 与开发版依赖

H308
MiniMax H3 Community License官方定制许可证 · 2026-08-02

地域、商业、分发、AI 训练与可接受使用限制

H309
MiniMax H3 Model API MetadataHugging Face · 核查 2026-08-10

仓库状态、固定 SHA 与各 Blob 字节体积

H310
Create Video Generation TaskMiniMax Platform · 核查 2026-08-10

模型 ID、输入模式、文件限制、分辨率、时长与异步任务合同

H311
H3 Context-IR APIMiniMax Platform · 核查 2026-08-10

上下文增强接口、Token 用量与输出含义

H312
H3 Regeneration APIMiniMax Platform · 核查 2026-08-10

768p 成片到 2K 重生成的接口合同

H313
Pay-as-you-go PricingMiniMax Platform · 价格快照 2026-08-10

H3 768P / 2K、输入素材、重生成与 Context-IR 价格

H314
SGLang MiniMax H3 CookbookSGLang · 核查 2026-08-10

H200/B300/RTX 5090 的同口径工作负载、并行、Offload 与复现实测;H100 小节只用于拓扑内比

H315
vLLM-Omni MiniMax H3 RecipevLLM · 核查 2026-08-10

双 Transformer 共享组件、服务入口、依赖与低显存路线

H316
Diffusers MiniMax H3 DocsHugging Face Diffusers · main · 核查 2026-08-10

ModularPipeline、双 Scheduler、生成约束与组件加载状态

H317
ComfyUI MiniMax H3 WorkflowComfyUI · v0.30.0+

T2V / I2V / R2V 原生工作流、节点与画布限制

H318
MiniMax-H3 Official RepositoryMiniMax-AI · 核查 2026-08-10

推荐框架、可复现请求、完整 2K 流程与 Prompt 指南

体积口径:GiB 按 Hugging Face API 返回的 Blob bytes ÷ 2³⁰ 求和;不代表单 GPU 驻留显存。价格口径:美元按量价快照,不含税、套餐、失败重试、本地算力、存储与传输。质量口径:官方示例与框架性能数字不视为独立内容质量结论。