H3-Context-IR
多阶段解析文本、图片、视频、音频之间的角色、时间和意图关系;官方称其对最终质量关键,但内部多模型流程不开放。
MiniMax H3 把文字、图片、视频和音频参考放进同一个上下文,让一条 33B 稠密 Transformer 主干联合预测视频与立体声音频潜变量。但最重要的第一课是:开放权重只覆盖 768p 的 H3-Base,不等于官方完整三段式系统。H301
API 适合先验证工作流,本地权重适合有明确数据或研究诉求的团队。H3 的统一能力很新,但首发全注意力、百 GiB 级权重和定制许可都不是“消费卡一键跑”的条件。
产品 / API 于 2026-07-31 官宣;开放权重许可证日期为 2026-08-02。Diffusers main 当前本地合同为 5–15 秒;动态 API、价格和框架状态快照为 2026-08-10。
官方完整 H3 先用 H3-Context-IR(Context Intermediate Representation,上下文中间表示)理解复杂素材,再由 H3-Base 生成 768p 音视频,最后让 H3-Regenerate-2K 带着原上下文重生成 2K。首版开放的是中间这一段。H301
把完整 H3 想成电影制片厂:Context-IR 是把散乱素材整理成分镜的导演组,H3-Base 是拍出 768p 画面与同期声的摄影棚,Regenerate-2K 是拿着原分镜重拍高分辨率版本。现在可以搬回家的,是摄影棚的机器,不是整个制片流程。
多阶段解析文本、图片、视频、音频之间的角色、时间和意图关系;官方称其对最终质量关键,但内部多模型流程不开放。
包含两个任务 Transformer、Qwen3-VL Encoder、Visual VAE 与 Audio VAE;本地目标是 768p 联合音视频生成。
不是固定像素插值,而是把 768p 成片与原始上下文再次送入 H3,让模型重新生成高分辨率细节。
FL2VA(First/Last-frame-to-Video-and-Audio,首/尾帧到音视频)同时承担纯文字和关键帧控制;Ref2VA(Reference-to-Video-and-Audio,参考素材到音视频)处理更复杂的图像、视频与音频关系。两者共享 Encoder 与 VAE,但使用不同生成 Transformer。H307
零张图是 T2VA(Text-to-Video-and-Audio,文生音视频);一张图可作为首帧或尾帧;两张图锁定首尾两端。
t2va / fl2va最多 9 张图、3 段视频和 3 段音频;视频与音频各自总时长不超过 15 秒。音频不能单独作为唯一参考,必须搭配图像或视频。
ref2va文本由 H3 Encoder 编码;图片和视频同时走 Encoder 与 Visual VAE(Variational Autoencoder,变分自编码器);参考音频走 Audio VAE。条件表示与噪声潜变量统一打包,加上 MM-RoPE(Multimodal Rotary Position Embedding,多模态旋转位置编码)的时间、高度、宽度坐标,再交给一条 33B 稠密单流 Transformer。H301
不同素材先各自找翻译:图片要同时保留“这是什么”和“像素怎么动”,音频要保留左右声道的节奏与音色。翻译完以后,它们都坐到同一张长桌上;一位总导演同时决定下一小段画面和声音,而不是先拍无声片再后期配音。
官方使用完整预训练权重,并把第 50 层隐藏状态送入 Omni Transformer;专用 Tokenizer 还增加了对白等特殊标记。
56 个注意力头、每头 128 维,hidden size 5,376,FFN 14,336;公开配置可复核这些几何。
AdaLN(Adaptive Layer Normalization,自适应层归一化)承担模态调制;官方称其输出可缓存,纯推理无需加载这部分参数。
训练末期已引入原生稀疏注意力,但首个开放版本只提供全注意力推理;长参考序列仍会快速放大成本。
| 公开组件 | 几何 / 配置 | 它改变什么 |
|---|---|---|
| H3 Encoder | Qwen3-VL-32B · 64 层 · hidden 5,120 · 第 50 层输出 | 先理解文字与视觉语义,不直接产生最终像素。 |
| Omni Transformer | 33B Dense · 50 + 2 层 · 56 heads · head dim 128 | 同一去噪主干联合更新视频与音频潜变量。 |
| 位置系统 | 3D MM-RoPE:(t, h, w) | 在打包序列里保留时间和二维空间关系。 |
| 推理引导 | CFG-distilled · 官方 recipe 50 steps | CFG(Classifier-Free Guidance,无分类器引导)已蒸馏,运行时只走一条去噪分支。 |
Visual VAE 先把空间缩 16×、时间缩 4×,再用 1×2×2 Patch 继续压空间,所以送进 Transformer 的有效空间缩放是 32×,时间仍是 4×。Audio VAE 则把每声道 32,000 Hz 波形压到 40 Hz 潜变量序列。H305H306
计算器按 24 FPS、时间 4×、空间 32×估算,不包含文本、参考图/视频/音频与实现边界 Token。
传统超分常只看低清结果猜回纹理;H3-Regenerate-2K 同时读取 768p 成片与最初的多模态上下文,再用生成能力重建细节。理论上它能利用原始文字、角色和参考素材找回小字与细节,但这一模块目前未开放权重,只能通过 API 验证。H312
“2K”是一条系统路线,不只是宽高参数。如果合规要求禁止上传原始素材或本地成片,托管 Context-IR 与重生成都可能不可用;这时应该把验收目标写成“本地 768p H3-Base”,而不是暗示已经复现完整云端质量。
带音轨;宽高都能被 32 整除;面积不超过 768×1344;107–362 帧,并满足 (帧数 − 5) mod 17 = 0。
不是“相似参考”或原始 Prompt。文本必须是 H3-Context-IR 返回后实际送进 Base 的最终 Prompt,媒体顺序与内容也要相同。
source_task_id 路线需要白名单,且源任务受 7 日查询窗口约束;生产应保存可访问的成片 URL 与完整输入 manifest。
截至 2026-08-10,固定配置、权重、示例脚本和框架复现已经足够分析系统;但官方技术报告仍标为“后续发布”,模型卡没有给统一测试集、对照模型、样本数与置信区间组成的质量表。厂商演示可以证明“能做”,不能单独证明“在你的业务里最好”。H302
固定 commit 能复核层数、头数、VAE 压缩、Blob 体积、任务目录与专用 Tokenizer;API 文档能复核时长、画幅与输入限制。
MiniMax 称大多数素材理解消耗约 10 万推理 Token、平均生成约 4,000 Token 描述;H3-VAE 带来约 4× 序列长度优势,异构训练吞吐提升近 30%。这些缺少完整实验配置,应保留“发布方称”。
SGLang 为 H200、B300 与 RTX 5090 披露了可对照的工作负载、延迟和峰值显存;H100 小节未披露完整工作负载,只适合做该小节内的拓扑比较。它们验证部署路线,不等于内容质量 Benchmark。
还需要冻结 Prompt / 素材 / 种子 / 时长,盲评角色一致性、动作正确、音画同步、对白可懂度、文本渲染、失败率与单位合格成本。
| 框架 / 硬件 | 固定工作负载 | 公开结果 | 正确读法 |
|---|---|---|---|
| SGLang · 4× H200 | 1344×768 · 约 5 秒 · 50 steps · warmup 后 | Ulysses 4:74.38 s · 94,290 MB/GPU | 数据中心吞吐参考;不是 15 秒或 Ref2VA 的通用延迟。 |
| SGLang · 8× B300 | 1344×768 · 124 帧 / 5.167 秒 · 50 steps · 单请求 + 1 次 warmup | FL2VA BF16 / fold:19.04 s · 83,578 MB/GPU | 只代表该版本、精度和 Encoder 放置;Ref2VA 与 FP8 是另外的行。 |
| SGLang · 2× RTX 5090 | 1344×768 · 约 5 秒 · 50 steps · layerwise offload | 559.67 s · 26.3 GiB/GPU · 384 GiB-class host | 证明工作站可跑,不代表交互式速度或低主存。 |
2026-08-10 的官方按量价:768P 输出 $0.08/秒,2K 输出 $0.13/秒;输入音频免费,前 5 张输入图免费、之后每张 $0.04;输入视频按输出分辨率的每秒费率计费。Context-IR 另按输入 / 输出 Token 收 $0.90 / $3.60 每百万。H313
只计算直接 H3 API 的已公布项目,不含 Context-IR、重生成、存储、网络或失败重试。
前 5 张图免费;输入视频按 768P 每秒 $0.08 计。
{
"model": "MiniMax-H3",
"content": [{ "type": "text", "text": "..." }],
"duration": 10,
"resolution": "768P",
"ratio": "16:9"
}创建接口返回 task_id,不是视频本体;客户端需要轮询查询任务、处理失败与超时,并在下载 URL 过期前把结果转存到自己的对象存储。文字是每个请求的必选项,图生视频与参考生视频模式不能混用。
按固定 Hugging Face commit 的 Blob 求和:一个自包含 FL2VA 目录约 134.2 GiB;共享组件加两个任务 Transformer 约 195.9 GiB。运行时还要放激活、长序列 Attention、VAE 解码、通信缓冲和框架余量,所以“权重装得下”远未等于“工作负载跑得稳”。H309
官方仓库把 SGLang 作为示例;4 卡用 Ulysses 序列并行、TP 或 FSDP,适合保留 50-step 质量基线并做容量测试。
当前 H3 走 vLLM-Omni 而非普通文本 vLLM;双 DiT 默认共享 Encoder/VAE,内存紧张时只加载 FL2VA 或 Ref2VA。
H3 采用 Modular Diffusers;当前支持位于 main,不能假设任意稳定版都包含。生产应从源码安装并锁 commit。Diffusers 本地文档约束 5–15 秒,与 API / SGLang / vLLM 的 4–15 秒合同分开;ComfyUI 需 0.30.0+。
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 --ulysses-degree 4 \
--performance-mode speed \
--model-variant fl2va \
--host 0.0.0.0 --port 30010MiniMax H3 Community License 的适用区域明确排除美国、欧盟、英国与韩国;排除地区需要另行申请。商业产品 / 服务年收入超过 2,000 万美元要事先书面授权;商业 UI 有展示要求,公开生成内容要标注机器生成,也不得用 H3 Works 或其 Outputs 改进其他 AI 模型(H3 及其衍生除外)。H308
向第三方提供 H3 Works 或相关产品 / 服务时要提供协议副本,修改文件要显著说明;NOTICE 文件只适用于非 Hosted Services 的第三方分发。许可证还包含可接受使用与高风险场景限制。这里是工程摘要,不是法律意见;跨区域产品、模型微调、输出再训练或商业分发,都应让法务按实际主体与流量路径复核原文。
H3 最有价值的创新,是把“理解混合参考”和“联合生成画面与立体声”放进一个可下载的 33B 主干;最容易误判的地方,是把这台主干当成完整 H3 产品。正确的验证顺序是:先用 API 冻结样本做音画盲评与成本账,再判断是否有足够强的数据、定制或研究理由承担本地 768p、全注意力和许可证门槛。
本文把模型卡与配置锁定到 commit 6818f6c,避免仓库更新后数字漂移;API、价格、框架与许可证按 2026-08-10 单独核查。发布方流程数字保留发布方属性,未发现的独立质量证据明确留空。
完整系统、任务输入、架构、开放边界与复现流程
产品定位、训练系统披露、Contextual Omni Representation 与技术报告状态
50+2 层、56 头、5,376 hidden、14,336 FFN 与 1×2×2 Patch
64 层、5,120 hidden、视觉塔与 262,144 位置配置
24 潜变量通道、空间 16×、时间 4× 与 ViT Decoder
32 kHz、32 潜变量通道与 800× 时间压缩
共享组件、FL2VA / Ref2VA 双 Transformer 与开发版依赖
地域、商业、分发、AI 训练与可接受使用限制
仓库状态、固定 SHA 与各 Blob 字节体积
模型 ID、输入模式、文件限制、分辨率、时长与异步任务合同
上下文增强接口、Token 用量与输出含义
768p 成片到 2K 重生成的接口合同
H3 768P / 2K、输入素材、重生成与 Context-IR 价格
H200/B300/RTX 5090 的同口径工作负载、并行、Offload 与复现实测;H100 小节只用于拓扑内比
双 Transformer 共享组件、服务入口、依赖与低显存路线
ModularPipeline、双 Scheduler、生成约束与组件加载状态
T2V / I2V / R2V 原生工作流、节点与画布限制
推荐框架、可复现请求、完整 2K 流程与 Prompt 指南
体积口径:GiB 按 Hugging Face API 返回的 Blob bytes ÷ 2³⁰ 求和;不代表单 GPU 驻留显存。价格口径:美元按量价快照,不含税、套餐、失败重试、本地算力、存储与传输。质量口径:官方示例与框架性能数字不视为独立内容质量结论。