MiniMax 正式开源了新一代通用视频模型 H3。这是一个全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段就具备了广泛的多模态上下文理解与生成能力。

输出规格
- 时长:4–15 秒
- 宽高比:支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种比例
- 分辨率:默认短边 768 像素,H3-Regenerate-2K 可实现 2K 分辨率
- 帧率:24 FPS
- 音频:32 kHz 立体声
- 语言:稳定支持 11 种语言(中、英、日、韩、法、德、西等)
两种输入模式
H3-Base-FL2VA(首尾帧模式):支持输入 0/1/2 张图像,分别对应文生视频、首帧生视频、尾帧生视频、首尾帧生视频。
H3-Base-Ref2VA(全模态参考模式):最多 9 张图像 + 3 段视频 + 3 段音频,合计最多 12 个文件。音频必须与图像或视频一同输入。
三大模块架构
H3 系统由三个模块组成:
- H3-Context-IR:多模态指令理解与提炼系统,将自由形式的输入转换为结构化表示,包含指令解析、跨模态关联、时序理解和复杂逻辑推理
- H3-Base:根据 Context-IR 的输出生成音频和视频,输出 768p 结果
- H3-Regenerate-2K:将 768p 结果连同原始上下文送回 H3,以 2K 分辨率重新生成,视觉保真度更高

技术架构细节
H3-Encoder:使用 Qwen3-VL-32B 的完整预训练权重,将第 50 层的 hidden states 提供给 H3-Omni-Transformer。Tokenizer 配置中增加了若干 special tokens。
H3-VAE:分为 H3-VisualVAE(视频/图像编码)和 H3-AudioVAE(音频编码),将多模态输入编码为统一表示。
H3-Omni-Transformer:联合预测视频 latent 和音频 latent,随后分别解码为视频和立体声音频。原生支持稀疏注意力训练与推理,首个开源版本提供全注意力推理,稀疏注意力将在后续更新中发布。

推荐工作流
完整 2K 工作流:先调用 H3-Context-IR API 处理输入(文本、图像、视频、音频),将返回的结构化表示连同原始素材传给 H3-Base 生成 768p 结果,再使用 H3-Regenerate-2K 将结果升频至 2K。
快速 768p 工作流:如果不需要 2K 分辨率,可以直接将结构化表示传给 H3-Base 完成生成。
MiniMax 还提供了详细的提示词写作指南和视频提示词模板,帮助开发者构建自己的预处理系统。
📦 开源地址:MiniMax-H3 @ Hugging Face | GitHub