10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

MiniMax H3 开源:全模态视频生成模型,支持 2K/15 秒/立体声

1周前 AI最新动态 623 0

MiniMax 正式开源了新一代通用视频模型 H3。这是一个全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段就具备了广泛的多模态上下文理解与生成能力。

图片 1

输出规格

  • 时长:4–15 秒
  • 宽高比:支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种比例
  • 分辨率:默认短边 768 像素,H3-Regenerate-2K 可实现 2K 分辨率
  • 帧率:24 FPS
  • 音频:32 kHz 立体声
  • 语言:稳定支持 11 种语言(中、英、日、韩、法、德、西等)

两种输入模式

H3-Base-FL2VA(首尾帧模式):支持输入 0/1/2 张图像,分别对应文生视频、首帧生视频、尾帧生视频、首尾帧生视频。

H3-Base-Ref2VA(全模态参考模式):最多 9 张图像 + 3 段视频 + 3 段音频,合计最多 12 个文件。音频必须与图像或视频一同输入。

三大模块架构

H3 系统由三个模块组成:

  • H3-Context-IR:多模态指令理解与提炼系统,将自由形式的输入转换为结构化表示,包含指令解析、跨模态关联、时序理解和复杂逻辑推理
  • H3-Base:根据 Context-IR 的输出生成音频和视频,输出 768p 结果
  • H3-Regenerate-2K:将 768p 结果连同原始上下文送回 H3,以 2K 分辨率重新生成,视觉保真度更高

图片 2

技术架构细节

H3-Encoder:使用 Qwen3-VL-32B 的完整预训练权重,将第 50 层的 hidden states 提供给 H3-Omni-Transformer。Tokenizer 配置中增加了若干 special tokens。

H3-VAE:分为 H3-VisualVAE(视频/图像编码)和 H3-AudioVAE(音频编码),将多模态输入编码为统一表示。

H3-Omni-Transformer:联合预测视频 latent 和音频 latent,随后分别解码为视频和立体声音频。原生支持稀疏注意力训练与推理,首个开源版本提供全注意力推理,稀疏注意力将在后续更新中发布。

图片 3

推荐工作流

完整 2K 工作流:先调用 H3-Context-IR API 处理输入(文本、图像、视频、音频),将返回的结构化表示连同原始素材传给 H3-Base 生成 768p 结果,再使用 H3-Regenerate-2K 将结果升频至 2K。

快速 768p 工作流:如果不需要 2K 分辨率,可以直接将结构化表示传给 H3-Base 完成生成。

MiniMax 还提供了详细的提示词写作指南和视频提示词模板,帮助开发者构建自己的预处理系统。

📦 开源地址:MiniMax-H3 @ Hugging Face | GitHub

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:MiniMax H3 开源:全模态视频生成模型,支持 2K/15 秒/立体声
#MiniMax #H3 #视频生成 #开源模型 #全模态 
收藏 1
Gander:零权限无广告的 Android 文件查看器,支持 PDF/Office/Markdown
Kimi K3 对比 DeepSeek V4 Flash:2.8 万亿参数与 50 倍价差的路线之争
推荐阅读
  • Cursor推出Ultra 计划!Cursor Pro 不限请求次数了!
  • GPT-5.6 宣而不发,Fable 5 归来再禁:出口管制下的模型封锁
  • 从视频到网页与代码:Kimi K2.5的多模态复现能力与Kimi Code实测
  • Qwen-Image-3.0正式上线千问AI平台:Arena.ai文生图榜单国内第一,4.5k token复杂版面一次生成
  • GPT-5 Codex 来了:比 Claude Code 更专业的编程伙伴?
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
33184 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29654 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
22698 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
21797 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
18858 4月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
17828 3月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17780 1年前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
17351 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
17268 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16032 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 智谱ZCode 3.0升级:面向GLM-5.2深度优化,缓存命中率98%,限时额度1.5倍
2 DeepSeek 官宣 API 整体涨价:免费 Token 时代倒计时,开发者如何应对
3 MiniMax-H3-Turbo-Lora:8 步推理加速视频生成,质量不输原生 20 步
4 DeepSeek V4 Flash 内置联网搜索:Responses API 原生支持 web_search,Codex 可直接调用
5 GPT-5.6 更新:Luna 免费无限文本,Sol 统一付费 Chat 快答与深思
6 Cherry Studio V2.0 正式发布:从 AI 聊天客户端到 Agent 自主执行的全能工作站
7 Qwen-Image-3.0正式上线千问AI平台:Arena.ai文生图榜单国内第一,4.5k token复杂版面一次生成
8 Qwen 3.8 Max 实测:与 Kimi K3 三场景对比,工程严谨度更胜一筹
9 Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?
10 Qwen3.8-Max 上线:2.4 万亿参数,自主编程 16 天,API 首发千问 AI 平台
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联