10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

MiniMax-H3-Turbo-Lora:8 步推理加速视频生成,质量不输原生 20 步

1月前 AI最新动态 852 0

MiniMax-H3 是一个通用的全模态生成系统,支持文本、图像、视频和音频多种输入组合,可以生成分辨率高达 2K、持续时间长达 15 秒的具有原生立体声音频的视频。

之前介绍了 MiniMax-H3 的特点和实测效果,当时生成的视频跑了 22 分钟。本文介绍第一种加速方案——MiniMax-H3-Turbo-Lora,来看下加速后的效果。

核心结论

MiniMax-H3-Turbo-Lora 在 8 步推理的情况下:

  • 视频质量不错
  • 音频质量也不错
  • 整体镜头切换不错,提示语中的时间线也遵循得不错
  • 提示语遵循性:和原生 20 步一样,单镜头内提示语没有完全遵循

性能对比

测试条件:RTX 4090 24G 显卡,64G 内存(其中 32G 可做共享显存),生成 10 秒 1280×736 分辨率视频。

指标 原生 20 步 Turbo Lora 8 步
显存占用 44G 44G
推理时长 1363s(22 分钟) 624s(10 分钟)
加速比 - 约 2.2 倍

效果展示

使用 MiniMax-H3 官方提示语测试:

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium-wide shot frames a baker opening the shutters of a small street bakery before sunrise. The camera pushes in with small amplitude at slow speed as the middle-aged baker with a calm, slightly raspy voice (S1) places a fresh loaf on the wooden counter and says: [English] First batch of the morning. [Shot 2] At 00:05.000, the camera cuts to a close-up of steam rising from the sliced bread while the baker's final words carry over from the previous shot.

overall_soundscape: Wooden shutters scrape open over a quiet street as trays clink softly inside the bakery. The doorbell rings once, followed by light footsteps and the crisp sound of bread being sliced.

non_diegetic_music: A soft acoustic-guitar pattern at a moderate tempo, joined by sparse upright-bass notes and a gentle fade at the end.

对比结果:加速后的画面质量不错,声音也不错,整体镜头切换和提示语中的时间线遵循得都不错。单镜头内提示语遵循方面,第一个镜头不错,第二个镜头中「镜头切换到切片面包上冒出的蒸汽的特写镜头」没有完全表现出来。

MiniMax-H3 Turbo Lora ComfyUI 工作流

与官方工作流几乎一致,仅三个改动点:

  • 增加 Lora 设置节点
  • 更换采样器
  • 减少采样步数

安装与使用

终端执行以下命令安装插件,之后重启 ComfyUI:

cd ComfyUI/custom_nodes
git clone https://github.com/larryvrh/ComfyUI-MiniMax-H3-Turbo

模型下载

Diffusion 模型(任选其一,放置到 ComfyUI/models/diffusion_models/):

  • minimax_h3_fl2va_bf16:全量模型
  • minimax_h3_fl2va_int8_convrot:int8 模型

CLIP 模型(任选其一,放置到 ComfyUI/models/text_encoders/):

  • qwen3vl_32b_minimax_h3_bf16:全量模型
  • qwen3vl_32b_minimax_h3_int8_convrot:int8 模型
  • qwen3vl_32b_minimax_h3_nvfp4_awq:nvfp4 模型

VAE 模型(全部下载,放置到 ComfyUI/models/vae/):

  • minimax_h3_video_vae_fp16.safetensors
  • minimax_h3_audio_vae_fp32.safetensors

Lora 模型(任选其一,放置到 ComfyUI/models/loras/):

  • minimax_h3_turbo_v4_step600_ema:官方推荐最强模型
  • minimax_h3_turbo_4step_ckpt850:画面动作幅度大时备选

参数设置建议

  • 采样步数:范围 4-8,6-8 的效果最好,超过 8 就没用了。推荐 8
  • Lora 强度:保持 1.0 不变。出现模糊重影→略微增加(1.05-1.2),出现过度锐化颗粒→略微减少(0.8-0.95)
  • low_vram:默认关闭,除非显存不足

该模型还在训练中,重点改进两方面:一是让单镜头内提示语遵循得更好,二是训练更通用的 Turbo Lora。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:MiniMax-H3-Turbo-Lora:8 步推理加速视频生成,质量不输原生 20 步
#MiniMax-H3 #Turbo Lora #视频生成加速 #ComfyUI #AI视频 
收藏 1
Prime Agent:会自我沉淀经验的开源 AI 代理架构,9.2k Stars
anydoc:14 种办公格式统一转 Markdown,5ms 极速转换
推荐阅读
  • AI编程大事件:苹果入局Vibe Coding、OpenAI天价收购Windsurf、Cursor估值狂飙,拆解Vibe Coding爆火逻辑
  • 千问云正式上线:一个 API Key 打通 150+ AI 模型,阿里 MaaS 平台全面开放
  • 腾讯 Hy3 限时免费两周:Hermes Agent 一键接入配置教程
  • Void:完全免费的开源AI代码编辑器来了,堪称Cursor开源平替?Hacker News热搜第一!
  • 支付宝 AI 钱包发布:3 亿笔 Agent 支付背后的商业协议布局
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
33958 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30529 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23372 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22732 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20873 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18817 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18433 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18291 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
17962 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16485 1年前

文章目录

关于苏米客
分类排行
1 Gemini 3.8 Live 发布:语音天梯榜登顶,价格仅为 OpenAI 实时 API 的三分之一
2 OpenAI Codex 用户反馈:300 万阅读量下的额度限制、产品定位与体验痛点
3 ChatGPT Pro X20 暂停新订阅:定价策略还是算力不足?
4 GPT Image 2.5 全面升级:免越狱生成、Sketch 草图、精准编辑,实测对比 Z-Image
5 ChatGPT Images 2.5 上线:生图速度提升 4 倍,免费用户可用,支持手绘草图生图
6 OpenAI 用 1 万个 Agent 88 小时求解纳维-斯托克斯方程:千禧年数学难题突破
7 小米 MiMo Desktop 邀测上线:长程 Agent 任务 99% 缓存命中,直连 Blender 和 Figma
8 GPT Image 2.5 上线:生图更快更高清,支持涂鸦参考、标注精修和透明背景
9 MiniCPM5-2B开源:AA榜单4B以下第一,端侧模型也能做通用Agent
10 OpenAI首席科学家预警:我们正在造出无法理解的外星大脑
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联