10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

HD-V1 视频模型实测:先理解再生成,音画同步与物理规律全面突破

1小时前 AI最新动态 9 0

2023 年 9 月写过《两款炸裂 AI 视频神器:Runway & Pika Labs》,之后两年视频模型狂飙突进——可灵、Veo、Seedance、海螺……每家 demo 都好看得不像话,但真拿去用又是另一回事。看到一个名叫 HiDream-O1-Video-1.0(简称 HD-V1)的视频模型刷屏时,第一反应也是"又一个"。但两个榜单让人停下来多看两眼。

在 Artificial Analysis 的图生视频榜(带音频)排全球第 4,Arena 图生视频盲测榜排第 8。背后开发者是智象未来——估值超 10 亿美元的生成式 AI 企业,与 vivago.ai 同源。

HD-V1 三模型对比测试

榜单:中国 AI 视频在第一梯队

Artificial Analysis 图生视频前六名:

  1. MiniMax H3 Max(fal 调过),1206 分
  2. 字节 Seedance 2.0,1197 分
  3. MiniMax H3,1190 分
  4. 智象 HD-V1,1186 分
  5. Google Gemini Omni Flash,1181 分
  6. 阿里万相 3.0,1179 分

第一名到第六名仅差 27 分。前六里除了 Google,全是中国公司模型。Google 的 Veo 3.1 在第 11。

Artificial Analysis 图生视频排行榜

Arena 盲测榜中 HD-V1 排第 8,前面是 MiniMax H3、Gemini Omni、万相 3.0、Seedance 2.5/2.0、Grok。中国 AI 视频在全球第一梯队,已是榜单上摆着的事实。

Arena 盲测排行榜

核心优势:先理解,再生成

HD-V1 在生成前挂了一个多模态意图理解模块:输入一句口语化描述,先拆成分镜表——镜头时长、场景地点、角色动作、台词节奏、光色影调、运镜焦段、道具音效——拆完再拿表去生成。理解越准,规划越稳,生成越不容易跑偏。普通人的意义很直接:不用学提示词工程,用大白话把事说清楚就行。

时长自适应:由内容决定,不是硬指标

HD-V1 原生支持 5 到 20 秒任意时长。它把时长当意图而非硬指标——写"五秒钟的回眸",最后可能给 3 秒或 10 秒,看内容本身需要多长。对比测试中,同样"抛苹果接住停住"的提示词,其他模型硬撑满 10 秒(动作做完后僵住或慢放凑时长),HD-V1 自然节奏起抛、接住、停稳,时长完全自适应。

音画同步:三路信号一起建模

大多数 AI 视频先逐帧画画面再回头配音,音画难对上。HD-V1 走另一条路:文本、视频、音频三路信号在同一生成过程中一起建模,互相约束。画面运动牵着声音节奏走,台词和音效反过来影响镜头情绪。测试中乒乓球弹跳声随高度变化、士兵耳语到大吼的口型对位、猪油掉进炭火的"刺啦"声,都做到了毫秒级同步。

物理规律:不是后期贴上去,写进叙事规划里

推开古堡木门、多米诺骨牌拐弯、咖啡倒流回杯子、赛车多普勒效应——这些测试中,HD-V1 在物理因果和力学真实感上明显优于竞品。这得益于原生全模态架构下模型直接"看"未经压缩的原图,学习空间关系、时间演变和因果逻辑等物理世界基础规则。

一致性:做成产品的门槛

冲刺运动员衣服 logo 不变、金毛犬项圈不中途改变、线稿上色不出线——做内容的人可能觉得是小瑕疵,但做产品的人知道这是命门。模型能不能稳定不崩,直接决定敢不敢把它包进产品里收钱。

一个底座,四个模型

智象未来 4 月发布原生全模态世界模型架构 HiDream-O1,图像、视频、3D 交互、具身动作在同一个架构上一起生长:

  • HiDream-O1-Image-1.5:Artificial Analysis 文生图榜中国第一、全球第二
  • HiDream-O1-World:WBench 榜单第一
  • HiDream-O1-Embodied:RoboColiseum 扰动适应和空间推理双榜第一
  • HiDream-O1-Video-1.0:Artificial Analysis 图生视频榜第四

HiDream-O1 四大模型同源演进

客观评价

  • 目前是内测状态,需申请
  • 5 到 20 秒是单条视频长度,长片需靠 agent 做分镜串接
  • 榜单只是"图生视频带音频"一项,不代表所有场景
  • API 价格和开放时间尚未公布

视频生成能力以后大概率谁家都有,差别会越来越小。最后拉开差距的是理解那一层——你说一句人话,它能不能听懂。这也是看完 HD-V1 最想记下来的一点。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:HD-V1 视频模型实测:先理解再生成,音画同步与物理规律全面突破
#AI视频 #HD-V1 #智象未来 #多模态 #视频生成 
收藏 1
Agent 自动上传代码库引隐私担忧:开源办公 Agent 为何更重要——以有道 LobsterAI 为例
Jev 模型发布:OpenAI 核心大佬打造纯决策 AI,速度快 200 倍成本降 400 倍
推荐阅读
  • Windsurf新LOGO和新免费计划:全面升级的AI编程体验
  • ChatGPT 史上最大改版:从聊天机器人到超级 App,Codex 周活突破 500 万
  • 支付宝上线「AI收」功能,AI Agent商业化新突破
  • 又是“最强模型”的一天!Google Gemini 2.5 Pro更新,性能再次跃升
  • GPT-5.6 发布:Codex 并入 ChatGPT 桌面端,Sites 一键部署,三子模型分层定价
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34036 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30625 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23412 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22812 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20995 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18892 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18491 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18327 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18073 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16530 1年前

文章目录

关于苏米客
分类排行
1 GLM-5.3-FlashX 上线:推理提速 5 倍达 200 tokens/s,Agent 构建推理 Infra
2 Jev 模型发布:OpenAI 核心大佬打造纯决策 AI,速度快 200 倍成本降 400 倍
3 HD-V1 视频模型实测:先理解再生成,音画同步与物理规律全面突破
4 Agent 自动上传代码库引隐私担忧:开源办公 Agent 为何更重要——以有道 LobsterAI 为例
5 小米 MiMo-V2.6 公开 RL 训练直播:两天烧掉千万,过程数据成研究金矿
6 Anthropic公开AI递归自我改进核心数据:3万Agent参与研发,人类正退出一线
7 Gemini 3.8 Live 发布:语音天梯榜登顶,价格仅为 OpenAI 实时 API 的三分之一
8 OpenAI Codex 用户反馈:300 万阅读量下的额度限制、产品定位与体验痛点
9 ChatGPT Pro X20 暂停新订阅:定价策略还是算力不足?
10 GPT Image 2.5 全面升级:免越狱生成、Sketch 草图、精准编辑,实测对比 Z-Image
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联