最近 GitHub 上有个叫 Hypit 的开源项目,干的事挺有意思:把做视频这活儿交给 AI Agent 来干。仓库是 7 月底才建出来的,到现在也没多久,现在的 Star 已经 8200 多了,涨得挺快。
Hypit 是什么
Hypit 是给 AI 编程 Agent 用的视频制作系统,像 WorkBuddy、豆包、Codex 这类 Agent 都能把它装上。装完以后想做什么视频,用大白话跟 Agent 说就行。手里有现成视频的话也行,直接丢给它,它会把这条视频拆成一份工程文件,这份文件后面还能改,改完还能重新跑。
代码主要是 TypeScript 写的,开源。软件本身不收钱,出来的成片也不给加水印,完全开源。

上面是它工作台的样子。左边是视频源文件(SVML),右边是实时渲染出来的画面,文本改了,画面跟着就变。
功能详情
拆出来的东西能直接出片
Hypit 给的东西不一样,它拆出来的是一份完整的工程,一条片子里面的所有东西都在里面了。每个镜头用的什么素材,字幕卡在哪,音效跟在哪句话后面出来,全都标清楚了。这份工程拿到手,可以直接再渲染出一条片子来,想改哪里也能接着改。
官方在仓库里放了三个完整的例子,连成本都标出来了。一条 20 秒的足球排行榜视频,全部成本 1.15 美元。还有一条 18 秒的播客片段,1.07 美元,一条 26 秒的街头采访,1.09 美元。钱花在哪也写明白了,大头是调生成模型的费用,渲染是在本地跑的,这部分不花钱。
改台词不用重排时间轴
干过剪辑的都知道,素材是钉在时间轴上的。第 3.5 秒切个画面,第 5.2 秒出条字幕,全是死的。这时候你要删一句词,麻烦了,后面的字幕和动画全都留在原地不动,声音和画面对不上,只能一个一个手动往后挪。
Hypit 的思路是把所有东西都挂在台词的词上面,不挂时间轴。字幕是跟着台词走的,B-roll 是等某个关键词说到了才进来,音效也是卡着词触发的。这么一来你随便改台词,改完整条视频的时间会自己重新排,对齐这种事根本不用人操心。
它描述视频用的是一种叫 .svml 的文件,可以理解成视频版的 HTML。一个文件里面分了好几层,台词和角色是一层,画面素材是一层,字幕和语音各有各的地方,最后还有一层管怎么合成。台词里还能用 @ 标签做记号,比如说讲到哪个词的时候,让屏幕上弹个表情出来。

词级字幕组件的效果
工程拆出来以后可以反复用
工程拆出来还不算完,我觉得更划算的是后面,它能反复用。
- 主播看腻了想换一个,那字幕和动画这些部分原样留着就行,只要重新生成主播的镜头。
- 带货的场景就更直接了,换品的时候把产品图换掉,价格啊口播词啊顺手改几句,整条片子的结构一点都不用动。
- 想出外语版也差不多,台词换掉以后,时间轴自己会跟着重新排。
官方的说法是一份 workflow 最多能出 100 个变体。一个结构跑通以后,后面每天换品就行。
每个部分都是独立组件
片子里面的各种花样,字幕样式啊、排行榜啊、表情揭示板啊、评论区贴纸啊,在 Hypit 里面都是一个一个独立的组件。官方库里本来就带了一些现成的,比如下面这个排行榜,条目是跟着音效一条一条落位的:

排行榜组件效果

街访视频里的表情揭示板组件
现成的要是看不上,可以 fork 一个过来自己改,改得多了也可以从零自己写一个,做好的组件还能打包发出去给别人用。这个玩法跟前端那边玩组件库差不多,只不过这边拼出来的东西是视频。
不用生成模型也能出片
片子里面的字幕和动效,还有用代码画出来的画面,编成成片的时候其实不用调视频生成模型。官方的说法是纯代码渲染的情况下,模型费用可以是零。素材和文案要是在手里都有,剩下排版加字幕加动画这些活儿,本地就能干完,一分钱模型费都不用花。
当然,要让 AI 生成主播形象和画面,那还是得接模型服务的。官方那几个例子里用的是 Seedance 生成视频,GPT Image 出图,WhisperX 做逐词对齐。Hypit 自己不过手,也不绑定哪家服务商,你有自己的 API 也行,想接本地模型也行。
许可证和费用
Hypit 的许可证是在 Apache 2.0 上面加了条件的,不是标准的 Apache。平时自己用,改改源码,这些都没什么障碍。但要是想拿它做多租户 SaaS 这种对外服务,官方是要求单独谈商用授权的。
快速开始
我自己装的时候就跑了一行命令:
npx skills add hypit-ai/hypit -g
装之前先看一眼 Node.js 的版本,要 22.15 以上,低了跑不起来。装完以后随便在哪个目录里跟 Agent 说话就行。比如我让它复刻一条本地视频:
/hypit 复刻这个视频:/path/to/video.mp4
手里没有参考视频也行,直接描述想要的东西:
/hypit 做一个排行榜视频,把我最近写的三个工具排个名次
第一次跑的时候,Agent 会自己检查环境,缺什么东西它会带着我们装。模型服务的 key 也是真要用到的时候才来要,不用提前准备一堆。
官方给了一些视频复刻案例,效果非常显著:

案例一

案例二

案例三
最后聊聊
聊聊它跟文生视频产品的区别。那些产品是让模型每次现想一条片子出来,Hypit 干的是另一件事,它把你手里已经验证好用的那条片子存下来,变成一个能反复用的东西,以后在上面换内容就行了,是两种赛道。当然选题和钩子这些还得人自己想,它省掉的主要是对字幕、换素材、重排时间这类重复劳动。
还有句话得说在前面,复刻别人的视频结构没什么问题,但素材版权、人物肖像这些事情得自己把关,AI 生成的内容发布的时候,记得按平台规则标清楚。