最近发现一个刚开源的项目叫 Hypit,口号是"1 条命令,100 个变体,1 亿次播放"。
做短视频的都懂一个痛点:找到一个跑通了的视频结构(比如"三秒钩子 + 痛点引出 + 方案展示 + CTA 收尾"),但下一条视频你得重新做一遍——文案可以复制,字幕要重新对齐时间轴,B-roll 要重新找素材,转场动画要重新调参数。一个 20 秒的视频,真正动剪辑的时间可能是两小时。

Hypit 就是奔着解决这个问题来的。它是把爆款视频变成可复用的工作流——丢一个参考视频进去,AI Agent 自动拆解出完整的生产流水线,从这个流水线上你想怎么生产就怎么生产。
简单说,Hypit 是一个开源的 AI 视频克隆引擎,让 AI 编程助手(Claude Code、Codex 这类 Agent)能够看懂一条爆款视频,然后输出一份结构化的、可编辑的、可批量复制的视频工作流。目前已收获 2.4K Star。

Hypit 最底层的技术创新是 .svml 格式——可以把它理解成视频领域的 HTML。一份 .svml 文件分五层:Script(台词和角色定义)、Media Track(画面素材)、Caption(字幕层,支持词级别对齐)、Speech Track(语音合成层)、Film(画布尺寸和渲染配置)。
而且它不是静态的。你可以用 @标签 在台词里嵌入触发逻辑——比如 @[emoji_flash] 标注在某句话上,Agent 就会在那个词出现的时候自动触发 emoji 闪现动画;标注 @[product_shot] 就会在那个位置切一个产品特写。
本质上,Hypit 把视频生产从"非线性剪辑"变成了声明式编程——你不需要考虑第几秒出现什么,只需要说"这段台词出现的时候,同时出现这个画面、这段语音、这组字幕",剩下的时间对齐全部自动计算。
七大使用场景
- 爆款广告克隆:从 Meta Ad Library 抓一条跑通的广告,换你的产品,当天出 50 个 hook 变体
- 带货:一个转化好的视频格式,每天换一个 SKU,换产品名、价格、CTA,结构完全不动
- 播客/访谈剪辑:分屏布局 + 说话人感知字幕 + 反应特效,自动识别谁在说话,字幕颜色跟着变
- 多语言本地化:同一条视频,改台词就自动出十种语言版本,时间轴重新对齐,嘴型同步
- 代码渲染视频:完全不用 AI 模型,只用字幕 + 动态图形,成本 $0,速度极快
- 街头采访模板:三段式揭秘结构 + 表情追踪 + 声音同步,自动检测人脸,字幕跟着人走
- 大规模 A/B 测试:10 个开头 + 5 个 CTA = 50 个变体,批量生成快速筛选
快速上手
环境要求:Node.js 22.15+(必须 22 以上),一个 AI 编程助手(Claude Code、Cursor、Codex 等)。
安装一行命令:npx skills add hypit-ai/hypit -g。首次使用时 Agent 会检查 Hypit 可执行文件是否就绪,没有会自动准备。
方式一:给参考视频让 Agent 克隆——/hypit Clone this video: /path/to/video.mp4 或给 URL。Agent 会下载/读取视频、调用多模态模型分析结构、生成 .svml 工作流文件、渲染成片预览、给你一个可编辑的项目。
方式二:从零描述让 Agent 写工作流——/hypit Make a 20-second TikTok style video about why open source is better for AI video. Hook: "Arcads charges $220/mo. This one's $0." Agent 会自动设计结构、写台词、选画面风格、生成完整的 .svml。
写在最后
Hypit 向我们证明了一件事:视频生产,终究会像代码生产一样被工程化。它不是让你做视频的效率提升 10 倍,而是让你把已经验证过的爆款结构直接变成工厂流水线,然后成倍地复制。
GitHub:github.com/hypit-ai/hypit