近期起司的一篇长文中,一个三百粉左右的新号用AI剧情视频跑到了百万播放。这条视频是用他做的「qisi 视频创意改编 Skill」完成的——从分析参考视频、改编剧本,到拆资产、做分镜、生成提示词,前后不到半小时。

项目开源在 GitHub:wyuzhi/qisi-video-remix,MIT License。
一、把 AI 视频的生产链路串起来
做一条完整的AI剧情视频,通常要经过这些环节:
- 找到故事原型,提炼冲突、情绪点和反转
- 重写剧本,重新设计人物关系、场景和台词
- 建立资产表,把角色、服装、场景和关键道具统一
- 按剧情拆分镜,确定景别、视角、动作和镜头运动
- 把相邻分镜组合成适合模型生成的视频段落
- 生成图片和视频,完成拼接、字幕、配音与节奏调整
qisi Skill把前五步尽量交给Agent:输入一条参考视频,先找出它为什么能抓住人,再重新改编剧情,继续产出资产生图提示词、分镜表和分段视频提示词。
二、分镜和分段,不是一回事
很多人第一次做AI视频会把剧本拆成十几个镜头,然后每个镜头单独生成。结果往往是一个镜头只有3~5秒,做一条60秒视频要生成十几个片段。只要角色长相变了、动作没接上,就得返工。

1. 分镜服务于叙事
剧本写的是"发生了什么",分镜要解决的是"观众会看到什么"。分镜里要写清楚人物动作、景别、机位、构图和镜头运动,首先考虑故事节奏,不是模型一次能生成多少秒。
2. 分段服务于模型
分段是在分镜完成后,把若干个连续镜头装进同一个生成任务。它要同时考虑模型的时长上限、场景连续性、人物一致性和生成成本。能连在一起的镜头尽量连起来;一旦场景、时间、人物状态或剧情方向发生明显变化,就该及时切段。
核心规则:先根据剧情拆出分镜,再把相邻分镜的时长依次累加;接近视频模型的时长上限时分段。如果中途出现明显的场景变化或重大剧情转折,立即分段。

分镜的单位是"镜头",分段的单位是"生成任务"。把这两个层级分开,才有机会同时顾住叙事、连续性和成本。
三、分段还要检查什么
只记住"凑到15秒或30秒"还不够。准备每一段提示词时,至少再看四件事:

1. 场景有没有变化——从客厅切到街道、从白天跳到夜晚,最好重新开一段。
2. 人物状态能不能接上——上一镜头人物刚坐下,下一镜头却突然站在门口;上一段穿深色外套,下一段衣服变了。这类问题要在提示词里明确承接。
3. 剧情转折是否值得单独落刀——秘密揭开、关系反转、冲突升级,这些节点通常需要新的镜头节奏。
4. 一段里有没有塞太多动作——时长上限不是必须填满的指标。动作太密时,宁可缩短一点。
四、用这套 Skill 怎么走一遍
项目地址:GitHub · wyuzhi/qisi-video-remix
Codex 用户可以直接克隆到本地 Skill 目录:
git clone https://github.com/wyuzhi/qisi-video-remix.git "${CODEX_HOME:-$HOME/.codex}/skills/qisi-video-remix"
使用流程:
- 准备一条适合分析的参考视频(目前情感短篇适配效果最好)
- 把Skill安装到支持自定义Skill的Agent中,上传参考视频

把仓库地址发给Agent,要求安装Skill。

调用 $qisi-video-remix 并附上视频,让Agent先交付剧本改编稿。这里不要急着生图,先检查人物关系、冲突、转折和结尾是否成立。

确认角色与场景资产,检查分镜和分段,再按顺序生成资产图和视频。最后放进剪辑软件拼接,补字幕、配音和必要的节奏调整。
可以直接这样说:
使用 $qisi-video-remix 改编这个视频。面向刚上班的年轻人,做成30秒竖屏短片,每段最长15秒,轻松一点。直接给我剧本、角色与场景生图提示词、分镜,以及每段可以复制使用的视频提示词。

五、别把"参考爆款"做成"照搬爆款"
这类工作流最容易被误解的地方,是把"分析爆点"变成"复制内容"。真正值得保留的是结构:前几秒怎么抛冲突,信息如何递进,反转为什么成立。人物设定、具体台词、画面、音乐和标志性桥段应该重新设计,也要处理好素材授权与平台规则。
六、最后说两句
这套方法最有价值的地方,不是承诺每个人都能复制一条百万播放视频。它真正解决的是生产问题:以前我们把"一个镜头"当成"一次生成",现在多了一层分段设计。先把故事拆对,再把镜头组合对,生成次数、返工成本和画面连续性才可能一起改善。