10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

pdoom-video:用代码渲染 MV,Claude Opus 5.5 全程对话打造 4K 音乐视频

1小时前 AI开源项目 9 0

近两周,一首名为《I'm Upping My P(doom)》的歌曲在 X 上爆火。但真正令人震撼的不是这首歌本身,而是有人用 Claude Code 为它拍了一支完整的 MV——全程没有使用任何 AI 视频生成模型,没有 Seedance、没有 Runway、没有 Grok。

每一帧画面、每一个镜头运动、每一次歌词字幕跳动,全是用代码算出来的。

pdoom-video MV 渲染效果

这个项目叫做 pdoom-video。作者 mexicat 全程在 Claude Code 里与 Claude Opus 5.5 对话完成——从概念策划到分镜设计,从音频分析到渲染引擎,每一个场景都是写出来的,不是生成出来的。

更关键的是:浏览器里的实时预览和离线导出的 4K60 成片像素级一致。因为每一帧都是歌曲时间的确定性函数——给定时间戳 t,输出画面永远一样。这在视频创作领域几乎是一个全新的范式。

pdoom-video 是什么

简单说,这是一个用代码渲染音乐视频的完整工程。它把一首歌拆成时间、节拍、鼓点、人声 onset,然后让 18 个场景模块像精密齿轮一样咬合运转,每一帧的视觉元素都跟着歌曲的节奏精准变化。

它证明了一件事——你不需要昂贵的视频编辑器,也不需要训练数百万参数的生成模型,只要有一个好的渲染引擎、一套严谨的时间对齐工具,再加一个足够强的编码助手,就能拍出一支完整的 MV。

四大核心亮点

1. 确定性渲染:同一首歌,永远同一支视频

每一帧的所有属性——位置、颜色、旋转、缩放——都是当前播放时间 t 的函数。这意味着:

  • 浏览器里按空格键播放的实时预览,和跑命令行渲染出来的 1080p60/4K60 成片完全一致
  • 改一行代码,重跑渲染,对比结果就能精准定位改了什么
  • 18 个场景模块共享同一个时间轴,场景切换精确对齐到歌词行和节拍网格

视频渲染变得可调试、可版本控制、可重现,就像维护一个 Web 应用一样。

2. 运动模糊的自适应采样

引擎会分析每帧的运动剧烈程度:静止帧只取 12 个子帧,普通相机运动取 36 个,快速推拉摇移最多取 324 个子帧——用 tol 阈值判断,多加子帧不再改变画面时就自动停止。

3. 18 个场景 × 1 种设计系统

项目有 18 个独立场景模块(open、loss、prompt、hook、room、shoggoth……),每个场景有独特的视觉语言——雕刻版画风、示波器线条、钞票雕刻线、蓝图工程图、光线追踪 3D……但它们共享统一的设计系统:字体族、色板、胶片颗粒感和冷幽默调性。

4. 逐词甚至逐音节的歌词对齐

作者做了一套完整的音频分析 pipeline:

  • Demucs 人声分离:用 htdemucs_ft 模型把人声从伴奏中分离
  • CTC 强制对齐:得到每个词的精确起止时间
  • Whisper 交叉验证:独立跑一次 Whisper,和 CTC 结果比对
  • 节拍/onset 分析:BPM 精确到小数点后三位(132.007 BPM)

最终产出逐词甚至逐音节的时间戳。字幕不是"跟着感觉走",而是精确到帧的"什么时候亮、亮多少、灭多少"。

技术架构

整个项目分为四层:

  • Timeline(时间轴):场景切换点,对齐歌词行和节拍
  • Scenes(场景模块 ×18):每个场景独立的视觉逻辑
  • Engine(渲染引擎):时间回放、后处理、字体、GPU
  • Data(数据层):lyrics.json audio.json

渲染引擎基于 Three.js(3D/GPU 加速)和 Bun Vite(开发打包),后处理管线包括 bloom 光晕、halation 辉光和 film grain 胶片颗粒。离线渲染通过 headless Chrome 逐帧渲染,经 WebSocket 推给主进程,最后由 ffmpeg 编码为 H.264 AAC 的 MP4。

快速上手

环境要求:bun(最新版)、Google Chrome(最新版)、ffmpeg(带 libx264 编码)、uv(仅分析阶段需要)。

git clone https://github.com/mexicat/pdoom-video.git
cd pdoom-video/app
bun install
bunx vite

打开 http://localhost:5173 即可在浏览器中实时预览。按空格键播放/暂停,[ / ] 切换场景。

渲染 1080p60 成片:

bun scripts/render.ts video \
  --samples auto \
  --shutter 0.2 \
  --out ../out/pdoom.mp4

渲染 4K60 只需加上 --scale 2 参数——每一层、每一条线、每一个 shader 都按 3840×2160 渲染,不是简单放大。

设计哲学:代码即媒介

pdoom-video 最核心的理念是:把视频每一帧都变成可计算的函数。这不是"AI 生成视频",而是"代码定义视频"。

这种范式有三个巨大优势:

  • 可调试:渲染结果有问题?找到对应场景模块,改参数,重跑。不像生成式模型只能"再来一次"
  • 可版本控制:Git 里每一行代码的改动,精确对应视频里每一帧的变化
  • 可复现:同样的代码和输入,永远得到同样的输出

苏米注:这个项目最值得关注的不是"做出了 MV",而是它证明了代码可以成为一种新的视觉创作媒介——可调试、可协作、可迭代。这才是对创作流程的真正改变。

写在最后

pdoom-video 展示的不仅是一支很酷的 MV,更是一个人和 AI 协作的新范例。

过去两年,AI 辅助编程大多停留在"让代码写得更快"这个层面。但 mexicat 和 Claude Opus 5.5 的合作告诉我们:当你有清晰的设计文档、严谨的技术架构和一个真正理解你意图的编码伙伴,AI 可以是你的设计总监、音频工程师、渲染程序员——甚至帮你拍一支完整的 MV。

Github:https://github.com/mexicat/pdoom-video

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:pdoom-video:用代码渲染 MV,Claude Opus 5.5 全程对话打造 4K 音乐视频
#pdoom-video #Claude #Claude-Code #开源 #音乐视频 
收藏 1
Omnigent:用 meta-harness 统一 Codex、Claude Code 等 AI 编程 Agent
Anthropic 长文评测 GLM-5.3:网络安全能力逼近 Claude Mythos 水平
推荐阅读
  • pi-mono 详解:4 万 Star 的 AI Agent 底层框架,OpenClaw 为什么选它?
  • 从AI生图到可编辑PSD,用Codex实现的GPT-image-2图层PSD的开源方案Skill
  • AstrBot:最强AI Agent聊天机器人平台横空出世,一键打通QQ/微信/飞书,主流模型随心配!
  • Presentation AI:一款开源AI PPT工具,AI一键生成精美幻灯片!
  • Google大神开源Agent Skills:用Google工程师的工作流约束AI,9个Skills让代码偷懒无所遁形
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
12555 1年前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10784 11月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
10437 9月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
9307 1年前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
9216 9月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
8760 1年前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
8622 11月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
8162 8月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
8059 5月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
7960 8月前

文章目录

关于苏米客
分类排行
1 dlss5-visual-enhancer:开源 AI 图像视频增强工具,DLSS 5 技术用于日常影音处理
2 pdoom-video:用代码渲染 MV,Claude Opus 5.5 全程对话打造 4K 音乐视频
3 Omnigent:用 meta-harness 统一 Codex、Claude Code 等 AI 编程 Agent
4 Awesome Claude Video Skills:180个AI视频制作Skill合集
5 BrewReel 开源工具:用便宜大模型一键生成竖版宣传片
6 BeefTV 开源视频创作工作台:本地优先、AI 原生的 LibTV 平替
7 changedetection.io:34K Star的开源网页监控工具,变化即时通知
8 Paseo:统一管理所有AI Agent的开源工具,支持手机端远程操控
9 magpie:统一切换所有AI Agent模型的本机网关工具
10 半小时做出百万播放视频的Skill:qisi视频创意改编工作流
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联