现在用的视频剪辑软件越来越依赖云服务——自动字幕要上传音频,AI 配音要联网,抠像也经常要把素材先传出去。看到一个思路完全相反的开源项目 Concat,21 天下载量破万,GitHub 已获 2700+ Star。它把剪辑器直接做成了本地桌面应用,自动字幕、文字转语音和人物抠像都可以在本机上运行。

Concat 先是一款完整的视频编辑器,然后才把 AI 功能塞进剪辑流程里。打开后就是普通的素材区、预览区和多轨时间线。视频可以切割、裁剪、拼接、变速,并且还可以添加转场、标题和关键帧。

AI 功能本地运行
口播视频生成字幕
把视频放入时间轴后就可以调用本地字幕模型来识别语音。模型第一次用的时候需要下载,官方提供的字幕模型大小在 78MB 到 488MB 之间,之后可以离线运行。这对课程录屏、产品介绍、知识类视频很实用——剪完以后直接识别,不需要再把视频扔到另一个字幕网站。

文字生成配音
Concat 集成了本地 Text-to-Speech。文字生成语音后,可以放到时间轴中进行调整。语音模型也是下载一次后本地使用。如果只是做教程旁白、演示视频或简单解说,这套流程能省掉来回导文件的步骤。


本地抠图
人物抠像模型约 15MB,物体抠像模型约 179MB,抠图笔刷模型约 40MB。更看重它把模型直接接进了剪辑器,字幕、配音和抠像都能直接在剪辑流程里完成——素材、时间轴、字幕、配音、抠像在一个软件中完成,操作链很短。

声音处理
项目还提供了 Voice Filters,可以对声音进行清理或变化处理。

多条时间线,一个项目
一个项目可以创建多个时间轴。做长视频、短版、横版和竖版的时候,不需要每次都创建新工程。这个功能很容易被 AI 功能抢走注意力,但在实际剪辑项目中很省事。

限制与安装
Concat 目前还是 0.2.x Beta。导出主要是 H.264 MP4,关键帧已支持位置、缩放、旋转和透明度,但还没有曲线编辑器。模板和特效数量也比 CapCut 少很多,更适合想尝鲜开源本地剪辑的人。
Windows、macOS、Linux 和 Android 都有现成构建,iOS/iPadOS 版本处于待测试状态。Windows 和 Linux 支持便携模式。
官方推荐 6 核以上 CPU,做 4K 时间线或使用较大字幕模型时,16GB 内存更合适。