10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

VoxCPM:开源声音克隆TTS神器,0.5B 逼真的语音克隆

10月前 AI开源项目 5256 0

最近我刷开源项目时,看到面壁团队(OpenBMB)放出了一个非常炸裂的开源工具 VoxCPM:一款 无需分词器的端到端语音生成(Tokenizer-Free TTS)模型,主打两个能力:

上下文感知的自然语音生成和逼真的零样本声音克隆

VoxCPM 不仅拥有高质量和丰富表现力的声线,而且只需上传几秒的参考声音,就能实现克隆。

VoxCPM 模型参数尺寸仅有 0.5 B,非常轻量,但语音合成的效果一点儿不逊。

在自然度、音色复刻程度、韵律等方面都达到了最优的水平,极其高效、实用。

项目简介

清华大学联合面壁智能推出了一款新的语音生成模型:VoxCPM,目前已经在 GitHub 和 Hugging Face 上开源了。

VoxCPM 基于 MiniCPM-4 语言模型骨干,采用 扩散-自回归架构(Diffusion Autoregressive),直接从文字生成连续语音表示,避免了主流TTS常见的“离散分词器限制”。

性能表现

下面这个表梳理了目前主流的语音合成模型的表现,开源的和不开源的都列进去了。

基于 Seed-TTS-EVAL 权威评测榜单,可以看到 VoxCPM 在 WER% (词错误率) 、 CER% (字错误率)、SIM% (相似度) 等维度上,不管是英文还是中文都达到了最优。

也就是说这个 0.5B 的小家伙,合成语音的准确性、克隆音色的相似程度、效率三个方面取得了惊人平衡的模型。

这让它在表达力、自然度和稳定性上有了明显优势。

它的训练数据规模也很惊人:180万小时的双语语音语料。

这意味着无论是中文还是英文,都能生成自然、流畅、带有情感的语音。

核心功能

上下文感知的语音生成

VoxCPM 会根据文本内容自动调整语调、停顿和情绪。例如读新闻时是平稳的,读诗歌时带有抑扬顿挫。

零样本声音克隆

只需一小段参考音频,就能克隆出高度逼真的声音,连口音、语速和情绪细节都能复刻。

高效推理

在消费级显卡(RTX 4090)上,实时因子(RTF)能低到 0.17,支持实时合成,适合对接应用场景。

模型原理

下面是 VoxCPM 模型的架构图。

它利用一个 MiniCPM-4 作为大脑来理解文本上下文,摒弃传统的语音离散化步骤,直接在连续空间中,采用扩散自回归的生成方式。

并辅以 FSQ 等约束来实现特征解耦,从而同时实现高度表现力的语音合成和极其逼真的零样本语音克隆。

应用场景

内容创作:播客、短视频配音、自媒体解说

教育领域:个性化教学助手、语言学习语音反馈

虚拟人/游戏:角色语音生成、剧情对话动态演绎

辅助功能:帮助语言障碍者发声,提升可及性

安装与使用

VoxCPM 已经发布到 PyPI,一行命令即可安装:

pip install voxcpm

首次运行时会自动下载模型,也可以提前从 Hugging Face 拉取:

# 下载 VoxCPM-0.5B
from huggingface_hub import snapshot_download
snapshot_download("openbmb/VoxCPM-0.5B",local_files_only=local_files_only)
​
# 下载 ZipEnhancer 和 SenseVoice-Small。
from modelscope import snapshot_download
snapshot_download('iic/speech_zipenhancer_ans_multiloss_16k_base')
snapshot_download('iic/SenseVoiceSmall')

Python 调用示例

import soundfile as sf
from voxcpm import VoxCPM
​
model = VoxCPM.from_pretrained("openbmb/VoxCPM-0.5B")
​
wav = model.generate(
  text="VoxCPM is an innovative end-to-end TTS model from ModelBest, designed to generate highly expressive speech.",
  prompt_wav_path=None,     # optional: path to a prompt speech for voice cloning
  prompt_text=None,         # optional: reference text
  cfg_value=2.0,             # LM guidance on LocDiT, higher for better adherence to the prompt, but maybe worse
  inference_timesteps=10,   # LocDiT inference timesteps, higher for better result, lower for fast speed
  normalize=True,           # enable external TN tool
  denoise=True,             # enable external Denoise tool
  retry_badcase=True,       # enable retrying mode for some bad cases (unstoppable)
  retry_badcase_max_times=3, # maximum retrying times
  retry_badcase_ratio_threshold=6.0, # maximum length restriction for bad case detection (simple but effective), it could be adjusted for slow pace speech
)
​
sf.write("output.wav", wav, 16000)
print("saved: output.wav")

CLI 快速调用

# 直接生成语音
voxcpm --text "Hello world!" --output out.wav  
​
# 声音克隆
voxcpm --text "This is cloned voice." \
      --prompt-audio sample.wav \
      --prompt-text "reference transcript" \
      --output cloned.wav

在线体验

如果你不想本地折腾,可以直接在官方提供的 Demo 里试用:

Demo体验:https://huggingface.co/spaces/OpenBMB/VoxCPM-Demo

Hugging Face: https://huggingface.co/openbmb/VoxCPM-0.5B

音频样例页面地址:https://openbmb.github.io/VoxCPM-demopage

上传一段语音或直接录音,使用 VoxCPM 参考合成一段新的音频

原声:

生成效果:

相似项目推荐

如果你对语音合成和声音克隆感兴趣,还可以关注:

  • VALL-E(微软):同样主打零样本语音克隆

  • StyleTTS 2:在表达力和音色控制方面更强

  • OpenVoice(MyShell):社区应用较广,适合快速尝试

相比之下,VoxCPM 的优势是开源、轻量、中文支持更好。

总结

作为一个经常体验AI工具的产品经理,我觉得 VoxCPM 给我的最大惊喜是 自然度和易用性。 过去很多TTS听起来“像机器人”,但 VoxCPM 的输出已经接近真人;再加上零样本声音克隆,它不仅能“说话”,还能“说出你自己的声音”。

如果你想探索 AI 语音生成在内容创作、教育、甚至虚拟人领域的可能性,VoxCPM 值得一试。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:VoxCPM:开源声音克隆TTS神器,0.5B 逼真的语音克隆
#VoxCPM #语音生成模型 #TTS #语音克隆 
收藏 1
TEN Framework:几分钟就能搭建Voice Agent 的AI 语音框架,开源GitHub 热榜第一
Prompt 只是起点,AI 产品经理真正要会的是这三件事
推荐阅读
  • i-have-adhd:让 AI 闭嘴少废话的 Claude Code 开源 Skill
  • OpenClaw 30+ 真实应用场景集合:从案例看 AI 智能体如何落地
  • Agentic:首个开源MCP商业化平台,让AI工具实现按量计费
  • Nexu:将 AI Agent 接入即时通讯的开源桌面客户端
  • pi-mono:AI 智能体工具包,从 LLM 集成到智能体部署的完整工具链,包含编码代理 CLI、统一 LLM API 和 UI 库
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
11443 11月前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10344 9月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
9017 7月前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
8487 7月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
8015 11月前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
7730 10月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
7714 10月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
7623 6月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
7087 6月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
6918 3月前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 微软开源 Skill Recorder:录制操作自动生成 AI Agent SKILL.md
2 AnyDoc:Rust 文档转 Markdown 引擎,性能碾压 MarkItDown
3 scroll-world 与 img2threejs:两个炫酷的 GitHub 开源项目,让 AI 帮你做网页和 3D 模型
4 Humanizer-zh:专治中文写作 AI 味的开源 Skill,14.6k Star
5 SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
6 Cloudflare 开源企业级 Agent 工作平台 Cloudflare OS
7 human-writing:卡兹克开源活人感写作 Skill,从材料到推进消除 AI 味
8 AI复刻王虹手写PPT:从GPT Image到HTML完整方案,附开源Skill
9 wigolo:开源免费的 Agent 联网搜索工具,零成本替代 Tavily/Exa
10 GitHub 7月热门开源项目盘点:Hallmark、Orca、Strix 等 17 个值得关注的项目
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联