0.5B 的“小钢炮”:VoxCPM 介绍与横评
署名:电动面包
想做声音克隆,但不想在一堆模型里迷路?最近面壁智能把 VoxCPM 开源了:一个免分词的 TTS / 声音克隆模型,主打中英双语、几秒参考音频就能克隆、还能流式合成。代码和权重都放出来了,装个包就能跑。(GitHub)
它厉害在哪:
- 免分词直出语音:不是把语音先切成离散 token 再拼回去,而是直接在连续空间里生成;底座是 MiniCPM-4 的 0.5B 版本。(GitHub)
- 真·零样本克隆:丢一段短参考音频就能复刻音色、口音、情绪与节奏。(GitHub)
- 跑得快:流式合成在消费级 4090 上能做到 RTF≈0.17,做实时应用不心虚。(GitHub)
- 开源宽松:代码和权重 Apache-2.0。(Hugging Face)
怎么用(超短版):pip install voxcpm 装好,命令行或 Python API 直接用;仓库里还带了一个简单的 Web Demo。(GitHub)
跟主流开源声音克隆怎么比?
-
Coqui XTTS-v2(经典老牌):
6 秒参考就能跨语言克隆,官方列了 16 种语言;社区成熟、生态多。注意许可是 Coqui Public Model License(非 Apache/MIT)。适合要多语、要稳的场景。(Hugging Face) -
OpenVoice(MyShell/MIT 合作):
MIT 许可(可商用),V2 原生支持中英日韩西法,风格参数(情绪/停顿/节奏)可控,跨语种零样本也行。上手门槛低,落地产品多。(GitHub) -
CosyVoice 2.x(FunAudioLLM/阿里系开源):
多语 + 方言,跨语种零样本与混合语码,还支持双向流式,首包延迟最低可到 ≈150ms;Apache-2.0。对中文场景和实时性很友好。(GitHub) -
Fish-Speech → OpenAudio-S1:
品质高,提供情感与风格控制;代码 Apache-2.0,但权重 CC-BY-NC-SA(非商用),要做商业请看清许可。(GitHub) -
GPT-SoVITS(中文圈热度王):
5 秒零样本可用,1 分钟微调相似度更像,支持中/英/日/韩/粤等跨语合成;社区工具链极多,更新勤。许可与整合包要按发行版查看。(GitHub)
一眼结论:
- 你要**“小而精 + 中英双语 + 速度在线 + 宽松许可”**:选 VoxCPM。(GitHub)
- 你要多语言覆盖(十几种以上):选 XTTS-v2。(Hugging Face)
- 你要风格可控 + 可商用且跨语种:选 OpenVoice。(GitHub)
- 你要中文/方言 + 低延迟流式:选 CosyVoice 2.x。(GitHub)
- 你要极强社区与微调生态:选 GPT-SoVITS(注意不同发行版的许可)。(GitHub)
VoxCPM 的三点落地提醒
- 硬件:4090 能“超实时”;更小显卡/CPU 也能跑,但速度取决于你的设备。(GitHub)
- 依赖下载:官方 Demo 里会用到 ModelScope 的 ZipEnhancer 和 SenseVoice-Small,首跑可能会连 ModelScope 拉模型,这属于正常行为。(GitHub)
- 模型来源:GitHub/Hugging Face/ModelScope 都同步,国内访问友好。(GitHub)
快速入口
GitHub:OpenBMB/VoxCPM
Hugging Face:openbmb/VoxCPM-0.5B
ModelScope:OpenBMB/VoxCPM-0.5B
(上面三处均含代码、权重与在线体验/示例。)(GitHub)
—— 电动面包
语音克隆模型VoxCPM是面壁智能开源项目,核心地址如下: GitHub源码库:github.com/OpenBMB/VoxCPM Hugging Face模型页:huggingface.co/openbmb/VoxCPM-0.5B 国内镜像站:modelscope.cn/models/OpenBMB/VoxCPM-0.5B 模型支持中英双语,0.5B参数规模,家用电脑就能跑。这几个链接包含了代码、模型权重和在线演示入口,可以直接访问使用。