0.5B 的“小钢炮”:VoxCPM 介绍与横评

署名:电动面包

想做声音克隆,但不想在一堆模型里迷路?最近面壁智能把 VoxCPM 开源了:一个免分词的 TTS / 声音克隆模型,主打中英双语、几秒参考音频就能克隆、还能流式合成。代码和权重都放出来了,装个包就能跑。(GitHub)

它厉害在哪:

  • 免分词直出语音:不是把语音先切成离散 token 再拼回去,而是直接在连续空间里生成;底座是 MiniCPM-4 的 0.5B 版本。(GitHub)
  • 真·零样本克隆:丢一段短参考音频就能复刻音色、口音、情绪与节奏。(GitHub)
  • 跑得快:流式合成在消费级 4090 上能做到 RTF≈0.17,做实时应用不心虚。(GitHub)
  • 开源宽松:代码和权重 Apache-2.0。(Hugging Face)

怎么用(超短版):pip install voxcpm 装好,命令行或 Python API 直接用;仓库里还带了一个简单的 Web Demo。(GitHub)


跟主流开源声音克隆怎么比?

  • Coqui XTTS-v2(经典老牌):
    6 秒参考就能跨语言克隆,官方列了 16 种语言;社区成熟、生态多。注意许可是 Coqui Public Model License(非 Apache/MIT)。适合要多语、要稳的场景。(Hugging Face)

  • OpenVoice(MyShell/MIT 合作):
    MIT 许可(可商用),V2 原生支持中英日韩西法,风格参数(情绪/停顿/节奏)可控,跨语种零样本也行。上手门槛低,落地产品多。(GitHub)

  • CosyVoice 2.x(FunAudioLLM/阿里系开源):
    多语 + 方言,跨语种零样本与混合语码,还支持双向流式,首包延迟最低可到 ≈150ms;Apache-2.0。对中文场景和实时性很友好。(GitHub)

  • Fish-Speech → OpenAudio-S1:
    品质高,提供情感与风格控制;代码 Apache-2.0,但权重 CC-BY-NC-SA(非商用),要做商业请看清许可。(GitHub)

  • GPT-SoVITS(中文圈热度王):
    5 秒零样本可用,1 分钟微调相似度更像,支持中/英/日/韩/粤等跨语合成;社区工具链极多,更新勤。许可与整合包要按发行版查看。(GitHub)

一眼结论:

  • 你要**“小而精 + 中英双语 + 速度在线 + 宽松许可”**:选 VoxCPM。(GitHub)
  • 你要多语言覆盖(十几种以上):选 XTTS-v2。(Hugging Face)
  • 你要风格可控 + 可商用且跨语种:选 OpenVoice。(GitHub)
  • 你要中文/方言 + 低延迟流式:选 CosyVoice 2.x。(GitHub)
  • 你要极强社区与微调生态:选 GPT-SoVITS(注意不同发行版的许可)。(GitHub)

VoxCPM 的三点落地提醒

  1. 硬件:4090 能“超实时”;更小显卡/CPU 也能跑,但速度取决于你的设备。(GitHub)
  2. 依赖下载:官方 Demo 里会用到 ModelScope 的 ZipEnhancer 和 SenseVoice-Small,首跑可能会连 ModelScope 拉模型,这属于正常行为。(GitHub)
  3. 模型来源:GitHub/Hugging Face/ModelScope 都同步,国内访问友好。(GitHub)

快速入口

GitHub:OpenBMB/VoxCPM
Hugging Face:openbmb/VoxCPM-0.5B
ModelScope:OpenBMB/VoxCPM-0.5B

(上面三处均含代码、权重与在线体验/示例。)(GitHub)

—— 电动面包

语音克隆模型VoxCPM是面壁智能开源项目,核心地址如下: GitHub源码库:github.com/OpenBMB/VoxCPM Hugging Face模型页:huggingface.co/openbmb/VoxCPM-0.5B 国内镜像站:modelscope.cn/models/OpenBMB/VoxCPM-0.5B 模型支持中英双语,0.5B参数规模,家用电脑就能跑。这几个链接包含了代码、模型权重和在线演示入口,可以直接访问使用。