简单说,这三个名词,其实对应的是三种不同的技术:
| 技术 | 生活中常见说法 | |
|---|---|---|
| ai生成音乐 | AI Music Generation - AI声音合成 | SunoAI |
| ai换声 | Voice Conversation - 声音转换 | ai+真实歌手名称,比如 ai+孙燕姿 |
| ai虚拟歌手 | Voice Synthesis - 歌声合成 | 虚拟歌姬、初音未来、洛天依 |
这三种技术,恰恰代表了三个技术分支

按照这个定义,全民k歌里面的ai歌手是什么技术呢?
ai虚拟歌手:从采样到智能生成
历史最悠久的是 2004 年由日本雅马哈公司(Yamaha Corporation)开发出来的 vocaloid,
它允许用户通过输入旋律和歌词,使用虚拟歌手的声音合成工具来创作歌曲。
vocaloid 软件通过使用录制的声音样本(由专业歌手提供)来“拼接”音符。
这些声音样本会被细致地分解成不同音节、音高和节奏,以供用户根据需要进行组合和调整,从而形成连续的歌声。
用户可以调节合成声音的情感、音色和速度等,创造出自己想要的歌曲效果。
在录制声音样本(采样)的时候,一般会使用词表,早期因为只支持日文,会使用 CVVC、VCV 录音格式,后期为了支持外语,增加了许多复杂的方法。
CVVC、VCV 实际上就是元音、辅音、辅音接元音、元音接辅音的表,看起来很麻烦,我举个例子尝试解释:
我想让vocaloid说:“你好”
vocaloid会选择把一句话拆成很多很小的小声音(音素),再一个个拼起来。

假设要合成:“你好呀~”
-
文本 → 音素序列
"你好呀"→ni hao na -
查找声音库
ni→ 找到 CV 或 CVVC 的录音hao→ 找到 CV 或 CVVC 的录音na→ 找到 CV 或 CVVC 的录音
-
拼接并平滑
- 拼接
n-i+h-ao+n-a - 在每个过渡处做平滑,让声音自然连起来
- 拼接
-
调整韵律与音高
- 调整音高和长短,让它听起来像唱歌而不是平板朗读
实际上,不光是vocaloid 采用了录制词表的方式,后来的utau(2008)、synthv也不约而同在早期选择了类似的采样方法。
整个过程可以这样理解:

这个阶段的歌曲特点:稳定、可控,但声音机械、情感表达有限。
但那个阶段,也有很多人发挥自己的创意,利用机械特性,制作出带有特殊情感的作品
如果没有ai,可能就这样发展下去了,人声演唱和机械声音各站一边,井水不犯河水。
直到 2018 年后,Synthesizer V 率先引入深度神经网络,让合成歌声更自然、更有呼吸感。
- 它支持多语言演唱(Cross-Lingual Singing)
- 并可精细调节音高、颤音、力度
CeVIO AI 则在情感表达与口语演绎方面表现出色,甚至能模仿“演员式”语气。
这个时候,歌曲中的演唱更加靠近真实人声,在人声和机械声中间,插入了中间态。
ai换声:我是你,你是我
与“从零生成”不同,RVC(Retrieval-based Voice Conversion)、SVC(Singing Voice Conversion) 等技术侧重“声音变换”。
它们将用户原唱的人声特征映射为目标音色,实现“AI 换声”。
RVC 和 SVC 具体区别如下:
| 技术名词 | 简单说 | |
|---|---|---|
| RVC | 想象你有一个朋友的声音录音,你想让你的声音说话听起来像他。RVC先学习目标声音的特点(音色、说话习惯),然后把你的声音转换成那个音色 | 换说话声,保留内容 |
| SVC | 和 RVC 类似,但专门针对唱歌的声音。它会把你唱歌时的音高、节奏保留,同时把你的音色换成目标歌手的音色 | 换唱歌声,保留旋律 |
使用SVC,声音真实自然,能保留演唱细节,但仍依赖原唱输入,不具备创作能力。
也就是说,如果你想唱一首歌,首先这首歌得让其他人先唱过。
这类技术的典型用途是“cover版”,如让我以孙燕姿的声线唱我要快乐
或者拿歌手年轻时的歌声训练,这样即使老了,也可以重回年轻时的风采。
ai生成音乐:你甚至不需要“懂音乐”
2023 年后,AI 音乐生成平台 Suno AI、 Udio、 MusicGen 出现,它们实现了从文字提示(Prompt)→ 完整歌曲(伴奏 + 人声)的全流程。
用户只需输入一句话,比如说“写一首悲伤的民谣”,系统即可生成旋律、歌词、人声演唱和编曲
这一代工具不再依赖用户提供旋律或声库,而是端到端学习“音乐的规律”。
Suno 的 v4.5 版本甚至加入了 stem 分离与编辑功能,开始从“生成器”向“AI 音乐工作站”进化。
那么,当今的ai音乐怎么样了呢?
| 维度 | 优势 | 局限 |
|---|---|---|
| 创作效率 | 无需音乐知识即可作曲、作词、编曲 | 难以保证歌词、旋律、节奏逻辑性 |
| 音色与自然度 | AI 声码器让声音更接近真实人声 | 情感表达仍较单一,细节有“AI味” |
| 可控性 | Prompt 控制方便,快速产出 | 难以精细调教音高、颤音、呼吸等 |
| 版权与伦理 | 创作门槛大幅降低 | 声音模仿与数据来源存在争议 |
这些技术,我要一起用
最后,再回顾一下三种技术的区别
| 技术 | 最佳用途 | 可与谁配合 | |
|---|---|---|---|
| ai虚拟歌手 (Vocaloid / SynthV) | AI声音合成 | 精细人声制作 | 可与 AI 生成旋律(如 Suno)搭配 |
| ai换声 (RVC / SVC) | 声音转换 | 声音换色、模仿特定歌手 | 可结合真人录音或 SynthV 输出 |
| ai生成音乐 (Suno / Udio) | 歌声合成 | 快速生成完整作品 | 生成 demo → 人工再重制/混音 |
你可以用 Suno AI 生成一首歌曲初稿,然后用 SynthV 让虚拟歌手重新演唱主旋律,最后用 RVC 调整音色为目标风格。当然了,如果你连词都不想写,直接让chatgpt生成合适的词,再输入suno ai也行 拿chatgpt和suno糊了一个 deepflood主题曲
支持一下