DeepFloodbeta

ai生成音乐、ai换声、ai虚拟歌手傻傻分不清?一篇文章为你尝试说明

简单说,这三个名词,其实对应的是三种不同的技术:

技术 生活中常见说法
ai生成音乐 AI Music Generation - AI声音合成 SunoAI
ai换声 Voice Conversation - 声音转换 ai+真实歌手名称,比如 ai+孙燕姿
ai虚拟歌手 Voice Synthesis - 歌声合成 虚拟歌姬、初音未来、洛天依

这三种技术,恰恰代表了三个技术分支

DY9FKJQ7s0P3F5kMLA8nndHxRR6czr45.webp

按照这个定义,全民k歌里面的ai歌手是什么技术呢?

ai虚拟歌手:从采样到智能生成

历史最悠久的是 2004 年由日本雅马哈公司(Yamaha Corporation)开发出来的 vocaloid,
它允许用户通过输入旋律和歌词,使用虚拟歌手的声音合成工具来创作歌曲。

vocaloid 软件通过使用录制的声音样本(由专业歌手提供)来“拼接”音符。
这些声音样本会被细致地分解成不同音节、音高和节奏,以供用户根据需要进行组合和调整,从而形成连续的歌声。
用户可以调节合成声音的情感、音色和速度等,创造出自己想要的歌曲效果。

在录制声音样本(采样)的时候,一般会使用词表,早期因为只支持日文,会使用 CVVC、VCV 录音格式,后期为了支持外语,增加了许多复杂的方法。
CVVC、VCV 实际上就是元音、辅音、辅音接元音、元音接辅音的表,看起来很麻烦,我举个例子尝试解释:

我想让vocaloid说:“你好”

vocaloid会选择把一句话拆成很多很小的小声音(音素),再一个个拼起来。

N2KOxzzVlftWzn1aBlSjh8fptLZw0YDj.webp

假设要合成:“你好呀~”

  1. 文本 → 音素序列
    "你好呀"ni hao na

  2. 查找声音库

    • ni → 找到 CV 或 CVVC 的录音
    • hao → 找到 CV 或 CVVC 的录音
    • na → 找到 CV 或 CVVC 的录音
  3. 拼接并平滑

    • 拼接 n-i + h-ao + n-a
    • 在每个过渡处做平滑,让声音自然连起来
  4. 调整韵律与音高

    • 调整音高和长短,让它听起来像唱歌而不是平板朗读

实际上,不光是vocaloid 采用了录制词表的方式,后来的utau(2008)、synthv也不约而同在早期选择了类似的采样方法。

整个过程可以这样理解:

oBm3OFOEZFgBUsUKtYDVJb6p1n91Jo6r.webp

这个阶段的歌曲特点:稳定、可控,但声音机械、情感表达有限。

但那个阶段,也有很多人发挥自己的创意,利用机械特性,制作出带有特殊情感的作品

如果没有ai,可能就这样发展下去了,人声演唱和机械声音各站一边,井水不犯河水。

直到 2018 年后,Synthesizer V 率先引入深度神经网络,让合成歌声更自然、更有呼吸感。

  • 它支持多语言演唱(Cross-Lingual Singing)
  • 并可精细调节音高、颤音、力度

CeVIO AI 则在情感表达与口语演绎方面表现出色,甚至能模仿“演员式”语气。

这个时候,歌曲中的演唱更加靠近真实人声,在人声和机械声中间,插入了中间态。

ai换声:我是你,你是我

与“从零生成”不同,RVC(Retrieval-based Voice Conversion)SVC(Singing Voice Conversion) 等技术侧重“声音变换”。
它们将用户原唱的人声特征映射为目标音色,实现“AI 换声”。

RVC 和 SVC 具体区别如下:

技术名词 简单说
RVC 想象你有一个朋友的声音录音,你想让你的声音说话听起来像他。RVC先学习目标声音的特点(音色、说话习惯),然后把你的声音转换成那个音色 换说话声,保留内容
SVC 和 RVC 类似,但专门针对唱歌的声音。它会把你唱歌时的音高、节奏保留,同时把你的音色换成目标歌手的音色 换唱歌声,保留旋律

使用SVC,声音真实自然,能保留演唱细节,但仍依赖原唱输入,不具备创作能力。
也就是说,如果你想唱一首歌,首先这首歌得让其他人先唱过。

这类技术的典型用途是“cover版”,如让我以孙燕姿的声线唱我要快乐
或者拿歌手年轻时的歌声训练,这样即使老了,也可以重回年轻时的风采。

ai生成音乐:你甚至不需要“懂音乐”

2023 年后,AI 音乐生成平台 Suno AI、 Udio、 MusicGen 出现,它们实现了从文字提示(Prompt)→ 完整歌曲(伴奏 + 人声)的全流程。
用户只需输入一句话,比如说“写一首悲伤的民谣”,系统即可生成旋律、歌词、人声演唱和编曲

这一代工具不再依赖用户提供旋律或声库,而是端到端学习“音乐的规律”
Suno 的 v4.5 版本甚至加入了 stem 分离与编辑功能,开始从“生成器”向“AI 音乐工作站”进化。

那么,当今的ai音乐怎么样了呢?

维度 优势 局限
创作效率 无需音乐知识即可作曲、作词、编曲 难以保证歌词、旋律、节奏逻辑性
音色与自然度 AI 声码器让声音更接近真实人声 情感表达仍较单一,细节有“AI味”
可控性 Prompt 控制方便,快速产出 难以精细调教音高、颤音、呼吸等
版权与伦理 创作门槛大幅降低 声音模仿与数据来源存在争议

这些技术,我要一起用

最后,再回顾一下三种技术的区别

技术 最佳用途 可与谁配合
ai虚拟歌手 (Vocaloid / SynthV) AI声音合成 精细人声制作 可与 AI 生成旋律(如 Suno)搭配
ai换声 (RVC / SVC) 声音转换 声音换色、模仿特定歌手 可结合真人录音或 SynthV 输出
ai生成音乐 (Suno / Udio) 歌声合成 快速生成完整作品 生成 demo → 人工再重制/混音

你可以用 Suno AI 生成一首歌曲初稿,然后用 SynthV 让虚拟歌手重新演唱主旋律,最后用 RVC 调整音色为目标风格。当然了,如果你连词都不想写,直接让chatgpt生成合适的词,再输入suno ai也行 拿chatgpt和suno糊了一个 deepflood主题曲

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

📈用户数目📈

目前论坛共有13151位用户

🎉欢迎新用户🎉