文字转语音方面,elevenlabs的自然度最高,能复刻真人音色,还支持多语言。缺点是按字符收费比较贵。国内的讯飞和字节豆包免费额度大,但英文发音差点意思
音乐生成领域,suno和udio打得火热。suno生成速度快,两分钟就能出一首完整的歌,编曲还挺专业。udio音质更细腻,特别是人声部分处理得好。两个都有版权争议,商用要谨慎
声音克隆类的工具,rvc用的人最多,开源免费。不过需要一定技术基础,还得准备训练数据。商业化的产品像resemble.ai体验更好,但价格不便宜。
实际应用场景上,做短视频配音用elevenlabs或豆包就够了。搞背景音乐可以试试suno,毕竟成本低。如果要做播客或者有声书这种长内容,还是找真人录比较靠谱,AI连读长文本容易出现情感不连贯的问题
标记
mark