天池赛——AIGC语音换音算法竞赛

比赛的链接:https://tianchi.aliyun.com/competition/entrance/532393

课程baseline路径:https://www.datawhale.cn/activity/361/learn/205/4500
简单分析一下baseline的代码
请添加图片描述
原baseline中,datawhale教研团队为我们提供了实用f5-tts进行语音生成的代码, 其中用到的模型是F5TTS_v1_base模型

经过课程群里面@小仿 老师的指点,我试着check了一下index-tts模型, index-tts是由bilibili提出的一个SOTA语音生成大模型, 并且在中文语音生成领域有着很显著的优势.
然后根据index-tts的官方github链接:github.com/index-tts/index-tts
index-tts有两个模型, 分别是IndexTTS和IndexTTS-1.5, 根据官方的测试结果来看, IndexTTS模型用官方的模型,在中文上的生成效果比较好
因此, 我这里也使用官方提供的checkpoint来做生成任务, 生成的效果还不错
以下是我用到的script脚本
请添加图片描述
我这里的问题是, 我是实用的cli去进行生成的, 可能生成的速度比较慢, 可以按照小仿老师的思路, 扒一下index-tts的类初始化方式, 做一次初始化, 剩下只用于推理, 速度就会大大提高.
指的一提的是, 我上面提到了一些err_idx, 这部分用index-tts生成会有error, 是因为index-tts对于这些长文本不支持, 需要用ffmpeg进行截断, 我这里图省事直接用示例语音了, 结果也还不错, 可以获得79分的成绩请添加图片描述
github instruction
在这里插入图片描述
在这里插入图片描述

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐