语音合成论文优:开源数据Hi-Fi Multi-Speaker English TTS Dataset

NVIDIA在2021年发布了一篇论文,介绍了他们为促进多说话者TTS研究而创建的高质量英语TTS数据集。该数据集基于LibriVox,包含11位说话者的300小时训练音频,着重于高信噪比和准确的文本。目前数据集尚未公开,但已详细描述了数据收集标准和质量评估。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

声明:语音合成论文优选系列主要分享论文,分享论文不做直接翻译,所写的内容主要是我对论文内容的概括和个人看法。如有转载,请标注来源。

欢迎关注微信公众号:低调奋进


Hi-Fi Multi-Speaker English TTS Dataset

本文是NVIDIA在2021.04.03更新的文章,主要为促进tts的multi-speaker的研究,对LibriVox进行处理,获取11speakers的300小时的训练语料,具体文章链接

https://arxiv.org/pdf/2104.01497.pdf

(数据还没放出来,先做个笔记吧)


内容摘要:

本文提到现有的开源TTS数据中高质量的数据很少,因此本文设计了一个新的数据集HI-Fi TTS。table 1展示了目前开源的数据集情况。为了获取高质量的音频和文本,本文制定以下的准则,较高的信噪比,而且text的必须完全正确。另外图1展示了音频质量好坏的图谱。经过一番努力获取了HI-FI tts,具体的数据情况如table2所示,其数据时长分布为图3所示。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

我叫永强

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值