声明:工作以来主要从事TTS工作,平时看些文章做些笔记。文章中难免存在错误的地方,还望大家海涵。平时搜集一些资料,方便查阅学习:TTS 论文列表 http://yqli.tech/page/tts_paper.html TTS 开源数据 http://yqli.tech/page/data.html。如转载,请标明出处。欢迎关注微信公众号:低调奋进
(本来想写完整后再发出,大家可以根据选取的文章先看个大概,等闲下来后再详细写。我接下来一个月可能碰到一些事情,更新也将会断断续续,望谅解)
此处的韵律跟前端韵律不同,前端的韵律是从语言学的角度来定义停顿时长,是表现目标,对于所有说话人都是一样。本文所讲的韵律是从声学特征学习的具体表现形式,其内容可包含情感,语速,语音质量等级等等信息,主要使合成的语音更加自然,富有情感,对于每位说话人都是不同。文章按照韵律调整的粒度分为两类:粗粒度和细粒度。粗粒度为句子级别的迁移调控,细粒度为phrase,word,phone的调控。接下来将讲解如下几篇文章:
粗粒度:
1)Towards end-to-end prosody transfer for expressive speech synthesis with tacotron (2018)
https://arxiv.org/pdf/1803.09047.pdf
2)Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis (2018)
https://arxiv.org/pdf/1803.09017.pdf
细粒度:
3)ROBUST AND FINE-GRAINED PROSODY CONTROL OF END-TO-END SPEECH SYNTHESIS (2019)
ht