diffusion-TTS : ProDiff FastDiff
迪丽瓦拉
2025-05-28 19:16:52
0次

文章目录

  • Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech
  • DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs
  • FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis
    • abstract
    • intro
    • method
  • ProDiff: Progressive Fast Diffusion Model for High-Quality Text-to-Speech
    • intro

模型RTF生成结果

Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech

  • 2021 ICML
  • 华为诺亚,莫斯科
  • code

DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs

  • Songxiang Liu, Dan Su, Dong Yu
  • 港中文/tencent AI
  • code
  • infer interactive page

FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis

  • Rongjie Huang work done in tencent AI Lab
  • demo page
  • IJCAI 2022 (2021年4月的工作)

abstract

DDPMs的模型因为迭代采样的方法,因而生成速度受限。
本为提出一种快速高质量端到端TTS生成的方法:(1)使用一系列不同感知野的time-aware location-variable conv,通过adaptive condition实现了高效的长时建模。(2) 使用noise schedule predictor,在不牺牲质量的情况下减少采样步数。
结果:在V100上实现58x实时。对unseen mel的泛化性比较好。首次工业级实时的diffusion-TTS。

intro

DDPMs方法存在的两大挑战:(1)给定optimal gradient,通过de-noise的方式生成目标,但是有可能在较多时间步以后过度降噪——对于语音上的一些气流音、声带闭合等说话特性被抹去;(2)需要数百上千的step进行生成质量优化,如果step过少,背景噪声去不干净。
DDPM的优点:可以建模多种数据分布,比如图像和时间域。

method

  • motivation
    • 问题:(1)和其他的生成模型不同,diffusion model 从带噪数据中建模,噪声的等级不同会引入更多信息变量;(2)减少迭代的时间步会明显的降低生成的质量。
    • 方案:(1) 使用time-aware location-variable conv,捕捉带噪样本的动态相关性;conv会考虑diffusion step,以及谱上的扰动,实现在反向加速过程中提高扩散模型的稳定性;(2)使用一个noise schedule predictor减少反向的时间步,

ProDiff: Progressive Fast Diffusion Model for High-Quality Text-to-Speech

  • Rongjie Huang
  • demo page
  • ACM MM 2022 (2022年9月的工作)

intro

存在的问题:(1)之前用DDPMs(Denoising diffusion probabilistic models)做TTS生成任务需要数百步才能生成高质量音频,速度很慢。难以工业应用。(2)如果减少steps,模型收敛变差,生成质量下降。
解决方法:本文提出ProDiff,progressive(逐步)diffusion model,用于高质量音频生成。之前的方式估计the gradient for data density,本文直接预测clean data,以避免在加速采样过程中造成质量损失。另外引入知识蒸馏,降低在目标域数据分布的变化。首先通过一个N-step DDIM teacher模型预测mel-spec,然后用N/2 step训练student model。如此,可以在保证生成质量的基础上,大幅减少预测速度。
取得结果:只需要2 iterations,就可以合成SOTA质量的音频。在2080 GPU上达到24x 实时。

相关内容

热门资讯

AI做攻略、“双向奔赴”……国... 本文转自:人民网人民网记者 许维娜今年国庆假期,AI(人工智能)成了不少年轻人的“旅行搭子”。行前做...
合肥的这个“梗”, 翻篇了 社交平台的评论区,曾长期流传一句专属于合肥的黑色幽默。有人问合肥哪里好玩,本地网友半开玩笑地回复:合...
7万+旅游中高层都在的群,今天... 做旅游这行,资源卡位、渠道互通、项目落地——往往就差一个“对的机会”。我们的行业社群已聚集70,00...
一场帐篷音乐节,如何让井研从“... 帐篷音乐节现场封面新闻记者 周洪攀10月的研溪湿地,晚风里裹着柑橘的清甜与民谣的回响。夜幕降临,10...
白鹤翩翩落星愿,上海迪士尼度假... 10月9日,世界候鸟日前夕,上海迪士尼度假区星愿公园的湖风里多了一分白鹤的灵动。三座白鹤雕塑正式揭幕...
成都锦江边赏初秋枫叶飘飘 目前,成都锦江边国华街枫叶树红了。近年来,国华街附近的几条街都栽种了红枫树,是城区较集中看枫叶的点位...
GBTA:商务旅行正在复苏,但... 亚太正在成为全球商务旅行增长的重要引擎。在经历疫情后的快速反弹之后,全球商务旅行正在进入一个新的增长...
从景区焕新到节赛引流 邹城双节... 齐鲁网·闪电新闻10月9日讯 中秋、国庆“双节”假期,邹城市文化和旅游局提前谋划、周密部署,立足自身...
江山如此多娇 且看石楼今朝 金秋十月,黄河岸畔秋意盎然,丰收盛会喜迎国庆。本次石楼国庆文旅活动以“江山如此多娇,且看石楼今朝”为...
海南国庆假期接待游客475.4... 2026年国庆假期,海南接待游客475.40万人次,较2025年增长13.1%,较2024年增长15...