Skip to content

ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer.

Huadai Liu, Rongjie Huang, Xuan Lin, Wenqiang Xu, Maozong Zheng, Hong Chen, Jinzheng He, Zhou Zhao

VenueA*EMNLP
Year2023
ProceedingsEMNLP

Browse the full EMNLP paper archive.