Sheng Zhao
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
55
Venues
15
Active years
2002–2025
Best venue rank
A*
Where they publish
Papers
55 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | ACL | Autoregressive Speech Synthesis without Vector Quantization. | Lingwei Meng, Long Zhou, Shujie Liu, Sanyuan Chen, Bing Han, Shujie Hu, Yanqing Liu, Jinyu Li, Sheng Zhao, Xixin Wu, Helen M. Meng, Furu Wei |
| 2025 | ASRU | Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation. | Yang Cui, Peter Pan, Lei He, Sheng Zhao |
| 2025 | CHI | Raise Your Eyebrows Higher: Facilitating Emotional Communication in Social Virtual Reality Through Region-Specific Facial Expression Exaggeration. | Xueyang Wang, Sheng Zhao, Yihe Wang, Howard Ziyu Han, Xinge Liu, Xin Yi, Xin Tong, Hewu Li |
| 2025 | ICASSP | LIMMITS'25: Multilingual Streaming TTS With Neural Codecs for Indian Languages. | Philipp Olbrich, Hema A. Murthy, Pranaw Kumar, Shinji Watanabe, Sheng Zhao, Mark Hasegawa-Johnson |
| 2025 | ICASSP | ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training. | Xinfa Zhu, Lei He, Yujia Xiao, Xi Wang, Xu Tan, Sheng Zhao, Lei Xie |
| 2025 | IECON | Automated Drifting for 4WD Vehicles: Analysis, Controller and Experiment. | Sheng Zhao, Zhouhang Yu, Liang Yan, Hangyu Lu, Xiaodong Wu |
| 2025 | MICCAI | Medical-Knowledge Driven Multiple Instance Learning for Classifying Severe Abdominal Anomalies on Prenatal Ultrasound. | Huanwen Liang, Jingxian Xu, Yuanji Zhang, Yuhao Huang, Yuhan Zhang, Xin Yang, Ran Li, Xuedong Deng, Yanjun Liu, Guowei Tao, Yun Wu, Sheng Zhao, Xinru Gao, Dong Ni |
| 2025 | VR | CoordAuth: Hands-Free Two-Factor Authentication in Virtual Reality Leveraging Head-Eye Coordination. | Sheng Zhao, Junrui Zhu, Shuning Zhang, Xueyang Wang, Hongyi Li, Fang Yi, Xin Yi, Hewu Li |
| 2024 | ICLR | GAIA: Zero-shot Talking Avatar Generation. | Tianyu He, Junliang Guo, Runyi Yu, Yuchi Wang, Jialiang Zhu, Kaikai An, Leyi Li, Xu Tan, Chunyu Wang, Han Hu, HsiangTao Wu, Sheng Zhao, Jiang Bian |
| 2024 | ICLR | PromptTTS 2: Describing and Generating Voices with Text Prompt. | Yichong Leng, Zhifang Guo, Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yufei Liu, Dongchao Yang, Leying Zhang, Kaitao Song, Lei He, Xiangyang Li, Sheng Zhao, Tao Qin, Jiang Bian |
| 2024 | ICLR | NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers. | Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yichong Leng, Lei He, Tao Qin, Sheng Zhao, Jiang Bian |
| 2024 | ICML | NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models. | Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Eric Liu, Yichong Leng, Kaitao Song, Siliang Tang, Zhizheng Wu, Tao Qin, Xiangyang Li, Wei Ye, Shikun Zhang, Jiang Bian, Lei He, Jinyu Li, Sheng Zhao |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | Interspeech | An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS. | Xiaofei Wang, Sefik Emre Eskimez, Manthan Thakker, Hemin Yang, Zirun Zhu, Min Tang, Yufei Xia, Jinzhu Li, Sheng Zhao, Jinyu Li, Naoyuki Kanda |
| 2024 | Interspeech | Total-Duration-Aware Duration Modeling for Text-to-Speech Systems. | Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Chung-Hsien Tsai, Canrun Li, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Jinyu Li, Sheng Zhao, Naoyuki Kanda |
| 2023 | AAAI | VideoDubber: Machine Translation with Speech-Aware Length Control for Video Dubbing. | Yihan Wu, Junliang Guo, Xu Tan, Chen Zhang, Bohan Li, Ruihua Song, Lei He, Sheng Zhao, Arul Menezes, Jiang Bian |
| 2023 | ICASSP | Prompttts: Controllable Text-To-Speech With Text Descriptions. | Zhifang Guo, Yichong Leng, Yihan Wu, Sheng Zhao, Xu Tan |
| 2023 | ICASSP | Improving Contextual Spelling Correction by External Acoustics Attention and Semantic Aware Data Augmentation. | Xiaoqiang Wang, Yanqing Liu, Jinyu Li, Sheng Zhao |
| 2023 | ICASSP | LeanSpeech: The Microsoft Lightweight Speech Synthesis System for Limmits Challenge 2023. | Chen Zhang, Shubham Bansal, Aakash Lakhera, Jinzhu Li, Gang Wang, Sandeepkumar Satpal, Sheng Zhao, Lei He |
| 2023 | ICCV | HiFace: High-Fidelity 3D Face Reconstruction by Learning Static and Dynamic Details. | Zenghao Chai, Tianke Zhang, Tianyu He, Xu Tan, Tadas Baltrusaitis, HsiangTao Wu, Runnan Li, Sheng Zhao, Chun Yuan, Jiang Bian |
| 2023 | Interspeech | Large-Scale Automatic Audiobook Creation. | Brendan Walsh, Mark Hamilton, Greg Newby, Xi Wang, Serena Ruan, Sheng Zhao, Lei He, Shaofei Zhang, Eric Dettinger, William T. Freeman, Markus Weimer |
| 2023 | Interspeech | ContextSpeech: Expressive and Efficient Text-to-Speech for Paragraph Reading. | Yujia Xiao, Shaofei Zhang, Xi Wang, Xu Tan, Lei He, Sheng Zhao, Frank K. Soong, Tan Lee |
| 2022 | ICASSP | Infergrad: Improving Diffusion Models for Vocoder by Considering Inference in Training. | Zehua Chen, Xu Tan, Ke Wang, Shifeng Pan, Danilo P. Mandic, Lei He, Sheng Zhao |
| 2022 | ICASSP | Transformer-S2A: Robust and Efficient Speech-to-Animation. | Liyang Chen, Zhiyong Wu, Jun Ling, Runnan Li, Xu Tan, Sheng Zhao |
| 2022 | ICASSP | A Study on the Efficacy of Model Pre-Training In Developing Neural Text-to-Speech System. | Guangyan Zhang, Yichong Leng, Daxin Tan, Ying Qin, Kaitao Song, Xu Tan, Sheng Zhao, Tan Lee |
| 2022 | Interspeech | DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders. | Yanqing Liu, Ruiqing Xue, Lei He, Xu Tan, Sheng Zhao |
| 2022 | Interspeech | AdaSpeech 4: Adaptive Text to Speech in Zero-Shot Scenarios. | Yihan Wu, Xu Tan, Bohan Li, Lei He, Sheng Zhao, Ruihua Song, Tao Qin, Tie-Yan Liu |
| 2022 | Interspeech | RetrieverTTS: Modeling Decomposed Factors for Text-Based Speech Insertion. | Dacheng Yin, Chuanxin Tang, Yanqing Liu, Xiaoqiang Wang, Zhiyuan Zhao, Yucheng Zhao, Zhiwei Xiong, Sheng Zhao, Chong Luo |
| 2022 | Interspeech | Mixed-Phoneme BERT: Improving BERT with Mixed Phoneme and Sup-Phoneme Representations for Text to Speech. | Guangyan Zhang, Kaitao Song, Xu Tan, Daxin Tan, Yuzi Yan, Yanqing Liu, Gang Wang, Wei Zhou, Tao Qin, Tan Lee, Sheng Zhao |
| 2021 | ICASSP | MBNET: MOS Prediction for Synthesized Speech with Mean-Bias Network. | Yichong Leng, Xu Tan, Sheng Zhao, Frank K. Soong, Xiang-Yang Li, Tao Qin |
| 2021 | ICASSP | Lightspeech: Lightweight and Fast Text to Speech with Neural Architecture Search. | Renqian Luo, Xu Tan, Rui Wang, Tao Qin, Jinzhu Li, Sheng Zhao, Enhong Chen, Tie-Yan Liu |
| 2021 | ICASSP | Adaspeech 2: Adaptive Text to Speech with Untranscribed Data. | Yuzi Yan, Xu Tan, Bohan Li, Tao Qin, Sheng Zhao, Yuan Shen, Tie-Yan Liu |
| 2021 | ICASSP | Denoispeech: Denoising Text to Speech with Frame-Level Noise Modeling. | Chen Zhang, Yi Ren, Xu Tan, Jinglin Liu, Kejun Zhang, Tao Qin, Sheng Zhao, Tie-Yan Liu |
| 2021 | ICLR | FastSpeech 2: Fast and High-Quality End-to-End Text to Speech. | Yi Ren, Chenxu Hu, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu |
| 2021 | ICLR | AdaSpeech: Adaptive Text to Speech for Custom Voice. | Mingjian Chen, Xu Tan, Bohan Li, Yanqing Liu, Tao Qin, Sheng Zhao, Tie-Yan Liu |
| 2021 | Interspeech | A Light-Weight Contextual Spelling Correction Model for Customizing Transducer-Based Speech Recognition Systems. | Xiaoqiang Wang, Yanqing Liu, Sheng Zhao, Jinyu Li |
| 2021 | Interspeech | Adaptive Text to Speech for Spontaneous Style. | Yuzi Yan, Xu Tan, Bohan Li, Guangyan Zhang, Tao Qin, Sheng Zhao, Yuan Shen, Wei-Qiang Zhang, Tie-Yan Liu |
| 2020 | AAAI | RobuTrans: A Robust Transformer-Based Text-to-Speech Model. | Naihan Li, Yanqing Liu, Yu Wu, Shujie Liu, Sheng Zhao, Ming Liu |
| 2020 | ACL | A Study of Non-autoregressive Model for Sequence Generation. | Yi Ren, Jinglin Liu, Xu Tan, Zhou Zhao, Sheng Zhao, Tie-Yan Liu |
| 2020 | Interspeech | Semantic Mask for Transformer Based End-to-End Speech Recognition. | Chengyi Wang, Yu Wu, Yujiao Du, Jinyu Li, Shujie Liu, Liang Lu, Shuo Ren, Guoli Ye, Sheng Zhao, Ming Zhou |
| 2020 | Interspeech | MultiSpeech: Multi-Speaker Text to Speech with Transformer. | Mingjian Chen, Xu Tan, Yi Ren, Jin Xu, Hao Sun, Sheng Zhao, Tao Qin |
| 2020 | Interspeech | MoBoAligner: A Neural Alignment Model for Non-Autoregressive TTS with Monotonic Boundary Search. | Naihan Li, Shujie Liu, Yanqing Liu, Sheng Zhao, Ming Liu, Ming Zhou |
| 2020 | Interspeech | Enhancing Monotonicity for Robust Autoregressive Transformer TTS. | Xiangyu Liang, Zhiyong Wu, Runnan Li, Yanqing Liu, Sheng Zhao, Helen Meng |
| 2020 | Interspeech | Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability. | Jinyu Li, Rui Zhao, Zhong Meng, Yanqing Liu, Wenning Wei, Sarangarajan Parthasarathy, Vadim Mazalov, Zhenghao Wang, Lei He, Sheng Zhao, Yifan Gong |
| 2020 | KDD | LRSpeech: Extremely Low-Resource Speech Synthesis and Recognition. | Jin Xu, Xu Tan, Yi Ren, Tao Qin, Jian Li, Sheng Zhao, Tie-Yan Liu |
| 2019 | AAAI | Neural Speech Synthesis with Transformer Network. | Naihan Li, Shujie Liu, Yanqing Liu, Sheng Zhao, Ming Liu |
| 2019 | ASRU | Knowledge Distillation from Bert in Pre-Training and Fine-Tuning for Polyphone Disambiguation. | Hao Sun, Xu Tan, Jun-Wei Gan, Sheng Zhao, Dongxu Han, Hongzhi Liu, Tao Qin, Tie-Yan Liu |
| 2019 | ICASSP | Dilated Residual Network with Multi-head Self-attention for Speech Emotion Recognition. | Runnan Li, Zhiyong Wu, Jia Jia, Sheng Zhao, Helen Meng |
| 2019 | ICML | Almost Unsupervised Text to Speech and Automatic Speech Recognition. | Yi Ren, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu |
| 2019 | IJCAI | Towards Discriminative Representation Learning for Speech Emotion Recognition. | Runnan Li, Zhiyong Wu, Jia Jia, Yaohua Bu, Sheng Zhao, Helen Meng |
| 2019 | Interspeech | Token-Level Ensemble Distillation for Grapheme-to-Phoneme Conversion. | Hao Sun, Xu Tan, Jun-Wei Gan, Hongzhi Liu, Sheng Zhao, Tao Qin, Tie-Yan Liu |
| 2012 | Interspeech | Turning a Monolingual Speaker into Multilingual for a Mixed-language TTS. | Ji He, Yao Qian, Frank K. Soong, Sheng Zhao |
| 2012 | TrustCom | Resources Collaborative Scheduling Model Based on Trust Mechanism in Cloud. | Kun Lu, Hua Jiang, Mingchu Li, Sheng Zhao, Jianhua Ma |
| 2003 | ICASSP | Chinese prosodic phrasing with extended features. | Sheng Zhao, Jianhua Tao, DanLing Jiang |
| 2002 | Interspeech | Prosodic phrasing with inductive learning. | Sheng Zhao, Jianhua Tao, Lianhong Cai |