Skip to content

Sheng Zhao

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

55

Venues

15

Active years

2002–2025

Best venue rank

A*

Where they publish

Papers

55 indexed papers, newest first.

YearVenueTitleAuthors
2025ACLAutoregressive Speech Synthesis without Vector Quantization.Lingwei Meng, Long Zhou, Shujie Liu, Sanyuan Chen, Bing Han, Shujie Hu, Yanqing Liu, Jinyu Li, Sheng Zhao, Xixin Wu, Helen M. Meng, Furu Wei
2025ASRUEfficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation.Yang Cui, Peter Pan, Lei He, Sheng Zhao
2025CHIRaise Your Eyebrows Higher: Facilitating Emotional Communication in Social Virtual Reality Through Region-Specific Facial Expression Exaggeration.Xueyang Wang, Sheng Zhao, Yihe Wang, Howard Ziyu Han, Xinge Liu, Xin Yi, Xin Tong, Hewu Li
2025ICASSPLIMMITS'25: Multilingual Streaming TTS With Neural Codecs for Indian Languages.Philipp Olbrich, Hema A. Murthy, Pranaw Kumar, Shinji Watanabe, Sheng Zhao, Mark Hasegawa-Johnson
2025ICASSPZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training.Xinfa Zhu, Lei He, Yujia Xiao, Xi Wang, Xu Tan, Sheng Zhao, Lei Xie
2025IECONAutomated Drifting for 4WD Vehicles: Analysis, Controller and Experiment.Sheng Zhao, Zhouhang Yu, Liang Yan, Hangyu Lu, Xiaodong Wu
2025MICCAIMedical-Knowledge Driven Multiple Instance Learning for Classifying Severe Abdominal Anomalies on Prenatal Ultrasound.Huanwen Liang, Jingxian Xu, Yuanji Zhang, Yuhao Huang, Yuhan Zhang, Xin Yang, Ran Li, Xuedong Deng, Yanjun Liu, Guowei Tao, Yun Wu, Sheng Zhao, Xinru Gao, Dong Ni
2025VRCoordAuth: Hands-Free Two-Factor Authentication in Virtual Reality Leveraging Head-Eye Coordination.Sheng Zhao, Junrui Zhu, Shuning Zhang, Xueyang Wang, Hongyi Li, Fang Yi, Xin Yi, Hewu Li
2024ICLRGAIA: Zero-shot Talking Avatar Generation.Tianyu He, Junliang Guo, Runyi Yu, Yuchi Wang, Jialiang Zhu, Kaikai An, Leyi Li, Xu Tan, Chunyu Wang, Han Hu, HsiangTao Wu, Sheng Zhao, Jiang Bian
2024ICLRPromptTTS 2: Describing and Generating Voices with Text Prompt.Yichong Leng, Zhifang Guo, Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yufei Liu, Dongchao Yang, Leying Zhang, Kaitao Song, Lei He, Xiangyang Li, Sheng Zhao, Tao Qin, Jiang Bian
2024ICLRNaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers.Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yichong Leng, Lei He, Tao Qin, Sheng Zhao, Jiang Bian
2024ICMLNaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Eric Liu, Yichong Leng, Kaitao Song, Siliang Tang, Zhizheng Wu, Tao Qin, Xiangyang Li, Wei Ye, Shikun Zhang, Jiang Bian, Lei He, Jinyu Li, Sheng Zhao
2024ICMLUniAudio: Towards Universal Audio Generation with Large Language Models.Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng
2024InterspeechAn Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS.Xiaofei Wang, Sefik Emre Eskimez, Manthan Thakker, Hemin Yang, Zirun Zhu, Min Tang, Yufei Xia, Jinzhu Li, Sheng Zhao, Jinyu Li, Naoyuki Kanda
2024InterspeechTotal-Duration-Aware Duration Modeling for Text-to-Speech Systems.Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Chung-Hsien Tsai, Canrun Li, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Jinyu Li, Sheng Zhao, Naoyuki Kanda
2023AAAIVideoDubber: Machine Translation with Speech-Aware Length Control for Video Dubbing.Yihan Wu, Junliang Guo, Xu Tan, Chen Zhang, Bohan Li, Ruihua Song, Lei He, Sheng Zhao, Arul Menezes, Jiang Bian
2023ICASSPPrompttts: Controllable Text-To-Speech With Text Descriptions.Zhifang Guo, Yichong Leng, Yihan Wu, Sheng Zhao, Xu Tan
2023ICASSPImproving Contextual Spelling Correction by External Acoustics Attention and Semantic Aware Data Augmentation.Xiaoqiang Wang, Yanqing Liu, Jinyu Li, Sheng Zhao
2023ICASSPLeanSpeech: The Microsoft Lightweight Speech Synthesis System for Limmits Challenge 2023.Chen Zhang, Shubham Bansal, Aakash Lakhera, Jinzhu Li, Gang Wang, Sandeepkumar Satpal, Sheng Zhao, Lei He
2023ICCVHiFace: High-Fidelity 3D Face Reconstruction by Learning Static and Dynamic Details.Zenghao Chai, Tianke Zhang, Tianyu He, Xu Tan, Tadas Baltrusaitis, HsiangTao Wu, Runnan Li, Sheng Zhao, Chun Yuan, Jiang Bian
2023InterspeechLarge-Scale Automatic Audiobook Creation.Brendan Walsh, Mark Hamilton, Greg Newby, Xi Wang, Serena Ruan, Sheng Zhao, Lei He, Shaofei Zhang, Eric Dettinger, William T. Freeman, Markus Weimer
2023InterspeechContextSpeech: Expressive and Efficient Text-to-Speech for Paragraph Reading.Yujia Xiao, Shaofei Zhang, Xi Wang, Xu Tan, Lei He, Sheng Zhao, Frank K. Soong, Tan Lee
2022ICASSPInfergrad: Improving Diffusion Models for Vocoder by Considering Inference in Training.Zehua Chen, Xu Tan, Ke Wang, Shifeng Pan, Danilo P. Mandic, Lei He, Sheng Zhao
2022ICASSPTransformer-S2A: Robust and Efficient Speech-to-Animation.Liyang Chen, Zhiyong Wu, Jun Ling, Runnan Li, Xu Tan, Sheng Zhao
2022ICASSPA Study on the Efficacy of Model Pre-Training In Developing Neural Text-to-Speech System.Guangyan Zhang, Yichong Leng, Daxin Tan, Ying Qin, Kaitao Song, Xu Tan, Sheng Zhao, Tan Lee
2022InterspeechDelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders.Yanqing Liu, Ruiqing Xue, Lei He, Xu Tan, Sheng Zhao
2022InterspeechAdaSpeech 4: Adaptive Text to Speech in Zero-Shot Scenarios.Yihan Wu, Xu Tan, Bohan Li, Lei He, Sheng Zhao, Ruihua Song, Tao Qin, Tie-Yan Liu
2022InterspeechRetrieverTTS: Modeling Decomposed Factors for Text-Based Speech Insertion.Dacheng Yin, Chuanxin Tang, Yanqing Liu, Xiaoqiang Wang, Zhiyuan Zhao, Yucheng Zhao, Zhiwei Xiong, Sheng Zhao, Chong Luo
2022InterspeechMixed-Phoneme BERT: Improving BERT with Mixed Phoneme and Sup-Phoneme Representations for Text to Speech.Guangyan Zhang, Kaitao Song, Xu Tan, Daxin Tan, Yuzi Yan, Yanqing Liu, Gang Wang, Wei Zhou, Tao Qin, Tan Lee, Sheng Zhao
2021ICASSPMBNET: MOS Prediction for Synthesized Speech with Mean-Bias Network.Yichong Leng, Xu Tan, Sheng Zhao, Frank K. Soong, Xiang-Yang Li, Tao Qin
2021ICASSPLightspeech: Lightweight and Fast Text to Speech with Neural Architecture Search.Renqian Luo, Xu Tan, Rui Wang, Tao Qin, Jinzhu Li, Sheng Zhao, Enhong Chen, Tie-Yan Liu
2021ICASSPAdaspeech 2: Adaptive Text to Speech with Untranscribed Data.Yuzi Yan, Xu Tan, Bohan Li, Tao Qin, Sheng Zhao, Yuan Shen, Tie-Yan Liu
2021ICASSPDenoispeech: Denoising Text to Speech with Frame-Level Noise Modeling.Chen Zhang, Yi Ren, Xu Tan, Jinglin Liu, Kejun Zhang, Tao Qin, Sheng Zhao, Tie-Yan Liu
2021ICLRFastSpeech 2: Fast and High-Quality End-to-End Text to Speech.Yi Ren, Chenxu Hu, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu
2021ICLRAdaSpeech: Adaptive Text to Speech for Custom Voice.Mingjian Chen, Xu Tan, Bohan Li, Yanqing Liu, Tao Qin, Sheng Zhao, Tie-Yan Liu
2021InterspeechA Light-Weight Contextual Spelling Correction Model for Customizing Transducer-Based Speech Recognition Systems.Xiaoqiang Wang, Yanqing Liu, Sheng Zhao, Jinyu Li
2021InterspeechAdaptive Text to Speech for Spontaneous Style.Yuzi Yan, Xu Tan, Bohan Li, Guangyan Zhang, Tao Qin, Sheng Zhao, Yuan Shen, Wei-Qiang Zhang, Tie-Yan Liu
2020AAAIRobuTrans: A Robust Transformer-Based Text-to-Speech Model.Naihan Li, Yanqing Liu, Yu Wu, Shujie Liu, Sheng Zhao, Ming Liu
2020ACLA Study of Non-autoregressive Model for Sequence Generation.Yi Ren, Jinglin Liu, Xu Tan, Zhou Zhao, Sheng Zhao, Tie-Yan Liu
2020InterspeechSemantic Mask for Transformer Based End-to-End Speech Recognition.Chengyi Wang, Yu Wu, Yujiao Du, Jinyu Li, Shujie Liu, Liang Lu, Shuo Ren, Guoli Ye, Sheng Zhao, Ming Zhou
2020InterspeechMultiSpeech: Multi-Speaker Text to Speech with Transformer.Mingjian Chen, Xu Tan, Yi Ren, Jin Xu, Hao Sun, Sheng Zhao, Tao Qin
2020InterspeechMoBoAligner: A Neural Alignment Model for Non-Autoregressive TTS with Monotonic Boundary Search.Naihan Li, Shujie Liu, Yanqing Liu, Sheng Zhao, Ming Liu, Ming Zhou
2020InterspeechEnhancing Monotonicity for Robust Autoregressive Transformer TTS.Xiangyu Liang, Zhiyong Wu, Runnan Li, Yanqing Liu, Sheng Zhao, Helen Meng
2020InterspeechDeveloping RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability.Jinyu Li, Rui Zhao, Zhong Meng, Yanqing Liu, Wenning Wei, Sarangarajan Parthasarathy, Vadim Mazalov, Zhenghao Wang, Lei He, Sheng Zhao, Yifan Gong
2020KDDLRSpeech: Extremely Low-Resource Speech Synthesis and Recognition.Jin Xu, Xu Tan, Yi Ren, Tao Qin, Jian Li, Sheng Zhao, Tie-Yan Liu
2019AAAINeural Speech Synthesis with Transformer Network.Naihan Li, Shujie Liu, Yanqing Liu, Sheng Zhao, Ming Liu
2019ASRUKnowledge Distillation from Bert in Pre-Training and Fine-Tuning for Polyphone Disambiguation.Hao Sun, Xu Tan, Jun-Wei Gan, Sheng Zhao, Dongxu Han, Hongzhi Liu, Tao Qin, Tie-Yan Liu
2019ICASSPDilated Residual Network with Multi-head Self-attention for Speech Emotion Recognition.Runnan Li, Zhiyong Wu, Jia Jia, Sheng Zhao, Helen Meng
2019ICMLAlmost Unsupervised Text to Speech and Automatic Speech Recognition.Yi Ren, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu
2019IJCAITowards Discriminative Representation Learning for Speech Emotion Recognition.Runnan Li, Zhiyong Wu, Jia Jia, Yaohua Bu, Sheng Zhao, Helen Meng
2019InterspeechToken-Level Ensemble Distillation for Grapheme-to-Phoneme Conversion.Hao Sun, Xu Tan, Jun-Wei Gan, Hongzhi Liu, Sheng Zhao, Tao Qin, Tie-Yan Liu
2012InterspeechTurning a Monolingual Speaker into Multilingual for a Mixed-language TTS.Ji He, Yao Qian, Frank K. Soong, Sheng Zhao
2012TrustComResources Collaborative Scheduling Model Based on Trust Mechanism in Cloud.Kun Lu, Hua Jiang, Mingchu Li, Sheng Zhao, Jianhua Ma
2003ICASSPChinese prosodic phrasing with extended features.Sheng Zhao, Jianhua Tao, DanLing Jiang
2002InterspeechProsodic phrasing with inductive learning.Sheng Zhao, Jianhua Tao, Lianhong Cai