| 2025 | ASRU | SLM-S2ST: A multimodal language model for direct speech-to-speech translation. | Yuxuan Hu, Haibin Wu, Ruchao Fan, Xiaofei Wang, Heng Lu, Yao Qian, Jinyu Li |
| 2025 | ASRU | Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model. | Haibin Wu, Yuxuan Hu, Ruchao Fan, Xiaofei Wang, Ken'ichi Kumatani, Bo Ren, Jianwei Yu, Heng Lu, Lijuan Wang, Yao Qian, Jinyu Li |
| 2025 | EMNLP | Audio-Aware Large Language Models as Judges for Speaking Styles. | Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang |
| 2024 | EMNLP | i-Code Studio: A Configurable and Composable Framework for Integrative AI. | Yuwei Fang, Mahmoud Khademi, Chenguang Zhu, Ziyi Yang, Reid Pryzant, Yichong Xu, Yao Qian, Takuya Yoshioka, Lu Yuan, Michael Zeng, Xuedong Huang |
| 2024 | ICASSP | Adapting Large Language Model with Speech for Fully Formatted End-to-End Speech Recognition. | Shaoshi Ling, Yuxuan Hu, Shuangbei Qian, Guoli Ye, Yao Qian, Yifan Gong, Ed Lin, Michael Zeng |
| 2024 | NAACL | i-Code V2: An Autoregressive Generation Framework over Vision, Language, and Speech Data. | Ziyi Yang, Mahmoud Khademi, Yichong Xu, Reid Pryzant, Yuwei Fang, Chenguang Zhu, Dongdong Chen, Yao Qian, Xuemei Gao, Yi-Ling Chen, Robert Gmyr, Naoyuki Kanda, Noel Codella, Bin Xiao, Yu Shi, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang |
| 2023 | AAAI | i-Code: An Integrative and Composable Multimodal Learning Framework. | Ziyi Yang, Yuwei Fang, Chenguang Zhu, Reid Pryzant, Dongdong Chen, Yu Shi, Yichong Xu, Yao Qian, Mei Gao, Yi-Ling Chen, Liyang Lu, Yujia Xie, Robert Gmyr, Noel Codella, Naoyuki Kanda, Bin Xiao, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang |
| 2023 | ICASSP | Target Sound Extraction with Variable Cross-Modality Clues. | Chenda Li, Yao Qian, Zhuo Chen, Dongmei Wang, Takuya Yoshioka, Shujie Liu, Yanmin Qian, Michael Zeng |
| 2023 | ICASSP | DATA2VEC-SG: Improving Self-Supervised Learning Representations for Speech Generation Tasks. | Heming Wang, Yao Qian, Hemin Yang, Naoyuki Kanda, Peidong Wang, Takuya Yoshioka, Xiaofei Wang, Yiming Wang, Shujie Liu, Zhuo Chen, DeLiang Wang, Michael Zeng |
| 2023 | ICASSP | Code-Switching Text Generation and Injection in Mandarin-English ASR. | Haibin Yu, Yuxuan Hu, Yao Qian, Ma Jin, Linquan Liu, Shujie Liu, Yu Shi, Yanmin Qian, Edward Lin, Michael Zeng |
| 2023 | Interspeech | Adapting Multi-Lingual ASR Models for Handling Multiple Talkers. | Chenda Li, Yao Qian, Zhuo Chen, Naoyuki Kanda, Dongmei Wang, Takuya Yoshioka, Yanmin Qian, Michael Zeng |
| 2022 | ACL | SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing. | Junyi Ao, Rui Wang, Long Zhou, Chengyi Wang, Shuo Ren, Yu Wu, Shujie Liu, Tom Ko, Qing Li, Yu Zhang, Zhihua Wei, Yao Qian, Jinyu Li, Furu Wei |
| 2022 | ICASSP | Large-Scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification. | Zhengyang Chen, Sanyuan Chen, Yu Wu, Yao Qian, Chengyi Wang, Shujie Liu, Yanmin Qian, Michael Zeng |
| 2022 | ICASSP | Unispeech-Sat: Universal Speech Representation Learning With Speaker Aware Pre-Training. | Sanyuan Chen, Yu Wu, Chengyi Wang, Zhengyang Chen, Zhuo Chen, Shujie Liu, Jian Wu, Yao Qian, Furu Wei, Jinyu Li, Xiangzhan Yu |
| 2022 | ICASSP | Wav2vec-Switch: Contrastive Learning from Original-Noisy Speech Pairs for Robust Speech Recognition. | Yiming Wang, Jinyu Li, Heming Wang, Yao Qian, Chengyi Wang, Yu Wu |
| 2022 | ICASSP | Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction. | Heming Wang, Yao Qian, Xiaofei Wang, Yiming Wang, Chengyi Wang, Shujie Liu, Takuya Yoshioka, Jinyu Li, DeLiang Wang |
| 2022 | ICASSP | Optimizing Alignment of Speech and Language Latent Spaces for End-To-End Speech Recognition and Understanding. | Wei Wang, Shuo Ren, Yao Qian, Shujie Liu, Yu Shi, Yanmin Qian, Michael Zeng |
| 2022 | ICASSP | Improving Self-Supervised Learning for Speech Recognition with Intermediate Layer Supervision. | Chengyi Wang, Yu Wu, Sanyuan Chen, Shujie Liu, Jinyu Li, Yao Qian, Zhenglu Yang |
| 2022 | Interspeech | Pre-Training Transformer Decoder for End-to-End ASR Model with Unpaired Speech Data. | Junyi Ao, Ziqiang Zhang, Long Zhou, Shujie Liu, Haizhou Li, Tom Ko, Lirong Dai, Jinyu Li, Yao Qian, Furu Wei |
| 2021 | ICASSP | Speech-Language Pre-Training for End-to-End Spoken Language Understanding. | Yao Qian, Ximo Bian, Yu Shi, Naoyuki Kanda, Leo Shen, Zhen Xiao, Michael Zeng |
| 2021 | ICML | UniSpeech: Unified Speech Representation Learning with Labeled and Unlabeled Data. | Chengyi Wang, Yu Wu, Yao Qian, Ken'ichi Kumatani, Shujie Liu, Furu Wei, Michael Zeng, Xuedong Huang |
| 2020 | Interspeech | Discriminative Transfer Learning for Optimizing ASR and Semantic Labeling in Task-Oriented Spoken Dialog. | Yao Qian, Yu Shi, Michael Zeng |
| 2019 | ASRU | Native Language Identification from Raw Waveforms Using Deep Convolutional Neural Networks with Attentive Pooling. | Rutuja Ubale, Vikram Ramanarayanan, Yao Qian, Keelan Evanini, Chee Wee Leong, Chong Min Lee |
| 2019 | ASRU | Using Very Deep Convolutional Neural Networks to Automatically Detect Plagiarized Spoken Responses. | Xinhao Wang, Keelan Evanini, Yao Qian, Klaus Zechner |
| 2019 | ICASSP | Neural Approaches to Automated Speech Scoring of Monologue and Dialogue Responses. | Yao Qian, Patrick L. Lange, Keelan Evanini, Robert A. Pugh, Rutuja Ubale, Matthew Mulholland, Xinhao Wang |
| 2019 | ICMI | Are Humans Biased in Assessment of Video Interviews? | Chee Wee Leong, Katrina Roohr, Vikram Ramanarayanan, Michelle P. Martin-Raugh, Harrison Kell, Rutuja Ubale, Yao Qian, Zydrune Mladineo, Laura McCulla |
| 2019 | Interspeech | Automated Estimation of Oral Reading Fluency During Summer Camp e-Book Reading with MyTurnToRead. | Anastassia Loukina, Beata Beigman Klebanov, Patrick L. Lange, Yao Qian, Binod Gyawali, Nitin Madnani, Abhinav Misra, Klaus Zechner, Zuowei Wang, John Sabatini |
| 2019 | Interspeech | Automatic Detection of Off-Topic Spoken Responses Using Very Deep Convolutional Neural Networks. | Xinhao Wang, Su-Youn Yoon, Keelan Evanini, Klaus Zechner, Yao Qian |
| 2019 | SIGdial | Scoring Interactional Aspects of Human-Machine Dialog for Language Learning and Assessment using Text Features. | Vikram Ramanarayanan, Matthew Mulholland, Yao Qian |
| 2018 | ICASSP | End-to-End Neural Network Based Automated Speech Scoring. | Lei Chen, Jidong Tao, Shabnam Ghaffarzadegan, Yao Qian |
| 2018 | Interspeech | Improvements to an Automated Content Scoring System for Spoken CALL Responses: the ETS Submission to the Second Spoken CALL Shared Task. | Keelan Evanini, Matthew Mulholland, Rutuja Ubale, Yao Qian, Robert A. Pugh, Vikram Ramanarayanan, Aoife Cahill |
| 2017 | ASRU | Improving native language (L1) identifation with better VAD and TDNN trained separately on native and non-native English corpora. | Yao Qian, Keelan Evanini, Patrick L. Lange, Robert A. Pugh, Rutuja Ubale, Frank K. Soong |
| 2017 | ASRU | Exploring ASR-free end-to-end modeling to improve spoken language understanding in a cloud-based dialog system. | Yao Qian, Rutuja Ubale, Vikram Ramanarayanan, Patrick L. Lange, David Suendermann-Oeft, Keelan Evanini, Eugene Tsuprun |
| 2017 | Interspeech | Bidirectional LSTM-RNN for Improving Automated Assessment of Non-Native Children's Speech. | Yao Qian, Keelan Evanini, Xinhao Wang, Chong Min Lee, Matthew Mulholland |
| 2017 | Interspeech | Improving Sub-Phone Modeling for Better Native Language Identification with Non-Native English Speech. | Yao Qian, Keelan Evanini, Xinhao Wang, David Suendermann-Oeft, Robert A. Pugh, Patrick L. Lange, Hillary R. Molloy, Frank K. Soong |
| 2016 | ICASSP | Unsupervised speaker adaptation for DNN-based TTS synthesis. | Yuchen Fan, Yao Qian, Frank K. Soong, Lei He |
| 2016 | ICASSP | Speaker and language factorization in DNN-based TTS synthesis. | Yuchen Fan, Yao Qian, Frank K. Soong, Lei He |
| 2016 | ICASSP | A comparison of ASR and human errors for transcription of non-native spontaneous speech. | Matthew Mulholland, Melissa Lopez, Keelan Evanini, Anastassia Loukina, Yao Qian |
| 2016 | Interspeech | Noise and Metadata Sensitive Bottleneck Features for Improving Speaker Recognition with Non-Native Speech Input. | Yao Qian, Jidong Tao, David Suendermann-Oeft, Keelan Evanini, Alexei V. Ivanov, Vikram Ramanarayanan |
| 2016 | Interspeech | Self-Adaptive DNN for Improving Spoken Language Proficiency Assessment. | Yao Qian, Xinhao Wang, Keelan Evanini, David Suendermann-Oeft |
| 2016 | NAACL | Learning Distributed Word Representations For Bidirectional LSTM Recurrent Neural Network. | Peilu Wang, Yao Qian, Frank K. Soong, Lei He, Hai Zhao |
| 2015 | ASRU | Using bidirectional lstm recurrent neural networks to learn high-level abstractions of sequential features for automated scoring of non-native spontaneous speech. | Zhou Yu, Vikram Ramanarayanan, David Suendermann-Oeft, Xinhao Wang, Klaus Zechner, Lei Chen, Jidong Tao, Aliaksei Ivanou, Yao Qian |
| 2015 | ICASSP | Multi-speaker modeling and speaker adaptation for DNN-based TTS synthesis. | Yuchen Fan, Yao Qian, Frank K. Soong, Lei He |
| 2015 | ICASSP | Word embedding for recurrent neural network based TTS synthesis. | Peilu Wang, Yao Qian, Frank K. Soong, Lei He, Hai Zhao |
| 2015 | Interspeech | Sequence generation error (SGE) minimization based deep neural networks training for text-to-speech synthesis. | Yuchen Fan, Yao Qian, Frank K. Soong, Lei He |
| 2014 | ICASSP | A DNN-based acoustic modeling of tonal language and its application to Mandarin pronunciation training. | Wenping Hu, Yao Qian, Frank K. Soong |
| 2014 | ICASSP | On the training aspects of Deep Neural Network (DNN) for parametric TTS synthesis. | Yao Qian, Yuchen Fan, Wenping Hu, Frank K. Soong |
| 2014 | Interspeech | TTS synthesis with bidirectional LSTM based recurrent neural networks. | Yuchen Fan, Yao Qian, Feng-Long Xie, Frank K. Soong |
| 2014 | Interspeech | Sequence error (SE) minimization training of neural network for voice conversion. | Feng-Long Xie, Yao Qian, Yuchen Fan, Frank K. Soong, Haifeng Li |
| 2014 | Interspeech | Modeling DCT parameterized F0 trajectory at intonation phrase level with DNN or decision tree. | Xiang Yin, Ming Lei, Yao Qian, Frank K. Soong, Lei He, Zhen-Hua Ling, Li-Rong Dai |
| 2013 | ICASSP | A fast table lookup based, statistical model driven non-uniform unit selection TTS. | Yao Qian, Frank K. Soong, Xiaobo Zhou, Yundi Qian, Xiaotian Zhang |
| 2013 | Interspeech | A new DNN-based high quality pronunciation evaluation for computer-aided language learning (CALL). | Wenping Hu, Yao Qian, Frank K. Soong |
| 2012 | Interspeech | Turning a Monolingual Speaker into Multilingual for a Mixed-language TTS. | Ji He, Yao Qian, Frank K. Soong, Sheng Zhao |
| 2011 | ICASSP | Improved F0 modeling and generation in voice conversion. | Aki Kunikoshi, Yao Qian, Frank K. Soong, Nobuaki Minematsu |
| 2011 | ICASSP | A frame mapping based HMM approach to cross-lingual voice transformation. | Yao Qian, Ji Xu, Frank K. Soong |
| 2011 | Interspeech | A New Phonetic Candidate Generator for Improving Search Query Efficiency. | Bo Peng, Yao Qian, Frank K. Soong, Bo Zhang |
| 2010 | ICASSP | RIch-context Unit Selection (RUS) approach to high quality TTS. | Zhi-Jie Yan, Yao Qian, Frank K. Soong |
| 2010 | ICASSP | Improved modeling for F0 generation and V/U decision in HMM-based TTS. | Qingqing Zhang, Frank K. Soong, Yao Qian, Zhijie Yan, Jielin Pan, Yonghong Yan |
| 2010 | Interspeech | An HMM trajectory tiling (HTT) approach to high quality TTS. | Yao Qian, Zhi-Jie Yan, Yi-Jian Wu, Frank K. Soong, Xin Zhuang, Shengyi Kong |
| 2010 | Interspeech | Formant-based frequency warping for improving speaker adaptation in HMM TTS. | Xin Zhuang, Yao Qian, Frank K. Soong, Yi-Jian Wu, Bo Zhang |
| 2009 | ICASSP | State mapping for cross-language speaker adaptation in TTS. | Yining Chen, Yang Jiao, Yao Qian, Frank K. Soong |
| 2009 | ICASSP | Improved prosody generation by maximizing joint likelihood of state and longer units. | Yao Qian, Zhizheng Wu, Frank K. Soong |
| 2009 | Interspeech | A minimum v/u error approach to F0 generation in HMM-based TTS. | Yao Qian, Frank K. Soong, Miaomiao Wang, Zhizheng Wu |
| 2009 | Interspeech | Rich context modeling for high quality HMM-based TTS. | Zhi-Jie Yan, Yao Qian, Frank K. Soong |
| 2008 | ICASSP | A cross-language state mapping approach to bilingual (Mandarin-English) TTS. | Hui Liang, Yao Qian, Frank K. Soong, Gongshen Liu |
| 2008 | Interspeech | Duration refinement by jointly optimizing state and longer unit likelihood. | Boyang Gao, Yao Qian, Zhizheng Wu, Frank K. Soong |
| 2008 | Interspeech | Generating natural F0 trajectory with additive trees. | Yao Qian, Hui Liang, Frank K. Soong |
| 2008 | Interspeech | A real-time text to audio-visual speech synthesis system. | Lijuan Wang, Xiaojun Qian, Lei Ma, Yao Qian, Yining Chen, Frank K. Soong |
| 2008 | Interspeech | Prosody for Mandarin speech recognition: a comparative study of read and spontaneous speech. | Yu Ting Yeung, Yao Qian, Tan Lee, Frank K. Soong |
| 2007 | Interspeech | Robust F0 modeling for Mandarin speech recognition in noise. | Sheng Qiang, Yao Qian, Frank K. Soong, Congfu Xu |
| 2006 | ICASSP | Tone-Enhanced Generalized Character Posterior Probability (GCPP) for Cantonese LVCSR. | Yao Qian, Frank K. Soong, Tan Lee |
| 2006 | Interspeech | A multi-space distribution (MSD) approach to speech recognition of tonal languages. | Huanliang Wang, Yao Qian, Frank K. Soong, Jian-Lai Zhou, Jiqing Han |
| 2004 | Interspeech | Tone information as a confidence measure for improving Cantonese LVCSR. | Yao Qian, Tan Lee, Frank K. Soong |
| 2003 | Interspeech | Overlapped di-tone modeling for tone recognition in continuous Cantonese speech. | Yao Qian, Tan Lee, Yujia Li |
| 2002 | ICASSP | Assigning phrase accent to Chinese Text-to-Speech system. | Yao Qian, Fang Chen |
| 2001 | ICASSP | Segmenting unrestricted Chinese text into prosodic words instead of lexical words. | Yao Qian, Min Chu, Hu Peng |