Skip to content

Yao Qian

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

76

Venues

10

Active years

2001–2025

Best venue rank

A*

Where they publish

Papers

76 indexed papers, newest first.

YearVenueTitleAuthors
2025ASRUSLM-S2ST: A multimodal language model for direct speech-to-speech translation.Yuxuan Hu, Haibin Wu, Ruchao Fan, Xiaofei Wang, Heng Lu, Yao Qian, Jinyu Li
2025ASRUTowards Efficient Speech-Text Jointly Decoding within One Speech Language Model.Haibin Wu, Yuxuan Hu, Ruchao Fan, Xiaofei Wang, Ken'ichi Kumatani, Bo Ren, Jianwei Yu, Heng Lu, Lijuan Wang, Yao Qian, Jinyu Li
2025EMNLPAudio-Aware Large Language Models as Judges for Speaking Styles.Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang
2024EMNLPi-Code Studio: A Configurable and Composable Framework for Integrative AI.Yuwei Fang, Mahmoud Khademi, Chenguang Zhu, Ziyi Yang, Reid Pryzant, Yichong Xu, Yao Qian, Takuya Yoshioka, Lu Yuan, Michael Zeng, Xuedong Huang
2024ICASSPAdapting Large Language Model with Speech for Fully Formatted End-to-End Speech Recognition.Shaoshi Ling, Yuxuan Hu, Shuangbei Qian, Guoli Ye, Yao Qian, Yifan Gong, Ed Lin, Michael Zeng
2024NAACLi-Code V2: An Autoregressive Generation Framework over Vision, Language, and Speech Data.Ziyi Yang, Mahmoud Khademi, Yichong Xu, Reid Pryzant, Yuwei Fang, Chenguang Zhu, Dongdong Chen, Yao Qian, Xuemei Gao, Yi-Ling Chen, Robert Gmyr, Naoyuki Kanda, Noel Codella, Bin Xiao, Yu Shi, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang
2023AAAIi-Code: An Integrative and Composable Multimodal Learning Framework.Ziyi Yang, Yuwei Fang, Chenguang Zhu, Reid Pryzant, Dongdong Chen, Yu Shi, Yichong Xu, Yao Qian, Mei Gao, Yi-Ling Chen, Liyang Lu, Yujia Xie, Robert Gmyr, Noel Codella, Naoyuki Kanda, Bin Xiao, Lu Yuan, Takuya Yoshioka, Michael Zeng, Xuedong Huang
2023ICASSPTarget Sound Extraction with Variable Cross-Modality Clues.Chenda Li, Yao Qian, Zhuo Chen, Dongmei Wang, Takuya Yoshioka, Shujie Liu, Yanmin Qian, Michael Zeng
2023ICASSPDATA2VEC-SG: Improving Self-Supervised Learning Representations for Speech Generation Tasks.Heming Wang, Yao Qian, Hemin Yang, Naoyuki Kanda, Peidong Wang, Takuya Yoshioka, Xiaofei Wang, Yiming Wang, Shujie Liu, Zhuo Chen, DeLiang Wang, Michael Zeng
2023ICASSPCode-Switching Text Generation and Injection in Mandarin-English ASR.Haibin Yu, Yuxuan Hu, Yao Qian, Ma Jin, Linquan Liu, Shujie Liu, Yu Shi, Yanmin Qian, Edward Lin, Michael Zeng
2023InterspeechAdapting Multi-Lingual ASR Models for Handling Multiple Talkers.Chenda Li, Yao Qian, Zhuo Chen, Naoyuki Kanda, Dongmei Wang, Takuya Yoshioka, Yanmin Qian, Michael Zeng
2022ACLSpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing.Junyi Ao, Rui Wang, Long Zhou, Chengyi Wang, Shuo Ren, Yu Wu, Shujie Liu, Tom Ko, Qing Li, Yu Zhang, Zhihua Wei, Yao Qian, Jinyu Li, Furu Wei
2022ICASSPLarge-Scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification.Zhengyang Chen, Sanyuan Chen, Yu Wu, Yao Qian, Chengyi Wang, Shujie Liu, Yanmin Qian, Michael Zeng
2022ICASSPUnispeech-Sat: Universal Speech Representation Learning With Speaker Aware Pre-Training.Sanyuan Chen, Yu Wu, Chengyi Wang, Zhengyang Chen, Zhuo Chen, Shujie Liu, Jian Wu, Yao Qian, Furu Wei, Jinyu Li, Xiangzhan Yu
2022ICASSPWav2vec-Switch: Contrastive Learning from Original-Noisy Speech Pairs for Robust Speech Recognition.Yiming Wang, Jinyu Li, Heming Wang, Yao Qian, Chengyi Wang, Yu Wu
2022ICASSPImproving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction.Heming Wang, Yao Qian, Xiaofei Wang, Yiming Wang, Chengyi Wang, Shujie Liu, Takuya Yoshioka, Jinyu Li, DeLiang Wang
2022ICASSPOptimizing Alignment of Speech and Language Latent Spaces for End-To-End Speech Recognition and Understanding.Wei Wang, Shuo Ren, Yao Qian, Shujie Liu, Yu Shi, Yanmin Qian, Michael Zeng
2022ICASSPImproving Self-Supervised Learning for Speech Recognition with Intermediate Layer Supervision.Chengyi Wang, Yu Wu, Sanyuan Chen, Shujie Liu, Jinyu Li, Yao Qian, Zhenglu Yang
2022InterspeechPre-Training Transformer Decoder for End-to-End ASR Model with Unpaired Speech Data.Junyi Ao, Ziqiang Zhang, Long Zhou, Shujie Liu, Haizhou Li, Tom Ko, Lirong Dai, Jinyu Li, Yao Qian, Furu Wei
2021ICASSPSpeech-Language Pre-Training for End-to-End Spoken Language Understanding.Yao Qian, Ximo Bian, Yu Shi, Naoyuki Kanda, Leo Shen, Zhen Xiao, Michael Zeng
2021ICMLUniSpeech: Unified Speech Representation Learning with Labeled and Unlabeled Data.Chengyi Wang, Yu Wu, Yao Qian, Ken'ichi Kumatani, Shujie Liu, Furu Wei, Michael Zeng, Xuedong Huang
2020InterspeechDiscriminative Transfer Learning for Optimizing ASR and Semantic Labeling in Task-Oriented Spoken Dialog.Yao Qian, Yu Shi, Michael Zeng
2019ASRUNative Language Identification from Raw Waveforms Using Deep Convolutional Neural Networks with Attentive Pooling.Rutuja Ubale, Vikram Ramanarayanan, Yao Qian, Keelan Evanini, Chee Wee Leong, Chong Min Lee
2019ASRUUsing Very Deep Convolutional Neural Networks to Automatically Detect Plagiarized Spoken Responses.Xinhao Wang, Keelan Evanini, Yao Qian, Klaus Zechner
2019ICASSPNeural Approaches to Automated Speech Scoring of Monologue and Dialogue Responses.Yao Qian, Patrick L. Lange, Keelan Evanini, Robert A. Pugh, Rutuja Ubale, Matthew Mulholland, Xinhao Wang
2019ICMIAre Humans Biased in Assessment of Video Interviews?Chee Wee Leong, Katrina Roohr, Vikram Ramanarayanan, Michelle P. Martin-Raugh, Harrison Kell, Rutuja Ubale, Yao Qian, Zydrune Mladineo, Laura McCulla
2019InterspeechAutomated Estimation of Oral Reading Fluency During Summer Camp e-Book Reading with MyTurnToRead.Anastassia Loukina, Beata Beigman Klebanov, Patrick L. Lange, Yao Qian, Binod Gyawali, Nitin Madnani, Abhinav Misra, Klaus Zechner, Zuowei Wang, John Sabatini
2019InterspeechAutomatic Detection of Off-Topic Spoken Responses Using Very Deep Convolutional Neural Networks.Xinhao Wang, Su-Youn Yoon, Keelan Evanini, Klaus Zechner, Yao Qian
2019SIGdialScoring Interactional Aspects of Human-Machine Dialog for Language Learning and Assessment using Text Features.Vikram Ramanarayanan, Matthew Mulholland, Yao Qian
2018ICASSPEnd-to-End Neural Network Based Automated Speech Scoring.Lei Chen, Jidong Tao, Shabnam Ghaffarzadegan, Yao Qian
2018InterspeechImprovements to an Automated Content Scoring System for Spoken CALL Responses: the ETS Submission to the Second Spoken CALL Shared Task.Keelan Evanini, Matthew Mulholland, Rutuja Ubale, Yao Qian, Robert A. Pugh, Vikram Ramanarayanan, Aoife Cahill
2017ASRUImproving native language (L1) identifation with better VAD and TDNN trained separately on native and non-native English corpora.Yao Qian, Keelan Evanini, Patrick L. Lange, Robert A. Pugh, Rutuja Ubale, Frank K. Soong
2017ASRUExploring ASR-free end-to-end modeling to improve spoken language understanding in a cloud-based dialog system.Yao Qian, Rutuja Ubale, Vikram Ramanarayanan, Patrick L. Lange, David Suendermann-Oeft, Keelan Evanini, Eugene Tsuprun
2017InterspeechBidirectional LSTM-RNN for Improving Automated Assessment of Non-Native Children's Speech.Yao Qian, Keelan Evanini, Xinhao Wang, Chong Min Lee, Matthew Mulholland
2017InterspeechImproving Sub-Phone Modeling for Better Native Language Identification with Non-Native English Speech.Yao Qian, Keelan Evanini, Xinhao Wang, David Suendermann-Oeft, Robert A. Pugh, Patrick L. Lange, Hillary R. Molloy, Frank K. Soong
2016ICASSPUnsupervised speaker adaptation for DNN-based TTS synthesis.Yuchen Fan, Yao Qian, Frank K. Soong, Lei He
2016ICASSPSpeaker and language factorization in DNN-based TTS synthesis.Yuchen Fan, Yao Qian, Frank K. Soong, Lei He
2016ICASSPA comparison of ASR and human errors for transcription of non-native spontaneous speech.Matthew Mulholland, Melissa Lopez, Keelan Evanini, Anastassia Loukina, Yao Qian
2016InterspeechNoise and Metadata Sensitive Bottleneck Features for Improving Speaker Recognition with Non-Native Speech Input.Yao Qian, Jidong Tao, David Suendermann-Oeft, Keelan Evanini, Alexei V. Ivanov, Vikram Ramanarayanan
2016InterspeechSelf-Adaptive DNN for Improving Spoken Language Proficiency Assessment.Yao Qian, Xinhao Wang, Keelan Evanini, David Suendermann-Oeft
2016NAACLLearning Distributed Word Representations For Bidirectional LSTM Recurrent Neural Network.Peilu Wang, Yao Qian, Frank K. Soong, Lei He, Hai Zhao
2015ASRUUsing bidirectional lstm recurrent neural networks to learn high-level abstractions of sequential features for automated scoring of non-native spontaneous speech.Zhou Yu, Vikram Ramanarayanan, David Suendermann-Oeft, Xinhao Wang, Klaus Zechner, Lei Chen, Jidong Tao, Aliaksei Ivanou, Yao Qian
2015ICASSPMulti-speaker modeling and speaker adaptation for DNN-based TTS synthesis.Yuchen Fan, Yao Qian, Frank K. Soong, Lei He
2015ICASSPWord embedding for recurrent neural network based TTS synthesis.Peilu Wang, Yao Qian, Frank K. Soong, Lei He, Hai Zhao
2015InterspeechSequence generation error (SGE) minimization based deep neural networks training for text-to-speech synthesis.Yuchen Fan, Yao Qian, Frank K. Soong, Lei He
2014ICASSPA DNN-based acoustic modeling of tonal language and its application to Mandarin pronunciation training.Wenping Hu, Yao Qian, Frank K. Soong
2014ICASSPOn the training aspects of Deep Neural Network (DNN) for parametric TTS synthesis.Yao Qian, Yuchen Fan, Wenping Hu, Frank K. Soong
2014InterspeechTTS synthesis with bidirectional LSTM based recurrent neural networks.Yuchen Fan, Yao Qian, Feng-Long Xie, Frank K. Soong
2014InterspeechSequence error (SE) minimization training of neural network for voice conversion.Feng-Long Xie, Yao Qian, Yuchen Fan, Frank K. Soong, Haifeng Li
2014InterspeechModeling DCT parameterized F0 trajectory at intonation phrase level with DNN or decision tree.Xiang Yin, Ming Lei, Yao Qian, Frank K. Soong, Lei He, Zhen-Hua Ling, Li-Rong Dai
2013ICASSPA fast table lookup based, statistical model driven non-uniform unit selection TTS.Yao Qian, Frank K. Soong, Xiaobo Zhou, Yundi Qian, Xiaotian Zhang
2013InterspeechA new DNN-based high quality pronunciation evaluation for computer-aided language learning (CALL).Wenping Hu, Yao Qian, Frank K. Soong
2012InterspeechTurning a Monolingual Speaker into Multilingual for a Mixed-language TTS.Ji He, Yao Qian, Frank K. Soong, Sheng Zhao
2011ICASSPImproved F0 modeling and generation in voice conversion.Aki Kunikoshi, Yao Qian, Frank K. Soong, Nobuaki Minematsu
2011ICASSPA frame mapping based HMM approach to cross-lingual voice transformation.Yao Qian, Ji Xu, Frank K. Soong
2011InterspeechA New Phonetic Candidate Generator for Improving Search Query Efficiency.Bo Peng, Yao Qian, Frank K. Soong, Bo Zhang
2010ICASSPRIch-context Unit Selection (RUS) approach to high quality TTS.Zhi-Jie Yan, Yao Qian, Frank K. Soong
2010ICASSPImproved modeling for F0 generation and V/U decision in HMM-based TTS.Qingqing Zhang, Frank K. Soong, Yao Qian, Zhijie Yan, Jielin Pan, Yonghong Yan
2010InterspeechAn HMM trajectory tiling (HTT) approach to high quality TTS.Yao Qian, Zhi-Jie Yan, Yi-Jian Wu, Frank K. Soong, Xin Zhuang, Shengyi Kong
2010InterspeechFormant-based frequency warping for improving speaker adaptation in HMM TTS.Xin Zhuang, Yao Qian, Frank K. Soong, Yi-Jian Wu, Bo Zhang
2009ICASSPState mapping for cross-language speaker adaptation in TTS.Yining Chen, Yang Jiao, Yao Qian, Frank K. Soong
2009ICASSPImproved prosody generation by maximizing joint likelihood of state and longer units.Yao Qian, Zhizheng Wu, Frank K. Soong
2009InterspeechA minimum v/u error approach to F0 generation in HMM-based TTS.Yao Qian, Frank K. Soong, Miaomiao Wang, Zhizheng Wu
2009InterspeechRich context modeling for high quality HMM-based TTS.Zhi-Jie Yan, Yao Qian, Frank K. Soong
2008ICASSPA cross-language state mapping approach to bilingual (Mandarin-English) TTS.Hui Liang, Yao Qian, Frank K. Soong, Gongshen Liu
2008InterspeechDuration refinement by jointly optimizing state and longer unit likelihood.Boyang Gao, Yao Qian, Zhizheng Wu, Frank K. Soong
2008InterspeechGenerating natural F0 trajectory with additive trees.Yao Qian, Hui Liang, Frank K. Soong
2008InterspeechA real-time text to audio-visual speech synthesis system.Lijuan Wang, Xiaojun Qian, Lei Ma, Yao Qian, Yining Chen, Frank K. Soong
2008InterspeechProsody for Mandarin speech recognition: a comparative study of read and spontaneous speech.Yu Ting Yeung, Yao Qian, Tan Lee, Frank K. Soong
2007InterspeechRobust F0 modeling for Mandarin speech recognition in noise.Sheng Qiang, Yao Qian, Frank K. Soong, Congfu Xu
2006ICASSPTone-Enhanced Generalized Character Posterior Probability (GCPP) for Cantonese LVCSR.Yao Qian, Frank K. Soong, Tan Lee
2006InterspeechA multi-space distribution (MSD) approach to speech recognition of tonal languages.Huanliang Wang, Yao Qian, Frank K. Soong, Jian-Lai Zhou, Jiqing Han
2004InterspeechTone information as a confidence measure for improving Cantonese LVCSR.Yao Qian, Tan Lee, Frank K. Soong
2003InterspeechOverlapped di-tone modeling for tone recognition in continuous Cantonese speech.Yao Qian, Tan Lee, Yujia Li
2002ICASSPAssigning phrase accent to Chinese Text-to-Speech system.Yao Qian, Fang Chen
2001ICASSPSegmenting unrestricted Chinese text into prosodic words instead of lexical words.Yao Qian, Min Chu, Hu Peng