| 2021 | Improving ASR Error Correction Using N-Best Hypotheses. | Linchen Zhu, Wenjie Liu, Linquan Liu, Edward Lin |
| 2021 | SpeechNAS: Towards Better Trade-Off Between Latency and Accuracy for Large-Scale Speaker Verification. | Wentao Zhu, Tianlong Kong, Shun Lu, Jixiang Li, Dawei Zhang, Feng Deng, Xiaorui Wang, Sen Yang, Ji Liu |
| 2021 | Multi-Granularity Annotation of Instantaneous Intelligibility of Learners' Utterances Based on Shadowing Techniques. | Chuanbo Zhu, Ryo Hakoda, Daisuke Saito, Nobuaki Minematsu, Noriko Nakanishi, Tazuko Nishimura |
| 2021 | Multilingual and Crosslingual Speech Recognition Using Phonological-Vector Based Phone Embeddings. | Chengrui Zhu, Keyu An, Huahuan Zheng, Zhijian Ou |
| 2021 | Adapting GPT, GPT-2 and BERT Language Models for Speech Recognition. | Xianrui Zheng, Chao Zhang, Philip C. Woodland |
| 2021 | On Addressing Practical Challenges for RNN-Transducer. | Rui Zhao, Jian Xue, Jinyu Li, Wenning Wei, Lei He, Yifan Gong |
| 2021 | Automatic Speech Recognition for Low-Resource Languages: The Thuee Systems for the IARPA Openasr20 Evaluation. | Jing Zhao, Gui-Xin Shi, Guan-Bo Wang, Wei-Qiang Zhang |
| 2021 | Duality Temporal-Channel-Frequency Attention Enhanced Speaker Representation Learning. | Li Zhang, Qing Wang, Lei Xie |
| 2021 | Cyclegean: Cycle Generative Enhanced Adversarial Network for Voice Conversion. | Xulong Zhang, Jianzong Wang, Ning Cheng, Edward Xiao, Jing Xiao |
| 2021 | On Lattice-Free Boosted MMI Training of HMM and CTC-Based Full-Context ASR Models. | Xiaohui Zhang, Vimal Manohar, David Zhang, Frank Zhang, Yangyang Shi, Nayan Singhal, Julian Chan, Fuchun Peng, Yatharth Saraf, Mike Seltzer |
| 2021 | Multi-Task Audio Source Separation. | Lu Zhang, Chenxing Li, Feng Deng, Xiaorui Wang |
| 2021 | Sequence Model with Self-Adaptive Sliding Window for Efficient Spoken Document Segmentation. | Qinglin Zhang, Qian Chen, Yali Li, Jiaqing Liu, Wen Wang |
| 2021 | Dive: End-to-End Speech Diarization Via Iterative Speaker Embedding. | Neil Zeghidour, Olivier Teboul, David Grangier |
| 2021 | Boundary and Context Aware Training for CIF-Based Non-Autoregressive End-to-End ASR. | Fan Yu, Haoneng Luo, Pengcheng Guo, Yuhao Liang, Zhuoyuan Yao, Lei Xie, Yingying Gao, Leijing Hou, Shilei Zhang |
| 2021 | Decoupling Recognition and Transcription in Mandarin ASR. | Jiahong Yuan, Xingyu Cai, Dongji Gao, Renjie Zheng, Liang Huang, Kenneth Church |
| 2021 | Speaker Conditioning of Acoustic Models Using Affine Transformation for Multi-Speaker Speech Recognition. | Midia Yousefi, John H. L. Hansen |
| 2021 | Mandarin Electrolaryngeal Speech Voice Conversion with Sequence-to-Sequence Modeling. | Ming-Chi Yen, Wen-Chin Huang, Kazuhiro Kobayashi, Yu-Huai Peng, Shu-Wei Tsai, Yu Tsao, Tomoki Toda, Jyh-Shing Roger Jang, Hsin-Min Wang |
| 2021 | Multi-Task Language Modeling for Improving Speech Recognition of Rare Words. | Chao-Han Huck Yang, Linda Liu, Ankur Gandhe, Yile Gu, Anirudh Raju, Denis Filimonov, Ivan Bulyko |
| 2021 | PSVD: Post-Training Compression of LSTM-Based RNN-T Models. | Suwa Xu, Jinwon Lee, Jim Steele |
| 2021 | Incorporating Real-World Noisy Speech in Neural-Network-Based Speech Enhancement Systems. | Yangyang Xia, Buye Xu, Anurag Kumar |
| 2021 | Cross-Lingual Transfer for Speech Processing Using Acoustic Language Similarity. | Peter Wu, Jiatong Shi, Yifan Zhong, Shinji Watanabe, Alan W. Black |
| 2021 | Dual-Encoder Architecture with Encoder Selection for Joint Close-Talk and Far-Talk Speech Recognition. | Felix Weninger, Marco Gaudesi, Ralf Leibold, Roberto Gemello, Puming Zhan |
| 2021 | Attentive Contextual Carryover for Multi-Turn End-to-End Spoken Language Understanding. | Kai Wei, Thanh Tran, Feng-Ju Chang, Kanthashree Mysore Sathyendra, Thejaswi Muniyappa, Jing Liu, Anirudh Raju, Ross McGowan, Nathan Susanj, Ariya Rastrow, Grant P. Strimel |
| 2021 | Word-Level Confidence Estimation for RNN Transducers. | Mingqiu Wang, Hagen Soltau, Laurent El Shafey, Izhak Shafran |
| 2021 | MACCIF-TDNN: Multi Aspect Aggregation of Channel and Context Interdependence Features in TDNN-Based Speaker Verification. | Fangyuan Wang, Zhigang Song, Hongchen Jiang, Bo Xu |