| 2021 | Automatic Generation of Diagnostic Content Feedback in Spoken Language Learning and Assessment. | Xinhao Wang, Christopher Hamill |
| 2021 | On Architectures and Training for Raw Waveform Feature Extraction in ASR. | Peter Vieting, Christoph Lscher, Wilfried Michel, Ralf Schlter, Hermann Ney |
| 2021 | Data Augmentation for ASR Using TTS Via a Discrete Representation. | Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2021 | Efficient Keyword Spotting by Capturing Long-Range Interactions with Temporal Lambda Networks. | Biel Tura, Santiago Escuder, Ferran Diego, Carlos Segura, Jordi Luque |
| 2021 | Robust Speech-Age Estimation Using Local Maximum Mean Discrepancy Under Mismatched Recording Conditions. | Naohiro Tawara, Atsunori Ogawa, Yuki Kitagishi, Hosana Kamiyama, Yusuke Ijima |
| 2021 | Improving Speaker Identification for Shared Devices by Adapting Embeddings to Speaker Subsets. | Zhenning Tan, Yuguang Yang, Eunjung Han, Andreas Stolcke |
| 2021 | TGAVC: Improving Autoencoder Voice Conversion with Text-Guided and Adversarial Training. | Huaizhen Tang, Xulong Zhang, Jianzong Wang, Ning Cheng, Zhen Zeng, Edward Xiao, Jing Xiao |
| 2021 | EditSpeech: A Text Based Speech Editing System Using Partial Inference and Bidirectional Fusion. | Daxin Tan, Liqun Deng, Yu Ting Yeung, Xin Jiang, Xiao Chen, Tan Lee |
| 2021 | Tree-Constrained Pointer Generator for End-to-End Contextual Speech Recognition. | Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2021 | Reconstructing Dual Learning for Neural Voice Conversion Using Relatively Few Samples. | Aolan Sun, Jianzong Wang, Ning Cheng, Methawee Tantrawenith, Zhiyong Wu, Helen Meng, Edward Xiao, Jing Xiao |
| 2021 | Unsupervised Domain Adaptation Schemes for Building ASR in Low-Resource Languages. | Chandran Savithri Anoop, Prathosh A. P., A. G. Ramakrishnan |
| 2021 | Learning How Long to Wait: Adaptively-Constrained Monotonic Multihead Attention for Streaming ASR. | Jaeyun Song, Hajin Shim, Eunho Yang |
| 2021 | Comparative Study of Different Tokenization Strategies for Streaming End-to-End ASR. | Sachin Singh, Ashutosh Gupta, Aman Maghan, Dhananjaya Gowda, Shatrughan Singh, Chanwoo Kim |
| 2021 | Self-Supervised Metric Learning With Graph Clustering For Speaker Diarization. | Prachi Singh, Sriram Ganapathy |
| 2021 | GLMSnet: Single Channel Speech Separation Framework in Noisy and Reverberant Environments. | Huiyu Shi, Xi Chen, Tianlong Kong, Shouyi Yin, Peng Ouyang |
| 2021 | Exploring Teacher-Student Learning Approach for Multi-Lingual Speech-to-Intent Classification. | Bidisha Sharma, Maulik C. Madhavi, Xuehao Zhou, Haizhou Li |
| 2021 | Towards Using Heterogeneous Relation Graphs for End-to-End TTS. | Amrith Setlur, Aman Madaan, Tanmay Parekh, Yiming Yang, Alan W. Black |
| 2021 | Audio-Visual Speech Recognition is Worth $32\times 32\times 8$ Voxels. | Dmitriy Serdyuk, Otavio Braga, Olivier Siohan |
| 2021 | Applying X-Vectors on Pathological Speech After Larynx Removal. | Ralph Scheuerer, Tino Haderlein, Elmar Nth, Tobias Bocklet |
| 2021 | Are You Dictating to Me? Detecting Embedded Dictations in Doctor-Patient Conversations. | Thomas Schaaf, Longxiang Zhang, Alireza Bayestehtashk, Mark C. Fuhs, Shahid Durrani, Susanne Burger, Monika Woszczyna, Thomas Polzin |
| 2021 | Leveraging Pre-Trained Representations to Improve Access to Untranscribed Speech from Endangered Languages. | Nay San, Martijn Bartelds, Mitchell Browne, Lily Clifford, Fiona Gibson, John Mansfield, David Nash, Jane Simpson, Myfany Turpin, Maria Vollmer, Sasha Wilmoth, Dan Jurafsky |
| 2021 | Assessing Evaluation Metrics for Speech-to-Speech Translation. | Elizabeth Salesky, Julian Mder, Severin Klinger |
| 2021 | Attention Based Model for Segmental Pronunciation Error Detection. | Jose Antonio Lopez Saenz, Md Asif Jalal, Rosanna Milner, Thomas Hain |
| 2021 | Low-Latency Incremental Text-to-Speech Synthesis with Distilled Context Prediction Network. | Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | Action Item Detection in Meetings Using Pretrained Transformers. | Kishan Sachdeva, Joshua Maynez, Olivier Siohan |