| 2021 | A Comparative Study of Modular and Joint Approaches for Speaker-Attributed ASR on Monaural Long-Form Audio. | Naoyuki Kanda, Xiong Xiao, Jian Wu, Tianyan Zhou, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Zhuo Chen, Takuya Yoshioka |
| 2021 | An End-to-End Far-Field Keyword Spotting System with Neural Beamforming. | Xuan Ji, Lu Lu, Fuming Fang, Jianbo Ma, Lei Zhu, Jinke Li, Dongdi Zhao, Ming Liu, Feijun Jiang |
| 2021 | Estimating the Generation Timing of Responsive Utterances by Active Listeners of Spoken Narratives. | Koichiro Ito, Masaki Murata, Tomohiro Ohno, Shigeki Matsubara |
| 2021 | Fast-MD: Fast Multi-Decoder End-to-End Speech Translation with Non-Autoregressive Hidden Intermediates. | Hirofumi Inaguma, Siddharth Dalmia, Brian Yan, Shinji Watanabe |
| 2021 | Instant One-Shot Word-Learning for Context-Specific Neural Sequence-to-Sequence Speech Recognition. | Christian Huber, Juan Hussain, Sebastian Stker, Alexander Waibel |
| 2021 | On Prosody Modeling for ASR+TTS Based Voice Conversion. | Wen-Chin Huang, Tomoki Hayashi, Xinjian Li, Shinji Watanabe, Tomoki Toda |
| 2021 | Multitask Generative Adversarial Imitation Learning for Multi-Domain Dialogue System. | Chuan-En Hsu, Mahdin Rohmatillah, Jen-Tzung Chien |
| 2021 | Towards Neural Diarization for Unlimited Numbers of Speakers Using Global and Local Attractors. | Shota Horiguchi, Shinji Watanabe, Paola Garca, Yawen Xue, Yuki Takashima, Yohei Kawaguchi |
| 2021 | Multi-Task Learning with Cross Attention for Keyword Spotting. | Takuya Higuchi, Anmol Gupta, Chandra Dhir |
| 2021 | A Comparative Study on Non-Autoregressive Modelings for Speech-to-Text Generation. | Yosuke Higuchi, Nanxin Chen, Yuya Fujita, Hirofumi Inaguma, Tatsuya Komatsu, Jaesong Lee, Jumon Nozaki, Tianzi Wang, Shinji Watanabe |
| 2021 | Latency-Controlled Neural Architecture Search for Streaming Speech Recognition. | Liqiang He, Shulin Feng, Dan Su, Dong Yu |
| 2021 | Voxceleb Enrichment for Age and Gender Recognition. | Khaled Hechmi, Trung Ngo Trong, Ville Hautamki, Tomi Kinnunen |
| 2021 | Attention-Based Scaling Adaptation for Target Speech Extraction. | Jiangyu Han, Wei Rao, Yanhua Long, Jiaen Liang |
| 2021 | 3D Spatial Features for Multi-Channel Target Speech Separation. | Rongzhi Gu, Shi-Xiong Zhang, Meng Yu, Dong Yu |
| 2021 | Voice to Action: Spoken Language Understanding for Memory-Constrained Systems. | Ashutosh Gupta, Aditya Jayasimha, Aman Maghan, Shatrughan Singh, Dhananjaya Gowda, Chanwoo Kim |
| 2021 | Intent Recognition and Unsupervised Slot Identification for Low-Resourced Spoken Dialog Systems. | Akshat Gupta, Olivia Deng, Akruti Kushwaha, Saloni Mittal, William Zeng, Sai Krishna Rallabandi, Alan W. Black |
| 2021 | Far-Field Speech Recognition Based on Complex-Valued Neural Networks and Inter-Frame Similarity Difference Method. | Yifan Guo, Yifan Chen, Gaofeng Cheng, Pengyuan Zhang, Yonghong Yan |
| 2021 | HiTNet: Byte-to-BPE Hierarchical Transcription Network for End-to-End Speech Recognition. | Dhananjaya Gowda, Abhinav Garg, Jiyeon Kim, Mehul Kumar, Sachin Singh, Ashutosh Gupta, Ankur Kumar, Nauman Dawalatabad, Aman Maghan, Shatrughan Singh, Chanwoo Kim |
| 2021 | What does the User Want? Information Gain for Hierarchical Dialogue Policy Optimisation. | Christian Geishauser, Songbo Hu, Hsien-Chin Lin, Nurul Lubis, Michael Heck, Shutong Feng, Carel van Niekerk, Milica Gasic |
| 2021 | ChannelAugment: Improving Generalization of Multi-Channel ASR by Training with Input Channel Randomization. | Marco Gaudesi, Felix Weninger, Dushyant Sharma, Puming Zhan |
| 2021 | Distilling Knowledge from Ensembles of Acoustic Models for Joint CTC-Attention End-to-End Speech Recognition. | Yan Gao, Titouan Parcollet, Nicholas D. Lane |
| 2021 | X-SHOT: Learning to Rank Voice Applications Via Cross-Locale Shard-Based Co-Training. | Zheng Gao, Mohamed Abdelhady, Radhika Arava, Xibin Gao, Qian Hu, Wei Xiao, Thahir Mohamed |
| 2021 | ASR Rescoring and Confidence Estimation with Electra. | Hayato Futami, Hirofumi Inaguma, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara |
| 2021 | Incremental Learning for End-to-End Automatic Speech Recognition. | Li Fu, Xiaoxiao Li, Libo Zi, Zhengchen Zhang, Youzheng Wu, Xiaodong He, Bowen Zhou |
| 2021 | Towards Robust Mispronunciation Detection and Diagnosis for L2 English Learners with Accent-Modulating Methods. | Shao-Wei Fan-Jiang, Bi-Cheng Yan, Tien-Hong Lo, Fu-An Chao, Berlin Chen |