| 2023 | Knowledge Distillation From Offline to Streaming Transducer: Towards Accurate and Fast Streaming Model by Matching Alignments. | Ji-Hwan Mo, Jae-Jin Jeon, Mun-Hak Lee, Joon-Hyuk Chang |
| 2023 | Identifying People with Mild Cognitive Impairment at Risk of Developing Dementia using Speech Analysis. | Bahman Mirheidari, Ronan O'Malley, Daniel Blackburn, Heidi Christensen |
| 2023 | LibriSpeech-PC: Benchmark for Evaluation of Punctuation and Capitalization Capabilities of End-to-End ASR Models. | Aleksandr Meister, Matvei Novikov, Nikolay Karpov, Evelina Bakhturina, Vitaly Lavrukhin, Boris Ginsburg |
| 2023 | Deriving Translational Acoustic Sub-Word Embeddings. | Amit Meghanani, Thomas Hain |
| 2023 | Whisper-Slu: Extending a Pretrained Speech-to-Text Transformer for Low Resource Spoken Language Understanding. | Quentin Meeus, Marie-Francine Moens, Hugo Van hamme |
| 2023 | LAE-ST-MOE: Boosted Language-Aware Encoder Using Speech Translation Auxiliary Task for E2E Code-Switching ASR. | Guodong Ma, Wenxuan Wang, Yuke Li, Yuting Yang, Binbin Du, Haoran Fu |
| 2023 | End-To-End Training of a Neural HMM with Label and Transition Probabilities. | Daniel Mann, Tina Raissi, Wilfried Michel, Ralf Schlter, Hermann Ney |
| 2023 | PP-MET: A Real-World Personalized Prompt Based Meeting Transcription System. | Xiang Lyu, Yuhang Cao, Qing Wang, Jingjing Yin, Yuguang Yang, Pengpeng Zou, Yanni Hu, Heng Lu |
| 2023 | Salt: Distinguishable Speaker Anonymization Through Latent Space Transformation. | Yuanjun Lv, Jixun Yao, Peikun Chen, Hongbin Zhou, Heng Lu, Lei Xie |
| 2023 | Cross-Modal Alignment With Optimal Transport For CTC-Based ASR. | Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai |
| 2023 | Zero-Shot Emotion Transfer for Cross-Lingual Speech Synthesis. | Yuke Li, Xinfa Zhu, Yi Lei, Hai Li, Junhui Liu, Danming Xie, Lei Xie |
| 2023 | Towards a Unified End-to-End Language Understanding System for Speech and Text Inputs. | Mohan Li, Catalin Zorila, Cong-Thanh Do, Rama Doddipatla |
| 2023 | Sa-Paraformer: Non-Autoregressive End-To-End Speaker-Attributed ASR. | Yangze Li, Fan Yu, Yuhao Liang, Pengcheng Guo, Mohan Shi, Zhihao Du, Shiliang Zhang, Lei Xie |
| 2023 | Prompting Large Language Models for Zero-Shot Domain Adaptation in Speech Recognition. | Yuang Li, Yu Wu, Jinyu Li, Shujie Liu |
| 2023 | After: Active Learning Based Fine-Tuning Framework for Speech Emotion Recognition. | Dongyuan Li, Yusong Wang, Kotaro Funakoshi, Manabu Okumura |
| 2023 | Improved Multi-Modal Emotion Recognition Using Squeeze-and-Excitation Block in Cross-Modal Attention. | Junchen Liu, Jesin James, Karan Nathwani |
| 2023 | Prompt Pool Based Class-Incremental Continual Learning for Dialog State Tracking. | Hong Liu, Yucheng Cai, Yuan Zhou, Zhijian Ou, Yi Huang, Junlan Feng |
| 2023 | Yodas: Youtube-Oriented Dataset for Audio and Speech. | Xinjian Li, Shinnosuke Takamichi, Takaaki Saeki, William Chen, Sayaka Shiota, Shinji Watanabe |
| 2023 | Improving Speech Enhancement Using Audio Tagging Knowledge From Pre-Trained Representations and Multi-Task Learning. | Shaoxiong Lin, Chao Zhang, Yanmin Qian |
| 2023 | Haha-POD: An Attempt for Laughter-Based Non-Verbal Speaker Verification. | Yuke Lin, Xiaoyi Qin, Ning Jiang, Guoqing Zhao, Ming Li |
| 2023 | Improving Whispered Speech Recognition Performance Using Pseudo-Whispered Based Data Augmentation. | Zhaofeng Lin, Tanvina Patel, Odette Scharenborg |
| 2023 | MelHuBERT: A Simplified Hubert on Mel Spectrograms. | Tzu-Quan Lin, Hung-Yi Lee, Hao Tang |
| 2023 | Reducing the Cost of Spoof Detection Labeling using Mixed-Strategy Active Learning and Pretrained Models. | Mark Lindsey, Nathaniel R. Robinson, Francis Kubala, Richard M. Stern |
| 2023 | Parameter-Efficient Cross-Language Transfer Learning for a Language-Modular Audiovisual Speech Recognition. | Zhengyang Li, Thomas Graave, Jing Liu, Timo Lohrenz, Siegfried Kunzmann, Tim Fingscheidt |
| 2023 | Zero-Shot Domain-Sensitive Speech Recognition with Prompt-Conditioning Fine-Tuning. | Feng-Ting Liao, Yung-Chieh Chan, Yi-Chang Chen, Chan-Jan Hsu, Da-Shan Shiu |