| 2023 | Transformer Attractors for Robust and Efficient End-To-End Neural Diarization. | Lahiru Samarakoon, Samuel J. Broughton, Marc Hrknen, Ivan Fung |
| 2023 | Leveraging the Multilingual Indonesian Ethnic Languages Dataset In Self-Supervised Models for Low-Resource ASR Task. | Sakriani Sakti, Benita Angela Titalim |
| 2023 | A Single Speech Enhancement Model Unifying Dereverberation, Denoising, Speaker Counting, Separation, And Extraction. | Kohei Saijo, Wangyou Zhang, Zhong-Qiu Wang, Shinji Watanabe, Tetsunori Kobayashi, Tetsuji Ogawa |
| 2023 | Rescuespeech: A German Corpus for Speech Recognition in Search and Rescue Domain. | Sangeet Sagar, Mirco Ravanelli, Bernd Kiefer, Ivana Kruijff-Korbayov, Josef van Genabith |
| 2023 | Robust Logarithmic Champernowne Algorithm for Feedback Cancellation in Hearing aids. | Vanitha Devi R, Vasundhara |
| 2023 | On the Relevance of Phoneme Duration Variability of Synthesized Training Data for Automatic Speech Recognition. | Nick Rossenbach, Benedikt Hilmes, Ralf Schlter |
| 2023 | Fast Conformer With Linearly Scalable Attention For Efficient Speech Recognition. | Dima Rekesh, Nithin Rao Koluguri, Samuel Kriman, Somshubra Majumdar, Vahid Noroozi, He Huang, Oleksii Hrinchuk, Krishna C. Puvvada, Ankur Kumar, Jagadeesh Balam, Boris Ginsburg |
| 2023 | On Time Domain Conformer Models for Monaural Speech Separation in Noisy Reverberant Acoustic Environments. | William Ravenscroft, Stefan Goetze, Thomas Hain |
| 2023 | Two-Pass Endpoint Detection for Speech Recognition. | Anirudh Raju, Aparna Khare, Di He, Ilya Sklyar, Long Chen, Sam Alptekin, Viet Anh Trinh, Zhe Zhang, Colin Vaz, Venkatesh Ravichandran, Roland Maas, Ariya Rastrow |
| 2023 | MASR: Multi-Label Aware Speech Representation. | Anjali Raj, Shikhar Bharadwaj, Sriram Ganapathy, Min Ma, Shikhar Vashishth |
| 2023 | Paraconsistent Feature Analysis for the Competency Evaluation of Voice Impersonation. | Rajeev Rajan, Noumida Abdul Kareem, Sreelakshmi S |
| 2023 | Can We Use Speaker Embeddings On Spontaneous Speech Obtained From Medical Conversations To Predict Intelligibility? | Sebastio Quintas, Mathieu Balaguer, Julie Mauclair, Virginie Woisard, Julien Pinquier |
| 2023 | Improving Large-Scale Deep Biasing With Phoneme Features and Text-Only Data in Streaming Transducer. | Jin Qiu, Lu Huang, Boyu Li, Jun Zhang, Lu Lu, Zejun Ma |
| 2023 | The Role of Feature Correlation on Quantized Neural Networks. | David Qiu, Shaojin Ding, Yanzhang He |
| 2023 | LE-SSL-MOS: Self-Supervised Learning MOS Prediction with Listener Enhancement. | Zili Qi, Xinhui Hu, Wangjin Zhou, Sheng Li, Hao Wu, Jian Lu, Xinkang Xu |
| 2023 | Towards Developing State-of-The-Art TTS Synthesisers for 13 Indian Languages with Signal Processing Aided Alignments. | Anusha Prakash, Srinivasan Umesh, Hema A. Murthy |
| 2023 | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | Multitask Learning Model with Text and Speech Representation for Fine-Grained Speech Scoring. | Seongjin Park, Rutuja Ubale |
| 2023 | Token-Level Serialized Output Training for Joint Streaming ASR and ST Leveraging Textual Alignments. | Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Jinyu Li, Yashesh Gaur |
| 2023 | Scenario-Aware Audio-Visual TF-Gridnet for Target Speech Extraction. | Zexu Pan, Gordon Wichern, Yoshiki Masuyama, Franois G. Germain, Sameer Khurana, Chiori Hori, Jonathan Le Roux |
| 2023 | WaveNeXt: ConvNeXt-Based Fast Neural Vocoder Without ISTFT layer. | Takuma Okamoto, Haruki Yamashita, Yamato Ohtani, Tomoki Toda, Hisashi Kawai |
| 2023 | Vits-Based Singing Voice Conversion Leveraging Whisper and Multi-Scale F0 Modeling. | Ziqian Ning, Yuepeng Jiang, Zhichao Wang, Bin Zhang, Lei Xie |
| 2023 | Audio-Adapterfusion: A Task-Id-Free Approach for Efficient and Non-Destructive Multi-Task Speech Recognition. | Hillary Ngai, Rohan Agrawal, Neeraj Gaur, W. Ronny Huang, Parisa Haghani, Pedro Moreno Mengibar |
| 2023 | Permod: Perceptually Grounded Voice Modification With Latent Diffusion Models. | Robin Netzorg, Ajil Jalal, Luna McNulty, Gopala Krishna Anumanchipalli |
| 2023 | Combining Relative and Absolute Learning Formulations to Predict Emotional Attributes From Speech. | Abinay Reddy Naini, Shruthi Subramanium, Seong-Gyun Leem, Carlos Busso |