| 2025 | OpusLM: A Family of Open Unified Speech Language Models. | Jinchuan Tian, William Chen, Yifan Peng, Jiatong Shi, Siddhant Arora, Shikhar Bharadwaj, Takashi Maekaku, Yusuke Shinohara, Keita Goto, Xiang Yue, Huck Yang, Shinji Watanabe |
| 2025 | SLASH: Self-Supervised Speech Pitch Estimation Leveraging DSP-derived Absolute Pitch. | Ryo Terashima, Yuma Shirahata, Masaya Kawamura |
| 2025 | Articulatory Vowel Distinctiveness in Spanish. | Kristin Teplansky, Emily Rangel, Mimi LaValley, Jinuk Kwon, Beiming Cao, Jun Wang |
| 2025 | Robust Vocal Intensity Prediction: Overcoming Dataset Bias with Pretrained Deep Models. | Quentin Le Tellier, Marc Evrard, Albert Rilliard, Jean-Sylvain Linard |
| 2025 | I want a horror - comedy - movie: Slips-of-the-Tongue Impact Conversational Recommender System Performance. | Maria Teleki, Lingfeng Shi, Chengkai Liu, James Caverlee |
| 2025 | Improving Audio Classification by Transitioning from Zero- to Few-Shot. | James Taylor, Wolfgang Mack |
| 2025 | Direct-path Relative Harmonic Coefficients Detection for Multi-source Direction-of-Arrival Estimation in Reverberant Environments. | Liang Tao, Maoshen Jia, Yonggang Hu |
| 2025 | Power Spectral Density Estimation for Acoustic Source Separation Using A Spherical Microphone Array. | Liang Tao, Maoshen Jia, Yonggang Hu |
| 2025 | Automatic classification of stop realisation with wav2vec2.0. | James Tanner, Morgan Sonderegger, Jane Stuart-Smith, Jeff Mielke, Tyler Kendall |
| 2025 | Intrasentential English in Swedish TTS: perceived English-accentedness. | Christina Tnnander, David House, Jonas Beskow, Jens Edlund |
| 2025 | Enhanced Hybrid Transducer and Attention Encoder Decoder with Text Data. | Yun Tang, Eesung Kim, Vijendra Raj Apsingekar |
| 2025 | CBA-Whisper: Curriculum Learning-Based AdaLoRA Fine-Tuning on Whisper for Low-Resource Dysarthric Speech Recognition. | Tianyi Tan, Xin'an Chen, Xiaohuai Le, Wenzhi Fan, Xianjun Xia, Chuanzeng Huang, Jing Lu |
| 2025 | Enhancing Serialized Output Training for Multi-Talker ASR with Soft Monotonic Alignment and Utterance-level Timestamp. | Fengyun Tan, Tao Wei, Kun Zou, Ning Cheng, Shaojun Wang, Jing Xiao |
| 2025 | Anne Rowling Neurological Speech Corpus: clinically annotated longitudinal dataset for developing speech biomarkers in neurodegenerative disorders. | Johnny Tam, Christine Weaver, Oliver Watts, Siddharthan Chandran, Suvankar Pal, Rowling Speech Consortium |
| 2025 | Multimodal Emotion Diarization: Frame-Wise Integration of Text and Audio Representations. | Ziv Tamir, Thomas Thebaud, Jess Villalba, Najim Dehak, Oren Kurland |
| 2025 | Development and Validation of a Wav2Vec 2.0-Based Cross-Language Methodology for Measurement of Articulatory Precision. | Tanya Talkar, Kan Kawabata, Connor Higgins, Sean Tobyne |
| 2025 | CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer. | Daiki Takeuchi, Binh Thien Nguyen, Masahiro Yasuda, Yasunori Ohishi, Daisuke Niizumi, Noboru Harada |
| 2025 | Fine-tuning Parakeet-TDT for Dysarthric Speech Recognition in the Speech Accessibility Project Challenge. | Kaito Takahashi, Keigo Hojo, Toshimitsu Sakai, Yukoh Wakabayashi, Norihide Kitaoka |
| 2025 | PeriodCodec: A Pitch-Controllable Neural Audio Codec Using Periodic Signals for Singing Voice Synthesis. | Masato Takagi, Miku Nishihara, Yukiya Hono, Kei Hashimoto, Yoshihiko Nankaku, Keiichi Tokuda |
| 2025 | Unified Semi-Supervised Pipeline for Automatic Speech Recognition. | Nune Tadevosyan, Nikolay Karpov, Andrei Andrusenko, Vitaly Lavrukhin, Ante Jukic |
| 2025 | FT-Boosted SV: Towards Noise Robust Speaker Verification for English Speaking Classroom Environments. | Saba Tabatabaee, Jing Liu, Carol Y. Espy-Wilson |
| 2025 | Enhancing Acoustic-to-Articulatory Speech Inversion by Incorporating Nasality. | Saba Tabatabaee, Suzanne Boyce, Liran Oren, Mark Tiede, Carol Y. Espy-Wilson |
| 2025 | Significance of Time-Frequency preprocessing for automatic Ultrasonic Vocalization classification in Autism Spectrum Disorder model detection. | Szymon Szmajdzinski, Juliusz Wjtowicz-Kruk, Ivan Ryzhankow, Lukasz Lazarski, Jakub Zak, Wladyslaw Sredniawa |
| 2025 | Voice Reconstruction through Large-Scale TTS Models: Comparing Zero-Shot and Fine-tuning Approaches to Personalise TTS in Assistive Communication. | va Szkely, Pter Mihajlik, Mt Soma Kdr, Lszl Tth |
| 2025 | AusKidTalk: Using Strategic Data Collection and Out-of-Domain Tools to Semi-Automate Novel Corpora Annotation. | Tnde Szalay, Mostafa Shahin, Tharmakulasingam Sirojan, Zheng Nan, Renata Huang, Kirrie J. Ballard, Beena Ahmed |