| 2025 | RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio. | Yusuke Kanamori, Yuki Okamoto, Taisei Takano, Shinnosuke Takamichi, Yuki Saito, Hiroshi Saruwatari |
| 2025 | LinearVC: Linear Transformations of Self-Supervised Features Through the Lens of Voice Conversion. | Herman Kamper, Benjamin van Niekerk, Julian Zadi, Marc-Andr Carbonneau |
| 2025 | MOVER: Combining Multiple Meeting Recognition Systems. | Naoyuki Kamo, Tsubasa Ochiai, Marc Delcroix, Tomohiro Nakatani |
| 2025 | Diarization-Guided Multi-Speaker Embeddings. | Joonas Kalda, Clment Pags, Tanel Alume, Herv Bredin |
| 2025 | Sounding Like a Winner? Prosodic Differences in Post-Match Interviews. | Sofoklis Kakouros, Haoyu Chen |
| 2025 | Investigating the Impact of Word Informativeness on Speech Emotion Recognition. | Sofoklis Kakouros |
| 2025 | SNR-Aligned Consistent Diffusion for Adaptive Speech Enhancement. | Yonghyeon Jun, Beomjun Woo, Myeonghun Jeong, Nam Soo Kim |
| 2025 | The Text-to-speech in the Wild (TITW) Database. | Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe |
| 2025 | Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting. | Youngmoon Jung, Yong-Hyeok Lee, Myunghun Jung, Jaeyoung Roh, Chang Woo Han, Hoon-Young Cho |
| 2025 | InfiniteAudio: Infinite-Length Audio Generation with Consistency. | Chaeyoung Jung, Hojoon Ki, Ji-Hoon Kim, Junmo Kim, Joon Son Chung |
| 2025 | Identifying Vocal and Facial Biomarkers of Depression in Large-Scale Remote Recordings: A Multimodal Study Using Mixed-Effects Modeling. | Nelson Hidalgo Julia, Robert Lewis, Craig Ferguson, Simon Goldberg, Wendy Lau, Caroline Swords, Gabriela Valdivia, Christine D. Wilson-Mendenhall, Raquel Tartar, Rosalind W. Picard, Richard Davidson |
| 2025 | French Listening Tests for the Assessment of Intelligibility, Quality, and Identity of Body-Conducted Speech Enhancement. | Thomas Joubaud, Julien Hauret, Vronique Zimpfer, ric Bavu |
| 2025 | Recognizing Every Voice: Towards Inclusive ASR for Rural Bhojpuri Women. | Sakshi Joshi, Eldho Ittan George, Tahir Javed, Kaushal Santosh Bhogale, Nikhil Narasimhan, Mitesh M. Khapra |
| 2025 | MATER: Multi-level Acoustic and Textual Emotion Representation for Interpretable Speech Emotion Recognition. | Hyo Jin Jon, Longbin Jin, Hyuntaek Jung, Hyunseo Kim, Donghun Min, Eun Yi Kim |
| 2025 | TELVID: A Multilingual Multi-modal Corpus for Speaker Recognition. | Karen Jones, Kevin Walker, Christopher Caruso, Elliot Singer, Trang Nguyen, Robert B. Dunn, Stephanie M. Strassel |
| 2025 | An Exploratory Framework for LLM-assisted Human Annotation of Speech Datasets. | Alexander Johnson, Harsh Deshpande, Emmy Phung, Ahmad Emami |
| 2025 | In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion. | Jiawei Jin, Zhihan Yang, Yixuan Zhou, Zhiyong Wu |
| 2025 | VoiceNet: Multilingual On-Device Phoneme-To-Audio Alignment. | Kun Jin, Siva Penke, Srinivasa Algubelli |
| 2025 | Contrastive Learning-based Syllable-Level Mispronunciation Detection and Diagnosis for Speech Audiometry. | Longbin Jin, Donghun Min, Jung Eun Shin, Eun Yi Kim |
| 2025 | Beyond Hard Sharing: Efficient Multi-Task Speech-to-Text Modeling with Supervised Mixture of Experts. | Hojun Jin, Eunsoo Hong, Ziwon Hyung, Sungjun Lim, Seungjin Lee, Keunseok Cho |
| 2025 | End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios. | Kangqi Jing, Wenbin Zhang, Yu Gao |
| 2025 | A Joint Network for Singing Melody Extraction from Polyphonic Music with Attention Aggregation and Self-Consistency Training. | Jiabo Jing, Ying Hu, Hao Huang, Liang He, Zhijian Ou |
| 2025 | Acoustic Features of Mandarin Tone Production in Noise: A Comparison Between Chinese Native Speakers and Korean L2 Learners. | Jinxin Ji, Yiying Hu, Xiaohu Yang, Gang Peng |
| 2025 | Exploring Efficient Directional and Distance Cues for Regional Speech Separation. | Yiheng Jiang, Haoxu Wang, Yafeng Chen, Gang Qiao, Biao Tian |
| 2025 | Whisper-Based Multilingual Alzheimer's Disease Detection and Improvements for Low-Resource Language. | Kaichen Jia, Jinpeng Li, Ke Li, Wei-Qiang Zhang |