| 2025 | GLCLAP: A Novel Contrastive Learning Pre-trained Model for Contextual Biasing in ASR. | Yuxiang Kong, Fan Cui, Liyong Guo, Heinrich Dinkel, Lichun Fan, Junbo Zhang, Jian Luan |
| 2025 | JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles. | Yuto Kondo, Hirokazu Kameoka, Kou Tanaka, Takuhiro Kaneko |
| 2025 | Can Multimodal Foundation Models Help Analyze Child-Inclusive Autism Diagnostic Videos? | Aditya Kommineni, Digbalay Bose, Tiantian Feng, So Hyun Kim, Helen Tager-Flusberg, Somer Bishop, Catherine Lord, Sudarsana Kadiri, Shrikanth Narayanan |
| 2025 | Towards Classification of Typical and Atypical Disfluencies: A Self Supervised Representation Approach. | Priyanka Kommagouni, Pragya Khanna, Vamshiraghusimha Narasinga, Anirudh Bocha, Anil Kumar Vuppala |
| 2025 | Leveraging Unlabeled Audio for Audio-Text Contrastive Learning via Audio-Composed Text Features. | Tatsuya Komatsu, Hokuto Munakata, Yuchi Ishikawa |
| 2025 | Granary: Speech Recognition and Translation Dataset in 25 European Languages. | Nithin Rao Koluguri, Monica Sekoyan, George Zelenfroynd, Sasha Meister, Shuoyang Ding, Sofia Kostandian, He Huang, Nikolay Karpov, Jagadeesh Balam, Vitaly Lavrukhin, Yifan Peng, Sara Papi, Marco Gaido, Alessio Brutti, Boris Ginsburg |
| 2025 | Improving Generalization of End-to-End ASR through Diversity and Independence Regularization. | Ye-Eun Ko, Mun-Hak Lee, Dong-Hyun Kim, Joon-Hyuk Chang |
| 2025 | What do self-supervised speech models know about Dutch? Analyzing advantages of language-specific pre-training. | Marianne de Heer Kloots, Hosein Mohebbi, Charlotte Pouw, Gaofei Shen, Willem H. Zuidema, Martijn Bentum |
| 2025 | A Practitioner's Guide to Building ASR Models for Low-Resource Languages: A Case Study on Scottish Gaelic. | Ondrej Klejch, William Lamb, Peter Bell |
| 2025 | Open-Set Source Tracing of Audio Deepfake Systems. | Nicholas Klein, Hemlata Tak, Elie Khoury |
| 2025 | Who knows best? Effects of speech disfluencies on incentivized decision-making. | Ambika Kirkland, Jens Edlund |
| 2025 | FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition. | Jongsuk Kim, Jaemyung Yu, Minchan Kwon, Junmo Kim |
| 2025 | Spatially Weighted Contrastive Learning for Robust Sound Source Localization. | Hyun-Soo Kim, Da-Hee Yang, Joon-Hyuk Chang |
| 2025 | SpeechMLC: Speech Multi-label Classification. | Miseul Kim, Seyun Um, Hyeonjin Cha, Hong-Goo Kang |
| 2025 | Stack Less, Repeat More: A Block Reusing Approach for Progressive Speech Enhancement. | Jangyeon Kim, Ui-Hyeop Shin, Jaehyun Ko, Hyung-Min Park |
| 2025 | Enhancing Audio Deepfake Detection by Improving Representation Similarity of Bonafide Speech. | Seung-bin Kim, Hyun-seo Shin, Jungwoo Heo, Chan-yeong Lim, Kyo-Won Koo, Jisoo Son, Sanghyun Hong, Souhwan Jung, Ha-Jin Yu |
| 2025 | Rethinking Leveraging Pre-Trained Multi-Layer Representations for Speaker Verification. | Jin Sob Kim, Hyun Joon Park, Wooseok Shin, Sung Won Han |
| 2025 | Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries. | Minyoung Kim, Sehwan Park, Sungmin Cha, Paul Hongsuck Seo |
| 2025 | Language-Agnostic Suicidal Risk Detection Using Large Language Models. | June-Woo Kim, Wonkyo Oh, Haram Yoon, Sung-Hoon Yoon, Dae-Jin Kim, Dong-Ho Lee, Sang-Yeol Lee, Chan-Mo Yang |
| 2025 | Towards an Ultra-Low-Delay Neural Audio Coding with Computational Efficiency. | Byeong Hyeon Kim, Hyungseob Lim, Inseon Jang, Hong-Goo Kang |
| 2025 | Quadruple Path Modeling with Latent Feature Transfer for Permutation-free Continuous Speech Separation. | Jihyun Kim, Doyeon Kim, Hyewon Han, Jinyoung Lee, Jonguk Yoo, Chang Woo Han, Jeongook Song, Hoon-Young Cho, Hong-Goo Kang |
| 2025 | Naturalness-Aware Curriculum Learning with Dynamic Temperature for Speech Deepfake Detection. | Taewoo Kim, Guisik Kim, Choongsang Cho, Young Han Lee |
| 2025 | Mamba-based Hybrid Model for Speech Enhancement. | Se-Ha Kim, Tae-Gyeong Kim, Chang-Jae Chun |
| 2025 | Learning Phonetic Context-Dependent Viseme for Enhancing Speech-Driven 3D Facial Animation. | Hyung Kyu Kim, Hak Gu Kim |
| 2025 | Towards Human-like Multimodal Conversational Agent by Generating Engaging Speech. | Taesoo Kim, Yongsik Jo, Hyunmin Song, Taehwan Kim |