| 2025 | Multimodal Dynamics of Hand Gestures and Pauses in Multiparty Interactions. | Delphine Charuau, Naomi Harte |
| 2025 | A-SMiLE: Affective Sparse Mixture-of-Experts Adapter with Multi-Task Learning for Spoken Dialogue Models. | Yi-Wen Chao, Yizhou Peng, Dianwen Ng, Yukun Ma, Chongjia Ni, Bin Ma, Eng Siong Chng |
| 2025 | Universal Speech Enhancement with Regression and Generative Mamba. | Rong Chao, Rauf Nasretdinov, Yu-Chiang Frank Wang, Ante Jukic, Szu-Wei Fu, Yu Tsao |
| 2025 | Relative cue weighting in multilingual stop voicing production. | Le Xuan Chan, Annika Heuser |
| 2025 | Multimodal Fusion with Semi-Supervised Learning Minimizes Annotation Quantity for Modeling Videoconference Conversation Experience. | Andrew Chang, Chenkai Hu, Ji Qi, Zhuojian Wei, Kexin Zhang, Viswadruth Akkaraju, David Poeppel, Dustin Freeman |
| 2025 | DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models. | Heng-Jui Chang, Hongyu Gong, Changhan Wang, James R. Glass, Yu-An Chung |
| 2025 | Beyond Attacks: Advancing Fake Speech Detection with Attack-Agnostic Methods. | Shilpa Chandra, Akansha Tyagi, Shiven Patel, Padmanabhan Rajan |
| 2025 | EmotionRankCLAP: Bridging Natural Language Speaking Styles and Ordinal Speech Emotion via Rank-N-Contrast. | Shreeram Suresh Chandra, Lucas Goncalves, Junchen Lu, Carlos Busso, Berrak Sisman |
| 2025 | Song Form-aware Full-Song Text-to-Lyrics Generation with Multi-Level Granularity Syllable Count Control. | Yunkee Chae, Eunsik Shin, Suntae Hwang, Seungryeol Paik, Kyogu Lee |
| 2025 | Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ. | Yunkee Chae, Kyogu Lee |
| 2025 | "Dyadosyncrasy", Idiosyncrasy and Demographic Factors in Turn-Taking. | Julio Cesar Cavalcanti, Gabriel Skantze |
| 2025 | NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference. | Edresson Casanova, Paarth Neekhara, Ryan Langman, Shehzeen Hussain, Subhankar Ghosh, Xuesong Yang, Ante Jukic, Jason Li, Boris Ginsburg |
| 2025 | Exploring Linear Variant Transformers and k-NN Memory Inference for Long-Form ASR. | Carlos Carvalho, Jinchuan Tian, William Chen, Yifan Peng, Alberto Abad, Shinji Watanabe |
| 2025 | SardinianVoxes: A Speech Recognition Dataset for the Sardinian Languages. | Salvatore Carta, Alessandro Giuliani, Marco Manolo Manca, Mirko Marras, Leonardo Piano |
| 2025 | Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering. | Andrs Carofilis, Pradeep Rangappa, Srikanth R. Madikeri, Shashi Kumar, Sergio Burdisso, Jeena J. Prakash, Esa Villatoro-Tello, Petr Motlcek, Bidisha Sharma, Kadri Hacioglu, Shankar Venkatesan, Saurabh Vyas, Andreas Stolcke |
| 2025 | Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach. | Umberto Cappellazzo, Minsu Kim, Stavros Petridis, Daniele Falavigna, Alessio Brutti |
| 2025 | Pitch Target Realization in Putonghua Tone Production of Children from Dialect-Speaking Regions. | Mengxue Cao, Tianxin Zheng, Jiewen Zheng |
| 2025 | ASR-based segmentation for the analysis of larger child-speech datasets: Performance evaluation on vowels from Australian-English speaking children aged 4 to 11 years. | Rui Cai, Titia Benders |
| 2025 | Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework. | Kyungguen Byun, Jason Filos, Erik Visser, Sunkuk Moon |
| 2025 | EmoDB 2.0: A Database of Emotional Speech in a World that is not Black or White but Grey. | Felix Burkhardt, Oliver Schrfer, Uwe D. Reichel, Hagen Wierstorf, Anna Derington, Florian Eyben, Bjrn W. Schuller |
| 2025 | Evaluating Parameter Sharing for Spoofing-Aware Speaker Verification: A Case Study on the ASVspoof 5 Dataset. | Aykut Bker, Oguzhan Kurnaz, Sule Bekiryazici, Selim Can Demirtas, Cemal Hanili |
| 2025 | Equivalence and differences: Formant patterns of labialization and pharyngealization in Tashlhiyt. | Philipp Buech, Anne Hermes, Rachid Ridouane |
| 2025 | Pushing the Limits of End-to-End Diarization. | Samuel J. Broughton, Lahiru Samarakoon |
| 2025 | Agent-based modelling, sound change, and metaphony in Southern Italian varieties of Italo-Romance. | Lilian von Bressensdorf, Pia Greca, Jonathan Harrington |
| 2025 | Pitfalls and Limits in Automatic Dementia Assessment. | Franziska Braun, Christopher Witzl, Andreas Erzigkeit, Hartmut Lehfeld, Thomas Hillemacher, Tobias Bocklet, Korbinian Riedhammer |