| 2025 | Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios. | Gerard I. Gllego, Oriol Pareras, Mart Cortada Garcia, Lucas Takanori, Javier Hernando |
| 2025 | Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs. | Hayato Futami, Emiru Tsunoo, Yosuke Kashiwagi, Yuki Ito, Hassan Shahmohammadi, Siddhant Arora, Shinji Watanabe |
| 2025 | How sibilant spectra shape gender perception in prepubertal children: A voice morphing study. | Riccarda Funk, Melanie Weirich, Adrian P. Simpson |
| 2025 | Are You Being Sarcastic? Prosodic Cues to Irony Perception in German. | Sophia Fnfgeld, Angelika Braun, Katharina Zahner-Ritter |
| 2025 | AuralNet: Hierarchical Attention-based 3D Binaural Localization of Overlapping Speakers. | Linya Fu, Yu Liu, Zhijie Liu, Zedong Yang, Zhong-Qiu Wang, Youfu Li, He Kong |
| 2025 | Backchannel prediction for natural spoken dialog systems using general speaker and listener information. | Yoshinori Fukunaga, Ryota Nishimura, Kengo Ohta, Norihide Kitaoka |
| 2025 | AC/DC: LLM-based Audio Comprehension via Dialogue Continuation. | Yusuke Fujita, Tomoya Mizumoto, Atsushi Kojima, Lianbo Liu, Yui Sudo |
| 2025 | Voice Impression Control in Zero-Shot TTS. | Kenichi Fujita, Shota Horiguchi, Yusuke Ijima |
| 2025 | Echoes of Phonetics: Unveiling Relevant Acoustic Cues for ASR via Feature Attribution. | Dennis Fucci, Marco Gaido, Matteo Negri, Mauro Cettolo, Luisa Bentivogli |
| 2025 | Towards Multi-Level Transcript Segmentation: LoRA Fine-Tuning for Table-of-Contents Generation. | Steffen Freisinger, Philipp Seeberger, Thomas Ranzenberger, Tobias Bocklet, Korbinian Riedhammer |
| 2025 | Private kNN-VC: Interpretable Anonymization of Converted Speech. | Carlos Franzreb, Arnab Das, Tim Polzehl, Sebastian Mller |
| 2025 | Influence of Room Acoustics on Objective Voice Assessment Methods in the Context of Speech and Language Therapy. | Sven Franz, Tanja Grewe, Bernd T. Meyer, Jrg Bitzer |
| 2025 | From Static to Dynamic: Enhancing AAC with Generative Imagery and Zero-Shot TTS. | Juliana Francis, Joakim Gustafson, va Szkely |
| 2025 | Evaluating Wav2Vec2-Bert for Computer-Assisted Pronunciation Training for isiZulu. | Alexandra Fort, Francis Tyers |
| 2025 | Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages. | Seraphina Fong, Marco Matassoni, Alessio Brutti |
| 2025 | Improving Low-Resource Dialect Classification Using Retrieval-based Voice Conversion. | Lea Fischbach, Akbar Karimi, Caroline Kleen, Alfred Lameli, Lucie Flek |
| 2025 | STOPA: A Dataset of Systematic VariaTion Of DeePfake Audio for Open-Set Source Tracing and Attribution. | Anton Firc, Manasi Chhibber, Jagabandhu Mishra, Vishwanath Pratap Singh, Tomi Kinnunen, Kamil Malinka |
| 2025 | Evaluating Deep Speaker Embedding Robustness to Domain, Sampling Rate, and Codec Variations. | Alexandre Ferro Filho, Diogo Fernandes Costa Silva, Pedro Elias Engelberg Silva Borges, Arlindo Rodrigues Galvo Filho |
| 2025 | Efficient Neural and Numerical Methods for High-QualityOnline Speech Spectrogram Inversion via Gradient Theorem. | Andres Fernandez, Juan Azcarreta Ortiz, agdas Bilen, Jesus Monge-Alvarez |
| 2025 | Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling. | Tiantian Feng, Anfeng Xu, Xuan Shi, Somer Bishop, Shrikanth Narayanan |
| 2025 | Developing a Top-tier Framework in Naturalistic Conditions Challenge for Categorized Emotion Prediction: From Speech Foundation Models and Learning Objective to Data Augmentation and Engineering Choices. | Tiantian Feng, Thanathai Lertpetchpun, Dani Byrd, Shrikanth Narayanan |
| 2025 | Rehearsal with Auxiliary-Informed Sampling for Audio Deepfake Detection. | Falih Gozi Febrinanto, Kristen Moore, Chandra Thapa, Jiangang Ma, Vidya Saikrishna, Feng Xia |
| 2025 | An Investigative Study on Recent Sharpness- and Flatness-Based Optimizers for Enhanced Self-Supervised Speaker Verification. | Abderrahim Fathan, Jahangir Alam, Xiaolin Zhu |
| 2025 | Automatic Labeling and Correction of Noisy Labels for Robust Self-Supervised Speaker Verification. | Abderrahim Fathan, Jahangir Alam |
| 2025 | Attention Models and Auditory Transduction Features for Noise Robustness. | Cathal Faolin, Andrew Hines |