| 2025 | Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification. | Badr M. Abdullah, Matthew Baas, Bernd Mbius, Dietrich Klakow |
| 2025 | DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching. | Wei Chen, Binzhu Sha, Dan Luo, Jing Yang, Zhuo Wang, Fan Fan, Zhiyong Wu |
| 2025 | Disentangling Speaker and Content in Pre-trained Speech Models with Latent Diffusion for Robust Speaker Verification. | Zhe Li, Man-Wai Mak, Jen-Tzung Chien, Mert Pilanci, Zezhong Jin, Helen Meng |
| 2025 | Finetune Large Pre-Trained Model Based on Frequency-Wise Multi-Query Attention Pooling for Anomalous Sound Detection. | Nan Jiang, Yan Song, Qing Gu, Haoyu Song, Lirong Dai, Ian McLoughlin |
| 2025 | An Effective Anomalous Sound Detection Method Based on Global and Local Attribute Mining. | Nan Jiang, Yan Song, Qing Gu, Haoyu Song, Lirong Dai, Ian McLoughlin |
| 2025 | Modeling Multi-Turn Spoken Language Understanding with Dynamic Graph Convolutional Networks. | Yi Huang, Si Chen, Jingyu Yao, Junlan Feng |
| 2025 | StarGAN-Aug: A Cross-domain Fault Audio Generation Method for High-performance Fault Diagnosis of Power Transformers. | Ben Niu, Yangjie Wei, Gang Yang, Yuqiao Wang, Shengling Yu |
| 2025 | VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schrdinger Bridge. | Zijing Zhao, Kai Wang, Hao Huang, Ying Hu, Liang He, Jichen Yang |
| 2025 | Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset. | Rui Liu, Pu Gao, Jiatian Xi, Berrak Sisman, Carlos Busso, Haizhou Li |
| 2025 | MADUV: The 1st INTERSPEECH Mice Autism Detection via Ultrasound Vocalization Challenge. | Zijiang Yang, Meishu Song, Xin Jing, Haojie Zhang, Kun Qian, Bin Hu, Kota Tamada, Toru Takumi, Bjrn W. Schuller, Yoshiharu Yamamoto |
| 2025 | Can AI Understand Mandarin Speech Prosody? A Framework and Benchmark Showcase. | Zilong Wang, Xiaoxue Zhang, Xinyang Jiang, Kaitao Song, Jue Yu |
| 2025 | Voxplorer: Voice data exploration and projection in an interactive dashboard. | Alessandro De Luca, Srikanth R. Madikeri, Volker Dellwo |
| 2025 | BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM. | Xun Gong, Anqi Lv, Wangyou Zhang, Zhiming Wang, Huijia Zhu, Yanmin Qian |
| 2025 | Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction. | Xiangyu Zhang, Daijiao Liu, Tianyi Xiao, Cihan Xiao, Tnde Szalay, Mostafa Shahin, Beena Ahmed, Julien Epps |
| 2025 | Breaking Resource Barriers in Speech Emotion Recognition via Data Distillation. | Yi Chang, Zhao Ren, Zhonghao Zhao, Thanh Tam Nguyen, Kun Qian, Tanja Schultz, Bjrn W. Schuller |
| 2025 | Exploring the Power of Empirical Mode Decomposition for Sensing the Sound of Silence: A Pilot Study on Mice Autism Detection via Ultrasonic Vocalisation. | Chenhao Wu, Xiangjun Cai, Haojie Zhang, Tianrui Jia, Yilu Deng, Kun Qian, Bjrn W. Schuller, Yoshiharu Yamamoto, Jiang Liu |
| 2025 | Collecting, Curating, and Annotating Good Quality Speech deepfake dataset for Famous Figures: Process and Challenges. | Hashim Ali, Surya Subramani, Raksha Varahamurthy, Nithin Sai Adupa, Lekha Bollinani, Hafiz Malik |
| 2025 | The Interspeech 2025 Speech Accessibility Project Challenge. | Xiuwen Zheng, Bornali Phukon, Jonghwan Na, Ed Cutrell, Kyu J. Han, Mark Hasegawa-Johnson, Pan-Pan Jiang, Aadhrik Kuila, Colin Lea, Bob MacDonald, Gautam Varma Mantena, Venkatesh Ravichandran, Leda Sari, Katrin Tomanek, Chang D. Yoo, Chris Zwilling |
| 2025 | Spectrotemporal Modulation: Efficient and Interpretable Feature Representation for Classifying Speech, Music, and Environmental Sounds. | Andrew Chang, Yike Li, Iran R. Roman, David Poeppel |
| 2025 | OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning. | Yifan Peng, Muhammad Shakeel, Yui Sudo, William Chen, Jinchuan Tian, Chyi-Jiunn Lin, Shinji Watanabe |
| 2025 | Dynamic Acoustic Model Architecture Optimization in Training for ASR. | Jingjing Xu, Zijian Yang, Albert Zeyer, Eugen Beck, Ralf Schlter, Hermann Ney |
| 2025 | VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation. | Yubin Kim, Taehan Kim, Wonjune Kang, Eugene Park, Joonsik Yoon, Dongjae Lee, Xin Liu, Daniel McDuff, Hyeonhoon Lee, Cynthia Breazeal, Hae Won Park |
| 2025 | GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer. | Minghui Fang, Shengpeng Ji, Jialong Zuo, Xize Cheng, Wenrui Liu, Xiaoda Yang, Ruofan Hu, Jieming Zhu, Zhou Zhao |
| 2025 | On the Within-class Variation Issue in Alzheimer's Disease Detection. | Jiawen Kang, Dongrui Han, Lingwei Meng, Jingyan Zhou, Jinchao Li, Xixin Wu, Helen Meng |
| 2025 | When focus shapes the flow: prosodic restructuring in Mandarin complex nominals. | Anqi Xu, Yu-Yin Hsu |