| 2025 | GTAnet: Geometry-Guided Temporal Attention for EEG-Based Sound Source Tracking in Cocktail Party Scenarios. | Saurav Pahuja, Gabriel Ivucic, Siqi Cai, Dashanka De Silva, Haizhou Li, Tanja Schultz |
| 2025 | Location-Aware Target Speaker Extraction for Hearing Aids. | Daniel-Jos Alcala Padilla, Nils L. Westhausen, Swati Vivekananthan, Bernd T. Meyer |
| 2025 | Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning. | mer Tarik zyilmaz, Matt Coler, Matias Valdenegro-Toro |
| 2025 | A Comprehensive Real-World Assessment of Audio Watermarking Algorithms: Will They Survive Neural Codecs? | Yigitcan zer, Woosung Choi, Joan Serr, Mayank Kumar Singh, Wei-Hsiang Liao, Yuki Mitsufuji |
| 2025 | CMSP-ST: Cross-modal Mixup with Speech Purification for End-to-End Speech Translation. | Jiale Ou, Hongying Zan |
| 2025 | The Faetar Speech Recognition Benchmark. | Michael Ong, Sean Robertson, Leo Peckham, Alba Jorquera Jimenez de Aberasturi, Paula Arkhangorodsky, Robin Huo, Aman Sakhardande, Mark Hallap, Naomi Nagy, Ewan Dunbar |
| 2025 | The mutual exclusivity bias of bilingual visually grounded speech models. | Dan Oneata, Leanne Nortje, Yevgen Matusevych, Herman Kamper |
| 2025 | Differentiable K-means for Fully-optimized Discrete Token-based ASR. | Kentaro Onda, Yosuke Kashiwagi, Emiru Tsunoo, Hayato Futami, Shinji Watanabe |
| 2025 | Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora. | Kentaro Onda, Keisuke Imoto, Satoru Fukayama, Daisuke Saito, Nobuaki Minematsu |
| 2025 | Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data. | Kentaro Onda, Keisuke Imoto, Satoru Fukayama, Daisuke Saito, Nobuaki Minematsu |
| 2025 | Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech. | Danilo de Oliveira, Julius Richter, Jean-Marie Lemercier, Simon Welker, Timo Gerkmann |
| 2025 | Simultaneous Speech Translation Integrated Compact Multiple Sound Spot Synthesis System On A Laptop Carried Out With A Backpack. | Takuma Okamoto, Michiyo Kono |
| 2025 | Simultaneous Masked and Unmasked Decoding with Speculative Decoding Masking for Fast ASR without Accuracy Loss. | Koji Okabe, Hitoshi Yamamoto |
| 2025 | Improving Cross-Attention based on Positional Alignment during Inference for Robust Long-form Speech Recognition. | Changhan Oh, Kiyoung Park, Jeom-ja Kang, Woo Yong Choi, Hwa Jeon Song |
| 2025 | Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning. | Hien Ohnaka, Yuma Shirahata, Byeongseon Park, Ryuichi Yamamoto |
| 2025 | Multimodal and Multitask Learning for Predicting Multiple Scores in L2 English Speech. | Sehyun Oh, Sunhee Kim, Minhwa Chung |
| 2025 | Multilingual Speech Assessment Using Cross-Attention and Multitask Learning. | Sehyun Oh, Minhwa Chung, Sunhee Kim |
| 2025 | Towards a Japanese Full-duplex Spoken Dialogue System. | Atsumoto Ohashi, Shinya Iizuka, Jingjing Jiang, Ryuichiro Higashinaka |
| 2025 | GST-BERT-TTS: Prosody Prediction Without Accentual Labels For Multi-Speaker TTS Using BERT With Global Style Tokens. | Tadashi Ogura, Takuma Okamoto, Yamato Ohtani, Erica Cooper, Tomoki Toda, Hisashi Kawai |
| 2025 | Voice Activity-based Text Segmentation for ASR Text Denormalization. | Sashi Novitasari, Takashi Fukuda, Gakuto Kurata |
| 2025 | Improving End-to-end Mixed-case ASR with Knowledge Distillation and Integration of Voice Activity Cues. | Sashi Novitasari, Takashi Fukuda, Gakuto Kurata |
| 2025 | Efficient Streaming Speech Quality Prediction with Spiking Neural Networks. | Mattias Nilsson, Riccardo Miccini, Julian Rossbroich, Clment Laroche, Tobias Piechowiak, Friedemann Zenke |
| 2025 | Towards Pre-training an Effective Respiratory Audio Foundation Model. | Daisuke Niizumi, Daiki Takeuchi, Masahiro Yasuda, Binh Thien Nguyen, Yasunori Ohishi, Noboru Harada |
| 2025 | Foundation Model Hidden Representations for Heart Rate Estimation from Auscultation. | Jingping Nie, Tien Dung Tran, Karan Thakkar, Vasudha Kowtha, Jon Huang, Carlos Avendao, Erdrin Azemi, Vikramjit Mitra |
| 2025 | On the cross-modal makeup of charisma: Insights from a field-data analysis. | Oliver Niebuhr |