Skip to content

IEEE Automatic Speech Recognition and Understanding Workshop

ASRU

C

CORE rank

CORE rank (raw)

C

Fields of research

Artificial Intelligence

Papers indexed

1,323

2007–2025

Papers per year

2007209 peak2025

ASRU papers

1,323 records sourced from DBLP. Search titles, filter by year, sort by recency.

YearTitleAuthors
2025Utilizing Kolmogorov-Arnold Network in Self-Supervised Learning for Speaker Diarization.Minh Vu, Phuong Tuan Dat, Kah Kuan Teh, Van Tuan Nguyen, Tran Huy Dat
2025The JHU-MIT System for NIST SRE24: Post-Evaluation Analysis.Jess Villalba, Jonas Borgstrom, Prabhav Singh, Leibny Paola Garca, Pedro A. Torres-Carrasquillo, Najim Dehak
2025Speaker Style-Aware Phoneme Anchoring For Improved Cross-Lingual Speech Emotion Recognition.Shreya G. Upadhyay, Carlos Busso, Chi-Chun Lee
2025Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training.Sathvik Udupa, Shinji Watanabe, Petr Schwarz, Jan Cernock
2025Speech Synthesis From Continuous Features Using Per-Token Latent Diffusion.Arnon Turetzky, Avihu Dekel, Nimrod Shabtay, Slava Shechtman, David Haws, Hagai Aronowitz, Ron Hoory, Yossi Adi
2025Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting.Emiru Tsunoo, Hayato Futami, Yosuke Kashiwagi, Siddhant Arora, Shinji Watanabe
2025Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition.Yuan Tseng, Titouan Parcollet, Rogier C. van Dalen, Shucong Zhang, Sourav Bhattacharya
2025Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs.Wei-Cheng Tseng, David Harwath
2025CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition.Yun-Shao Tsai, Yi-Cheng Lin, Huang-Cheng Chou, Hung-Yi Lee
2025Meta Audiobox Aesthetics: Unified Automatic Assessment for Speech, Music and Sound.Andros Tjandra, Yi-Chiao Wu, Baishan Guo, John Hoffman, Brian Ellis, Apoorv Vyas, Bowen Shi, Sanyuan Chen, Matt Le, Nick Zacharov, Carleigh Wood, Ann Lee, Wei-Ning Hsu
2025Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis.Wenjie Tian, Xinfa Zhu, Hanke Xie, Zhen Ye, Wei Xue, Lei Xie
2025Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM.Thomas Thebaud, Yen-Ju Lu, Matthew Wiesner, Peter Viechnicki, Najim Dehak
2025More Similar than Dissimilar: Modeling Annotators for Cross-Corpus Speech Emotion Recognition.James Tavernor, Emily Mower Provost
2025LauraTSE: Target Speaker Extraction using Auto-Regressive Decoder-Only Language Models.Beilong Tang, Bang Zeng, Ming Li
2025SEF-MK: Speaker-Embedding-Free Voice Anonymization through Multi-k-means Quantization.Beilong Tang, Xiaoxiao Miao, Xin Wang, Ming Li
2025Reliability of Lexical Richness Measures for ASR-Based Children's Speech Assessment.Imen Talbi, Christopher Gebauer, Lars Rumberg, Edith Beaulac, Hanna Ehlert, Jrn Ostermann
2025Acoustic to Articulatory Speech Inversion for Children with Velopharyngeal Insufficiency.Saba Tabatabaee, Suzanne Boyce, Liran Oren, Mark Tiede, Carol Y. Espy-Wilson
2025Continual Pre-training for Codec-Based Speech LLMs: Balancing Understanding and Generation.Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu
2025PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning.Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe
2025Group Relative Policy Optimization for Speech Recognition.Prashanth Gurunath Shivakumar, Yile Gu, Ankur Gandhe, Ivan Bulyko
2025VERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration.Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe
2025Unifying Model and Layer Fusion for Speech Foundation Models.Yi-Jen Shih, David Harwath
2025Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition.Hao Shi, Yusuke Fujita, Tomoya Mizumoto, Lianbo Liu, Atsushi Kojima, Yui Sudo
2025L2 Vowel Acquisition Analysis at the Inventory Level.Shuju Shi
2025PhysMVNet: Physics-Informed End-to-End MVDR Beamformer with Residual Spectral Mapping for Multichannel Speech Enhancement.Xingyu Shen, Wei-Ping Zhu, Benot Champagne
5175 of 1,323← PreviousNext →

Comparable venues

Other A*/A conferences filed under the same field of research.