Skip to content

IEEE Automatic Speech Recognition and Understanding Workshop

ASRU

C

CORE rank

CORE rank (raw)

C

Fields of research

Artificial Intelligence

Papers indexed

1,323

2007–2025

Papers per year

2007209 peak2025

ASRU papers

1,323 records sourced from DBLP. Search titles, filter by year, sort by recency.

YearTitleAuthors
2023Multi Transcription-Style Speech Transcription Using Attention-Based Encoder-Decoder Model.Yan Huang, Piyush Behre, Guoli Ye, Shawn Chang, Yifan Gong
2023CTC Blank Triggered Dynamic Layer-Skipping for Efficient Ctc-Based Speech Recognition.Junfeng Hou, Peiyao Wang, Jincheng Zhang, Meng Yang, Minwei Feng, Jingcheng Yin
2023Mask-Conformer: Augmenting Conformer with Mask-Predict Decoder.Yosuke Higuchi, Andrew Rosenberg, Yuan Wang, Murali Karthick Baskar, Bhuvana Ramabhadran
2023ED-CEC: Improving Rare word Recognition Using ASR Postprocessing Based on Error Detection and Context-Aware Error Correction.Jiajun He, Zekun Yang, Tomoki Toda
2023Voiceextender: Short-Utterance Text-Independent Speaker Verification With Guided Diffusion Model.Yayun He, Zuheng Kang, Jianzong Wang, Junqing Peng, Jing Xiao
2023Robust Recognition of Speaker Emotion With Difference Feature Extraction Using a Few Enrollment Utterances.Daichi Hayakawa, Takehiko Kagoshima, Kenji Iwata, Norbert Braunschweiler, Rama Doddipatla
2023Improving Severity Preservation of Healthy-to-Pathological Voice Conversion With Global Style Tokens.Bence Mark Halpern, Wen-Chin Huang, Lester Phillip Violeta, R. J. J. H. van Son, Tomoki Toda
2023Boosting Modality Representation With Pre-Trained Models and Multi-Task Training for Multimodal Sentiment Analysis.Jiarui Hai, Yu-Jeh Liu, Mounya Elhilali
2023HIGNN-TTS: Hierarchical Prosody Modeling With Graph Neural Networks for Expressive Long-Form TTS.Dake Guo, Xinfa Zhu, Liumeng Xue, Tao Li, Yuanjun Lv, Yuepeng Jiang, Lei Xie
2023Using Joint Training Speaker Encoder With Consistency Loss to Achieve Cross-Lingual Voice Conversion and Expressive Voice Conversion.Houjian Guo, Chaoran Liu, Carlos Toshinori Ishi, Hiroshi Ishiguro
2023QUICKVC: A Lightweight VITS-Based Any-to-Many Voice Conversion Model using ISTFT for Faster Conversion.Houjian Guo, Chaoran Liu, Carlos Toshinori Ishi, Hiroshi Ishiguro
2023Acoustics-Text Dual-Modal Joint Representation Learning for Cover Song Identification.Yanmei Gu, Jing Li, Jiayi Zhou, Zhiming Wang, Huijia Zhu
2023Joint Audio and Speech Understanding.Yuan Gong, Alexander H. Liu, Hongyin Luo, Leonid Karlinsky, James R. Glass
2023Learning From Flawed Data: Weakly Supervised Automatic Speech Recognition.Dongji Gao, Hainan Xu, Desh Raj, Leibny Paola Garca-Perera, Daniel Povey, Sanjeev Khudanpur
2023E3 TTS: Easy End-to-End Diffusion-Based Text To Speech.Yuan Gao, Nobuyuki Morioka, Yu Zhang, Nanxin Chen
2023GPU-Accelerated Wfst Beam Search Decoder for CTC-Based Speech Recognition.Daniel Galvez, Tim Kaldewey
2023Robust End-to-End Diarization with Domain Adaptive Training and Multi-Task Learning.Ivan Fung, Lahiru Samarakoon, Samuel J. Broughton
2023LV-CTC: Non-Autoregressive ASR With CTC and Latent Variable Models.Yuya Fujita, Shinji Watanabe, Xuankai Chang, Takashi Maekaku
2023No Pitch Left Behind: Addressing Gender Unbalance In Automatic Speech Recognition Through Pitch Manipulation.Dennis Fucci, Marco Gaido, Matteo Negri, Mauro Cettolo, Luisa Bentivogli
2023CAMSAT: Augmentation Mix and Self-Augmented Training Clustering for Self-Supervised Speaker Recognition.Abderrahim Fathan, Jahangir Alam
2023MUST: A Multilingual Student-Teacher Learning Approach for Low-Resource Speech Recognition.Muhammad Umar Farooq, Rehan Ahmad, Thomas Hain
2023Generalized Zero-Shot Audio-to-Intent Classification.Veera Raghavendra Elluru, Devang Kulshreshtha, Rohit Paturi, Sravan Bodapati, Srikanth Ronanki
2023Enhancing Expressivity Transfer in Textless Speech-to-Speech Translation.Jarod Duret, Benjamin O'Brien, Yannick Estve, Titouan Parcollet
2023Leveraging Multilingual Self-Supervised Pretrained Models for Sequence-to-Sequence End-to-End Spoken Language Understanding.Pavel Denisov, Ngoc Thang Vu
2023Can Unpaired Textual Data Replace Synthetic Speech in ASR Model Adaptation?Pasquale D'Alterio, Christian Hensel, Bashar Awwad Shiekh Hasan
351375 of 1,323← PreviousNext →

Comparable venues

Other A*/A conferences filed under the same field of research.