| 2023 | Multi Transcription-Style Speech Transcription Using Attention-Based Encoder-Decoder Model. | Yan Huang, Piyush Behre, Guoli Ye, Shawn Chang, Yifan Gong |
| 2023 | CTC Blank Triggered Dynamic Layer-Skipping for Efficient Ctc-Based Speech Recognition. | Junfeng Hou, Peiyao Wang, Jincheng Zhang, Meng Yang, Minwei Feng, Jingcheng Yin |
| 2023 | Mask-Conformer: Augmenting Conformer with Mask-Predict Decoder. | Yosuke Higuchi, Andrew Rosenberg, Yuan Wang, Murali Karthick Baskar, Bhuvana Ramabhadran |
| 2023 | ED-CEC: Improving Rare word Recognition Using ASR Postprocessing Based on Error Detection and Context-Aware Error Correction. | Jiajun He, Zekun Yang, Tomoki Toda |
| 2023 | Voiceextender: Short-Utterance Text-Independent Speaker Verification With Guided Diffusion Model. | Yayun He, Zuheng Kang, Jianzong Wang, Junqing Peng, Jing Xiao |
| 2023 | Robust Recognition of Speaker Emotion With Difference Feature Extraction Using a Few Enrollment Utterances. | Daichi Hayakawa, Takehiko Kagoshima, Kenji Iwata, Norbert Braunschweiler, Rama Doddipatla |
| 2023 | Improving Severity Preservation of Healthy-to-Pathological Voice Conversion With Global Style Tokens. | Bence Mark Halpern, Wen-Chin Huang, Lester Phillip Violeta, R. J. J. H. van Son, Tomoki Toda |
| 2023 | Boosting Modality Representation With Pre-Trained Models and Multi-Task Training for Multimodal Sentiment Analysis. | Jiarui Hai, Yu-Jeh Liu, Mounya Elhilali |
| 2023 | HIGNN-TTS: Hierarchical Prosody Modeling With Graph Neural Networks for Expressive Long-Form TTS. | Dake Guo, Xinfa Zhu, Liumeng Xue, Tao Li, Yuanjun Lv, Yuepeng Jiang, Lei Xie |
| 2023 | Using Joint Training Speaker Encoder With Consistency Loss to Achieve Cross-Lingual Voice Conversion and Expressive Voice Conversion. | Houjian Guo, Chaoran Liu, Carlos Toshinori Ishi, Hiroshi Ishiguro |
| 2023 | QUICKVC: A Lightweight VITS-Based Any-to-Many Voice Conversion Model using ISTFT for Faster Conversion. | Houjian Guo, Chaoran Liu, Carlos Toshinori Ishi, Hiroshi Ishiguro |
| 2023 | Acoustics-Text Dual-Modal Joint Representation Learning for Cover Song Identification. | Yanmei Gu, Jing Li, Jiayi Zhou, Zhiming Wang, Huijia Zhu |
| 2023 | Joint Audio and Speech Understanding. | Yuan Gong, Alexander H. Liu, Hongyin Luo, Leonid Karlinsky, James R. Glass |
| 2023 | Learning From Flawed Data: Weakly Supervised Automatic Speech Recognition. | Dongji Gao, Hainan Xu, Desh Raj, Leibny Paola Garca-Perera, Daniel Povey, Sanjeev Khudanpur |
| 2023 | E3 TTS: Easy End-to-End Diffusion-Based Text To Speech. | Yuan Gao, Nobuyuki Morioka, Yu Zhang, Nanxin Chen |
| 2023 | GPU-Accelerated Wfst Beam Search Decoder for CTC-Based Speech Recognition. | Daniel Galvez, Tim Kaldewey |
| 2023 | Robust End-to-End Diarization with Domain Adaptive Training and Multi-Task Learning. | Ivan Fung, Lahiru Samarakoon, Samuel J. Broughton |
| 2023 | LV-CTC: Non-Autoregressive ASR With CTC and Latent Variable Models. | Yuya Fujita, Shinji Watanabe, Xuankai Chang, Takashi Maekaku |
| 2023 | No Pitch Left Behind: Addressing Gender Unbalance In Automatic Speech Recognition Through Pitch Manipulation. | Dennis Fucci, Marco Gaido, Matteo Negri, Mauro Cettolo, Luisa Bentivogli |
| 2023 | CAMSAT: Augmentation Mix and Self-Augmented Training Clustering for Self-Supervised Speaker Recognition. | Abderrahim Fathan, Jahangir Alam |
| 2023 | MUST: A Multilingual Student-Teacher Learning Approach for Low-Resource Speech Recognition. | Muhammad Umar Farooq, Rehan Ahmad, Thomas Hain |
| 2023 | Generalized Zero-Shot Audio-to-Intent Classification. | Veera Raghavendra Elluru, Devang Kulshreshtha, Rohit Paturi, Sravan Bodapati, Srikanth Ronanki |
| 2023 | Enhancing Expressivity Transfer in Textless Speech-to-Speech Translation. | Jarod Duret, Benjamin O'Brien, Yannick Estve, Titouan Parcollet |
| 2023 | Leveraging Multilingual Self-Supervised Pretrained Models for Sequence-to-Sequence End-to-End Spoken Language Understanding. | Pavel Denisov, Ngoc Thang Vu |
| 2023 | Can Unpaired Textual Data Replace Synthetic Speech in ASR Model Adaptation? | Pasquale D'Alterio, Christian Hensel, Bashar Awwad Shiekh Hasan |