| 2023 | Flap: Fast Language-Audio Pre-Training. | Ching-Feng Yeh, Po-Yao Huang, Vasu Sharma, Shang-Wen Li, Gargi Ghosh |
| 2023 | Preserving Phonemic Distinctions For Ordinal Regression: A Novel Loss Function For Automatic Pronunciation Assessment. | Bi-Cheng Yan, Hsin-Wei Wang, Yi-Cheng Wang, Jiun-Ting Li, Chi-Han Lin, Berlin Chen |
| 2023 | Investigating The Effect of Language Models in Sequence Discriminative Training For Neural Transducers. | Zijian Yang, Wei Zhou, Ralf Schlter, Hermann Ney |
| 2023 | FAT-HuBERT: Front-End Adaptive Training of Hidden-Unit BERT For Distortion-Invariant Robust Speech Recognition. | Dongning Yang, Wei Wang, Yanmin Qian |
| 2023 | Towards Matching Phones and Speech Representations. | Gene-Ping Yang, Hao Tang |
| 2023 | Fast-Hubert: an Efficient Training Framework for Self-Supervised Speech Representation Learning. | Guanrou Yang, Ziyang Ma, Zhisheng Zheng, Yakun Song, Zhikang Niu, Xie Chen |
| 2023 | Generative Speech Recognition Error Correction With Large Language Models and Task-Activating Prompting. | Chao-Han Huck Yang, Yile Gu, Yi-Chieh Liu, Shalini Ghosh, Ivan Bulyko, Andreas Stolcke |
| 2023 | Towards Robust Packet Loss Concealment System With ASR-Guided Representations. | Da-Hee Yang, Joon-Hyuk Chang |
| 2023 | Transcribing and Aligning Conversational Speech: A Hybrid Pipeline Applied to French Conversations. | Hiroyoshi Yamasaki, Jrme Louradour, Julie Hunter, Laurent Prvot |
| 2023 | A Comparative Study of Voice Conversion Models With Large-Scale Speech and Singing Data: The T13 Systems for the Singing Voice Conversion Challenge 2023. | Ryuichi Yamamoto, Reo Yoneyama, Lester Phillip Violeta, Wen-Chin Huang, Tomoki Toda |
| 2023 | Partial Rank Similarity Minimization Method for Quality MOS Prediction of Unseen Speech Synthesis Systems in Zero-Shot and Semi-Supervised Setting. | Hemant Yadav, Erica Cooper, Junichi Yamagishi, Sunayana Sitaram, Rajiv Ratn Shah |
| 2023 | KAQ: A Non-Intrusive Stacking Framework for Mean Opinion Score Prediction with Multi-Task Learning. | Chenglin Xu, Xiguang Zheng, Chen Zhang, Chao Zhou, Qi Huang, Bing Yu |
| 2023 | A Weakly-Supervised Streaming Multilingual Speech Model with Truly Zero-Shot Capability. | Jian Xue, Peidong Wang, Jinyu Li, Eric Sun |
| 2023 | MBTFNET: Multi-Band Temporal-Frequency Neural Network for Singing Voice Enhancement. | Weiming Xu, Zhouxuan Chen, Zhili Tan, Shubo Lv, Runduo Han, Wenjiang Zhou, Weifeng Zhao, Lei Xie |
| 2023 | On Decoder-Only Architecture For Speech-to-Text and Large Language Model Integration. | Jian Wu, Yashesh Gaur, Zhuo Chen, Long Zhou, Yimeng Zhu, Tianrui Wang, Jinyu Li, Shujie Liu, Bo Ren, Linquan Liu, Yu Wu |
| 2023 | Semi-Supervised Multi-Channel Speaker Diarization With Cross-Channel Attention. | Shilong Wu, Jun Du, Mao-Kui He, Shutong Niu, Hang Chen, Haitao Tang, Chin-Hui Lee |
| 2023 | Variational Gaussian Process Data Uncertainty. | Jeremy Heng Meng Wong, Huayun Zhang, Nancy F. Chen |
| 2023 | Not All Errors Are Created Equal: Evaluating The Impact of Model and Speaker Factors on ASR Outcomes in Clinical Populations. | Daniela A. Wiepert, Rene L. Utianski, Joseph R. Duffy, John L. Stricker, Leland Barnard, Keith A. Josephs, Jennifer L. Whitwell, David T. Jones, Hugo Botha |
| 2023 | FedCPC: An Effective Federated Contrastive Learning Method for Privacy Preserving Early-Stage Alzheimers Speech Detection. | Wenqing Wei, Zhengdong Yang, Yuan Gao, Jiyi Li, Chenhui Chu, Shogo Okada, Sheng Li |
| 2023 | COCO-NUT: Corpus of Japanese Utterance and Voice Characteristics Description for Prompt-Based Control. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Wataru Nakata, Detai Xin, Hiroshi Saruwatari |
| 2023 | Crosssinger: A Cross-Lingual Multi-Singer High-Fidelity Singing Voice Synthesizer Trained on Monolingual Singers. | Xintong Wang, Chang Zeng, Jun Chen, Chunhui Wang |
| 2023 | Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition. | Yujin Wang, Changli Tang, Ziyang Ma, Zhisheng Zheng, Xie Chen, Wei-Qiang Zhang |
| 2023 | Speech Emotion Diarization: Which Emotion Appears When? | Yingzhi Wang, Mirco Ravanelli, Alya Yacoubi |
| 2023 | Adapting Pretrained Speech Model for Mandarin Lyrics Transcription and Alignment. | Jun-You Wang, Chon-In Leong, Yu-Chen Lin, Li Su, Jyh-Shing Roger Jang |
| 2023 | Zero-Shot Singing Voice Synthesis from Musical Score. | Jun-You Wang, Hung-Yi Lee, Jyh-Shing Roger Jang, Li Su |