| 2025 | Interspeech | Speaker Normalization and Content Restoration for Zero-Shot Voice Conversion with Attention-Enhanced Discriminator. | Desheng Hu, Yang Xiang, Jian Lu, Xinhui Hu, Xinkang Xu |
| 2025 | Interspeech | RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval. | Haoqin Sun, Jingguang Tian, Jiaming Zhou, Hui Wang, Jiabei He, Shiwan Zhao, Xiangyu Kong, Desheng Hu, Xinkang Xu, Xinhui Hu, Yong Qin |
| 2025 | Interspeech | Discrete Audio Representations for Automated Audio Captioning. | Jingguang Tian, Haoqin Sun, Xinhui Hu, Xinkang Xu |
| 2024 | ICASSP | Learning Emotion-Invariant Speaker Representations for Speaker Verification. | Jingguang Tian, Xinhui Hu, Xinkang Xu |
| 2024 | ICASSP | The Royalflush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge. | Jingguang Tian, Shuaishuai Ye, Shunfei Chen, Yang Xiang, Zhaohui Yin, Xinhui Hu, Xinkang Xu |
| 2024 | ICASSP | A Deep Representation Learning-Based Speech Enhancement Method Using Complex Convolution Recurrent Variational Autoencoder. | Yang Xiang, Jingguang Tian, Xinhui Hu, Xinkang Xu, Zhaohui Yin |
| 2024 | Interspeech | SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR. | Shuaishuai Ye, Shunfei Chen, Xinhui Hu, Xinkang Xu |
| 2023 | ASRU | LE-SSL-MOS: Self-Supervised Learning MOS Prediction with Listener Enhancement. | Zili Qi, Xinhui Hu, Wangjin Zhou, Sheng Li, Hao Wu, Jian Lu, Xinkang Xu |
| 2022 | ICASSP | The Royalflush System of Speech Recognition for M2met Challenge. | Shuaishuai Ye, Peiyao Wang, Shunfei Chen, Xinhui Hu, Xinkang Xu |
| 2022 | Interspeech | Multiple Enhancements to LSTM for Learning Emotion-Salient Features in Speech Emotion Recognition. | Desheng Hu, Xinhui Hu, Xinkang Xu |
| 2021 | ICASSP | An Investigation of Using Hybrid Modeling Units for Improving End-to-End Speech Recognition System. | Shunfei Chen, Xinhui Hu, Sheng Li, Xinkang Xu |
| 2021 | Interspeech | An End-to-End Dialect Identification System with Transfer Learning from a Multilingual Automatic Speech Recognition Model. | Ding Wang, Shuaishuai Ye, Xinhui Hu, Sheng Li, Xinkang Xu |
| 2020 | Interspeech | Data Augmentation for Code-Switch Language Modeling by Fusing Multiple Text Generation Methods. | Xinhui Hu, Qi Zhang, Lei Yang, Binbin Gu, Xinkang Xu |