| 2025 | Interspeech | RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval. | Haoqin Sun, Jingguang Tian, Jiaming Zhou, Hui Wang, Jiabei He, Shiwan Zhao, Xiangyu Kong, Desheng Hu, Xinkang Xu, Xinhui Hu, Yong Qin |
| 2025 | Interspeech | Discrete Audio Representations for Automated Audio Captioning. | Jingguang Tian, Haoqin Sun, Xinhui Hu, Xinkang Xu |
| 2025 | Interspeech | A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model. | Yang Xiang, Canan Huang, Desheng Hu, Jingguang Tian, Xinhui Hu, Chao Zhang |
| 2024 | ICASSP | Learning Emotion-Invariant Speaker Representations for Speaker Verification. | Jingguang Tian, Xinhui Hu, Xinkang Xu |
| 2024 | ICASSP | The Royalflush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge. | Jingguang Tian, Shuaishuai Ye, Shunfei Chen, Yang Xiang, Zhaohui Yin, Xinhui Hu, Xinkang Xu |
| 2024 | ICASSP | A Deep Representation Learning-Based Speech Enhancement Method Using Complex Convolution Recurrent Variational Autoencoder. | Yang Xiang, Jingguang Tian, Xinhui Hu, Xinkang Xu, Zhaohui Yin |