| 2025 | ASRU | MBENet: Bone-conduction and Air-conduction Fusion Network for Target Speaker Extraction. | Chen Zhang, Linfeng Feng, Zhi Liu, Xiao-Lei Zhang, Xuelong Li |
| 2025 | ICASSP | Co-Attention Based Multi-Channel TF-GridNet for Speech Separation with Ad-Hoc Microphone Arrays. | Hongmei Guo, Linfeng Feng, Yijiang Chen, Xueqing Li, Boyu Zhu, Hao-Yu Wang, Xiao-Lei Zhang, Xuelong Li |
| 2025 | Interspeech | Augment Mandarin to Cantonese Speech Databases via Retrieval-Augmented Generation and Speech Synthesis. | Fan Liu, Cheng Gong, Boyu Zhu, Ruihao Jing, Chunyu Qiang, Tianrui Wang, Xiao-Lei Zhang, Xuelong Li |
| 2024 | ICASSP | Exploiting A Quantum Multiple Kernel Learning Approach For Low-Resource Spoken Command Recognition. | Xianyan Fu, Xiao-Lei Zhang, Chao-Han Huck Yang, Jun Qi |
| 2024 | ICASSP | A Hierarchical Multi-Proxy Loss with Dynamic Main-Proxy for Deep Metric Learning. | Lei Zhao, Xiao-Lei Zhang |
| 2024 | Interspeech | Textual-Driven Adversarial Purification for Speaker Verification. | Sizhou Chen, Yibo Bai, Jiadi Yao, Xiao-Lei Zhang, Xuelong Li |
| 2023 | ICASSP | Soft Label Coding for end-to-end Sound Source Localization with ad-hoc Microphone Arrays. | Linfeng Feng, Yijun Gong, Xiao-Lei Zhang |
| 2023 | ICASSP | Fast-U2++: Fast and Accurate End-to-End Speech Recognition in Joint CTC/Attention Frames. | Chengdong Liang, Xiao-Lei Zhang, Binbin Zhang, Di Wu, Shengqiang Li, Xingchen Song, Zhendong Peng, Fuping Pan |
| 2023 | ICASSP | Optimizing Quantum Federated Learning Based on Federated Quantum Natural Gradient Descent. | Jun Qi, Xiao-Lei Zhang, Javier Tejedor |
| 2023 | ICASSP | Wekws: A Production First Small-Footprint End-to-End Keyword Spotting Toolkit. | Jie Wang, Menglong Xu, Jingyong Hou, Binbin Zhang, Xiao-Lei Zhang, Lei Xie, Fuping Pan |
| 2023 | Interspeech | Branch-ECAPA-TDNN: A Parallel Branch Architecture to Capture Local and Global Features for Speaker Verification. | Jiadi Yao, Chengdong Liang, Zhendong Peng, Binbin Zhang, Xiao-Lei Zhang |
| 2022 | ICASSP | End-To-End Multi-Modal Speech Recognition with Air and Bone Conducted Speech. | Junqi Chen, Mou Wang, Xiao-Lei Zhang, Zhiyong Huang, Susanto Rahardja |
| 2022 | Interspeech | Multi-Channel Far-Field Speaker Verification with Large-Scale Ad-hoc Microphone Arrays. | Chengdong Liang, Yijiang Chen, Jiadi Yao, Xiao-Lei Zhang |
| 2022 | Interspeech | Multi-class AUC Optimization for Robust Small-footprint Keyword Spotting with Limited Training Data. | Menglong Xu, Shengqiang Li, Chengdong Liang, Xiao-Lei Zhang |
| 2021 | ICASSP | Speech Enhancement Aided End-To-End Multi-Task Learning for Voice Activity Detection. | Xu Tan, Xiao-Lei Zhang |
| 2021 | ICASSP | Transformer-Based End-to-End Speech Recognition with Local Dense Synthesizer Attention. | Menglong Xu, Shengqiang Li, Xiao-Lei Zhang |
| 2021 | Interspeech | Scaling Sparsemax Based Channel Selection for Speech Recognition with ad-hoc Microphone Arrays. | Junqi Chen, Xiao-Lei Zhang |
| 2020 | ICASSP | Partial AUC Optimization Based Deep Speaker Embeddings with Class-Center Learning for Text-Independent Speaker Verification. | Zhongxin Bai, Xiao-Lei Zhang, Jingdong Chen |
| 2020 | ICPR | Deep Topic Modeling by Multilayer Bootstrap Network and Lasso. | Jianyu Wang, Xiao-Lei Zhang |
| 2020 | Interspeech | Depthwise Separable Convolutional ResNet with Squeeze-and-Excitation Blocks for Small-Footprint Keyword Spotting. | Menglong Xu, Xiao-Lei Zhang |
| 2019 | ICASSP | AUC Optimization for Deep Learning Based Voice Activity Detection. | Zi-Chen Fan, Zhongxin Bai, Xiao-Lei Zhang, Susanto Rahardja, Jingdong Chen |
| 2019 | ICASSP | Robust Sparse Multichannel Active Noise Control. | Jingli Xie, Danqi Jin, Wen Zhang, Xiao-Lei Zhang, Jie Chen, DeLiang Wang |
| 2018 | Interspeech | Cosine Metric Learning for Speaker Verification in the I-vector Space. | Zhongxin Bai, Xiao-Lei Zhang, Jingdong Chen |
| 2016 | Interspeech | Universal Background Sparse Coding and Multilayer Bootstrap Network for Speaker Clustering. | Xiao-Lei Zhang |
| 2015 | Interspeech | Multi-resolution stacking for speech separation based on boosted DNN. | Xiao-Lei Zhang, DeLiang Wang |
| 2014 | ACML | Nonlinear Dimensionality Reduction of Data by Deep Distributed Random Samplings. | Xiao-Lei Zhang |
| 2014 | ICASSP | Unsupervised domain adaptation for deep neural network based voice activity detection. | Xiao-Lei Zhang |
| 2014 | Interspeech | Boosted deep neural networks and multi-resolution cochleagram features for voice activity detection. | Xiao-Lei Zhang, DeLiang Wang |
| 2013 | ICASSP | Denoising deep neural networks based voice activity detection. | Xiao-Lei Zhang, Ji Wu |
| 2013 | ICASSP | Weight optimization and layered clustering-based ECOC. | Xiao-Lei Zhang, Ji Wu |
| 2012 | ICASSP | Optimized weighted decoding for error-correcting output codes. | Xiao-Lei Zhang, Ji Wu, Zhipeng Chen, Ping Lv |
| 2010 | Interspeech | A new VAD framework using statistical model and human knowledge based empirical rule. | Ji Wu, Xiao-Lei Zhang, Wei Li |