| 2026 | ACL | DisCo_Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec. | Tao Li, Wenshuo Ge, Zhichao Wang, Zihao Cui, Yong Ma, Yingying Gao, Chao Deng, Shilei Zhang, Junlan Feng |
| 2025 | COLING | DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles. | Jiaxuan Liu, Zhaoci Liu, Yajun Hu, Yingying Gao, Shilei Zhang, Zhenhua Ling |
| 2025 | ICASSP | Energy-based Model Guided Self-Supervised Learning for Speaker Verification. | Yaqian Hao, Chenguang Hu, Chong Bian, Junlan Feng, Yingying Gao, Shilei Zhang |
| 2025 | ICASSP | Codec-ASV: Exploring Neural Audio Codec For Speaker Representation Learning. | Yuke Lin, Fulin Zhang, Yingying Gao, Shilei Zhang, Ming Li |
| 2025 | ICASSP | Efficient Extreme Large-Scale Speaker Verification: Dynamic Active Sub Fully-Connected Layers for Faster Training and Memory Optimization. | Fulin Zhang, Chenguang Hu, Yao Shen, Yingying Gao, Shilei Zhang, Junlan Feng |
| 2025 | Interspeech | Privacy-Preserving Speaker Verification via End-to-End Secure Representation Learning. | Chenguang Hu, Yaqian Hao, Fulin Zhang, Xiaoxue Luo, Yao Shen, Yingying Gao, Chao Deng, Shilei Zhang, Junlan Feng |
| 2024 | Interspeech | MFSN: Multi-perspective Fusion Search Network For Pre-training Knowledge in Speech Emotion Recognition. | Haiyang Sun, Fulin Zhang, Yingying Gao, Shilei Zhang, Zheng Lian, Junlan Feng |
| 2024 | Interspeech | GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model. | Yingying Gao, Shilei Zhang, Chao Deng, Junlan Feng |
| 2024 | Interspeech | Exploring Energy-Based Models for Out-of-Distribution Detection in Dialect Identification. | Yaqian Hao, Chenguang Hu, Yingying Gao, Shilei Zhang, Junlan Feng |
| 2024 | Interspeech | On Calibration of Speech Classification Models: Insights from Energy-Based Model Investigations. | Yaqian Hao, Chenguang Hu, Yingying Gao, Shilei Zhang, Junlan Feng |
| 2024 | Interspeech | VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark. | Yuke Lin, Ming Cheng, Fulin Zhang, Yingying Gao, Shilei Zhang, Ming Li |
| 2024 | Interspeech | CEC: A Noisy Label Detection Method for Speaker Recognition. | Yao Shen, Yingying Gao, Yaqian Hao, Chenguang Hu, Fulin Zhang, Junlan Feng, Shilei Zhang |
| 2023 | ICASSP | Semi-Supervised Speech Enhancement Based On Speech Purity. | Zihao Cui, Shilei Zhang, Yanan Chen, Yingying Gao, Chao Deng, Junlan Feng |
| 2023 | ICASSP | VE-KWS: Visual Modality Enhanced End-to-End Keyword Spotting. | Ao Zhang, He Wang, Pengcheng Guo, Yihui Fu, Lei Xie, Yingying Gao, Shilei Zhang, Junlan Feng |
| 2023 | Interspeech | Cascaded Multi-task Adaptive Learning Based on Neural Architecture Search. | Yingying Gao, Shilei Zhang, Zihao Cui, Chao Deng, Junlan Feng |
| 2023 | Interspeech | Flow-VAE VC: End-to-End Flow Framework with Contrastive Loss for Zero-shot Voice Conversion. | Le Xu, Rongxiu Zhong, Ying Liu, Huibao Yang, Shilei Zhang |
| 2022 | ICASSP | Harmonic Gated Compensation Network Plus for ICASSP 2022 DNS Challenge. | Tianrui Wang, Weibin Zhu, Yingying Gao, Yanan Chen, Junlan Feng, Shilei Zhang |
| 2022 | ICASSP | HGCN: Harmonic Gated Compensation Network for Speech Enhancement. | Tianrui Wang, Weibin Zhu, Yingying Gao, Junlan Feng, Shilei Zhang |
| 2022 | Interspeech | Meta Auxiliary Learning for Low-resource Spoken Language Understanding. | Yingying Gao, Junlan Feng, Chao Deng, Shilei Zhang |
| 2021 | ASRU | Boundary and Context Aware Training for CIF-Based Non-Autoregressive End-to-End ASR. | Fan Yu, Haoneng Luo, Pengcheng Guo, Yuhao Liang, Zhuoyuan Yao, Lei Xie, Yingying Gao, Leijing Hou, Shilei Zhang |
| 2021 | Interspeech | Our Learned Lessons from Cross-Lingual Speaker Verification: The CRMI-DKU System Description for the Short-Duration Speaker Verification Challenge 2021. | Xiaoyi Qin, Chao Wang, Yong Ma, Min Liu, Shilei Zhang, Ming Li |
| 2021 | UIC | Feasibility Analysis of Machine Learning Optimization on GPU-based Low-cost Edges. | Jiashun Suo, Xingzhou Zhang, Shilei Zhang, Wei Zhou, Weisong Shi |
| 2019 | Interspeech | Few-Shot Audio Classification with Attentional Graph Neural Networks. | Shilei Zhang, Yong Qin, Kewei Sun, Yonghua Lin |
| 2018 | ACCV | Identity-Enhanced Network for Facial Expression Recognition. | Yanwei Li, Xingang Wang, Shilei Zhang, Lingxi Xie, Wenqi Wu, Hongyuan Yu, Zheng Zhu |
| 2017 | APNOMS | Service failure diagnosis in service function chain. | Shilei Zhang, Ying Wang, Wenjing Li, Xuesong Qiu |
| 2017 | APNOMS | Load balancing for multiple controllers in SDN based on switches group. | Yaning Zhou, Ying Wang, Jinke Yu, Junhua Ba, Shilei Zhang |
| 2017 | ICMI | Emotion recognition with multimodal features and temporal models. | Shuai Wang, Wenxuan Wang, Jinming Zhao, Shizhe Chen, Qin Jin, Shilei Zhang, Yong Qin |
| 2017 | IJCAI | Autoencoder Regularized Network For Driving Style Representation Learning. | Weishan Dong, Ting Yuan, Kai Yang, Changsheng Li, Shilei Zhang |
| 2016 | ICMI | Video emotion recognition in the wild based on fusion of multimodal features. | Shizhe Chen, Xinrui Li, Qin Jin, Shilei Zhang, Yong Qin |
| 2016 | ICPR | Wake-up-word spotting using end-to-end deep neural network system. | Shilei Zhang, Wen Liu, Yong Qin |
| 2016 | ICPR | Rapid feature space MLLR speaker adaptation for deep neural network acoustic modeling. | Shilei Zhang, Yong Qin |
| 2016 | ICPR | Text-independent voice conversion using deep neural network based phonetic level features. | Huadi Zheng, Weicheng Cai, Tianyan Zhou, Shilei Zhang, Ming Li |
| 2013 | ICASSP | Semi-supervised accent detection and modeling. | Shilei Zhang, Yong Qin |
| 2012 | ICASSP | Model dimensionality selection in bilinear transformation for feature space MLLR rapid speaker adaptation. | Shilei Zhang, Yong Qin |
| 2011 | ICASSP | Rapid feature space MLLR speaker adaptation with bilinear models. | Shilei Zhang, Peder A. Olsen, Yong Qin |
| 2010 | ICASSP | The 2009 IBM GALE Mandarin broadcast transcription system. | Stephen M. Chu, Daniel Povey, Hong-Kwang Kuo, Lidia Mangu, Shilei Zhang, Qin Shi, Yong Qin |
| 2010 | ICPR | Modeling Syllable-Based Pronunciation Variation for Accented Mandarin Speech Recognition. | Shilei Zhang, Qin Shi, Yong Qin |
| 2010 | ICPR | Automatic Pronunciation Transliteration for Chinese-English Mixed Language Keyword Spotting. | Shilei Zhang, Zhiwei Shuang, Yong Qin |
| 2010 | ICPR | Improved Mandarin Keyword Spotting Using Confusion Garbage Model. | Shilei Zhang, Zhiwei Shuang, Qin Shi, Yong Qin |
| 2010 | Interspeech | Spoken English assessment system for non-native speakers using acoustic and prosodic features. | Qin Shi, Kun Li, Shilei Zhang, Stephen M. Chu, Ji Xiao, Zhijian Ou |
| 2009 | ICASSP | Utterance verification using improved confidence measures based on alignment confusion rate in Chinese digits recognition. | Shilei Zhang, Danning Jiang, Yong Qin |
| 2009 | ICASSP | Main vowel domain tone modeling with lexical and prosodic analysis for Mandarin ASR. | Shilei Zhang, Qin Shi, Stephen M. Chu, Yong Qin |
| 2008 | ICASSP | Recent advances in the IBM GALE Mandarin transcription system. | Selina M. Chu, Hong-Kwang Kuo, Lidia Mangu, Yi Liu, Yong Qin, Qin Shi, Shilei Zhang, Hagai Aronowitz |
| 2006 | ICPR | A Two-level Method for Unsupervised Speaker-based Audio Segmentation. | Shilei Zhang, Shuwu Zhang, Bo Xu |
| 2006 | Interspeech | Fast SVM training based on the choice of effective samples for audio classification. | Shilei Zhang, Hongchen Jiang, Shuwu Zhang, Bo Xu |
| 2005 | Interspeech | Optimal model order selection based on regression tree in speaker identification. | Shilei Zhang, Junmei Bai, Shuwu Zhang, Bo Xu |