| 2025 | AAAI | Code-switching Mediated Sentence-level Semantic Learning. | Shuai Zhang, Jiangyan Yi, Zhengqi Wen, Jianhua Tao, Feihu Che, Jinyang Wu, Ruibo Fu |
| 2025 | AAAI | Region-Based Optimization in Continual Learning for Audio Deepfake Detection. | Yujie Chen, Jiangyan Yi, Cunhang Fan, Jianhua Tao, Yong Ren, Siding Zeng, Chu Yuan Zhang, Xinrui Yan, Hao Gu, Jun Xue, Chenglong Wang, Zhao Lv, Xiaohui Zhang |
| 2025 | ICASSP | PET: High-Frequency Temporal Self-Consistency Learning for Partially Deepfake Audio Localization. | Jiayi He, Jiangyan Yi, Jianhua Tao, Siding Zeng |
| 2025 | ICASSP | Adversarial Training and Gradient Optimization for Partially Deepfake Audio Localization. | Siding Zeng, Jiangyan Yi, Jianhua Tao, Jiayi He, Zheng Lian, Shan Liang, Chuyuan Zhang, Yujie Chen, Xiaohui Zhang |
| 2025 | ICASSP | WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification. | Junzuo Zhou, Jiangyan Yi, Yong Ren, Jianhua Tao, Tao Wang, Chuyuan Zhang |
| 2025 | ICML | AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models. | Zheng Lian, Haoyu Chen, Lan Chen, Haiyang Sun, Licai Sun, Yong Ren, Zebang Cheng, Bin Liu, Rui Liu, Xiaojiang Peng, Jiangyan Yi, Jianhua Tao |
| 2025 | ICML | OV-MER: Towards Open-Vocabulary Multimodal Emotion Recognition. | Zheng Lian, Haiyang Sun, Licai Sun, Haoyu Chen, Lan Chen, Hao Gu, Zhuofan Wen, Shun Chen, Siyuan Zhang, Hailiang Yao, Bin Liu, Rui Liu, Shan Liang, Ya Li, Jiangyan Yi, Jianhua Tao |
| 2024 | AAAI | What to Remember: Self-Adaptive Continual Learning for Audio Deepfake Detection. | Xiaohui Zhang, Jiangyan Yi, Chenglong Wang, Chu Yuan Zhang, Siding Zeng, Jianhua Tao |
| 2024 | COLING | NLoPT: N-gram Enhanced Low-Rank Task Adaptive Pre-training for Efficient Language Model Adaption. | Hao Gu, Jiangyan Yi, Zheng Lian, Jianhua Tao, Xinrui Yan |
| 2024 | ICASSP | Fewer-Token Neural Speech Codec with Time-Invariant Codes. | Yong Ren, Tao Wang, Jiangyan Yi, Le Xu, Jianhua Tao, Chu Yuan Zhang, Junzuo Zhou |
| 2024 | ICASSP | Multi-Scale Permutation Entropy for Audio Deepfake Detection. | Chenglong Wang, Jiayi He, Jiangyan Yi, Jianhua Tao, Chu Yuan Zhang, Xiaohui Zhang |
| 2024 | Interspeech | RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection. | Yujie Chen, Jiangyan Yi, Jun Xue, Chenglong Wang, Xiaohui Zhang, Shunbo Dong, Siding Zeng, Jianhua Tao, Zhao Lv, Cunhang Fan |
| 2024 | Interspeech | Frequency-mix Knowledge Distillation for Fake Speech Detection. | Cunhang Fan, Shunbo Dong, Jun Xue, Yujie Chen, Jiangyan Yi, Zhao Lv |
| 2024 | Interspeech | Residual Speaker Representation for One-Shot Voice Conversion. | Le Xu, Jiangyan Yi, Tao Wang, Yong Ren, Rongxiu Zhong, Zhengqi Wen, Jianhua Tao |
| 2024 | Interspeech | Enhancing Partially Spoofed Audio Localization with Boundary-aware Attention Mechanism. | Jiafeng Zhong, Bin Li, Jiangyan Yi |
| 2024 | Interspeech | TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking. | Junzuo Zhou, Jiangyan Yi, Tao Wang, Jianhua Tao, Ye Bai, Chu Yuan Zhang, Yong Ren, Zhengqi Wen |
| 2023 | ICASSP | GCC-Speaker: Target Speaker Localization with Optimal Speaker-Dependent Weighting in Multi-Speaker Scenarios. | Guanjun Li, Wei Xue, Wenju Liu, Jiangyan Yi, Jianhua Tao |
| 2023 | ICASSP | Learning From Yourself: A Self-Distillation Method For Fake Speech Detection. | Jun Xue, Cunhang Fan, Jiangyan Yi, Chenglong Wang, Zhengqi Wen, Dan Zhang, Zhao Lv |
| 2023 | ICML | Do You Remember? Overcoming Catastrophic Forgetting for Fake Audio Detection. | Xiaohui Zhang, Jiangyan Yi, Jianhua Tao, Chenglong Wang, Chu Yuan Zhang |
| 2023 | Interspeech | Detection of Cross-Dataset Fake Audio Based on Prosodic and Pronunciation Features. | Chenglong Wang, Jiangyan Yi, Jianhua Tao, Chu Yuan Zhang, Shuai Zhang, Xun Chen |
| 2023 | Interspeech | TO-Rawnet: Improving RawNet with TCN and Orthogonal Regularization for Fake Audio Detection. | Chenglong Wang, Jiangyan Yi, Jianhua Tao, Chu Yuan Zhang, Shuai Zhang, Ruibo Fu, Xun Chen |
| 2022 | ICASSP | Context-Aware Mask Prediction Network for End-to-End Text-Based Speech Editing. | Tao Wang, Jiangyan Yi, Liqun Deng, Ruibo Fu, Jianhua Tao, Zhengqi Wen |
| 2022 | ICASSP | ADD 2022: the first Audio Deep Synthesis Detection Challenge. | Jiangyan Yi, Ruibo Fu, Jianhua Tao, Shuai Nie, Haoxin Ma, Chenglong Wang, Tao Wang, Zhengkun Tian, Ye Bai, Cunhang Fan, Shan Liang, Shiming Wang, Shuai Zhang, Xinrui Yan, Le Xu, Zhengqi Wen, Haizhou Li |
| 2022 | ICASSP | A Robust Deep Audio Splicing Detection Method via Singularity Detection Feature. | Kanghao Zhang, Shan Liang, Shuai Nie, Shulin He, Jiahui Pan, Xueliang Zhang, Haoxin Ma, Jiangyan Yi |
| 2022 | Interspeech | reducing multilingual context confusion for end-to-end code-switching automatic speech recognition. | Shuai Zhang, Jiangyan Yi, Zhengkun Tian, Jianhua Tao, Yu Ting Yeung, Liqun Deng |
| 2021 | ICASSP | Decoupling Pronunciation and Language for End-to-End Code-Switching Automatic Speech Recognition. | Shuai Zhang, Jiangyan Yi, Zhengkun Tian, Ye Bai, Jianhua Tao, Zhengqi Wen |
| 2021 | ICASSP | Bi-Level Style and Prosody Decoupling Modeling for Personalized End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Tao Wang, Chunyu Qiang |
| 2021 | ICASSP | Prosody and Voice Factorization for Few-Shot Speaker Adaptation in the Challenge M2voc 2021. | Tao Wang, Ruibo Fu, Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Chunyu Qiang, Shiming Wang |
| 2021 | ICASSP | Patnet : A Phoneme-Level Autoregressive Transformer Network for Speech Synthesis. | Shiming Wang, Zhenhua Ling, Ruibo Fu, Jiangyan Yi, Jianhua Tao |
| 2021 | Interspeech | End-to-End Spelling Correction Conditioned on Acoustic Feature for Code-Switching Speech Recognition. | Shuai Zhang, Jiangyan Yi, Zhengkun Tian, Ye Bai, Jianhua Tao, Xuefei Liu, Zhengqi Wen |
| 2021 | Interspeech | Continual Learning for Fake Audio Detection. | Haoxin Ma, Jiangyan Yi, Jianhua Tao, Ye Bai, Zhengkun Tian, Chenglong Wang |
| 2021 | Interspeech | FSR: Accelerating the Inference Process of Transducer-Based Models by Applying Fast-Skip Regularization. | Zhengkun Tian, Jiangyan Yi, Ye Bai, Jianhua Tao, Shuai Zhang, Zhengqi Wen |
| 2021 | Interspeech | Half-Truth: A Partially Fake Audio Detection Dataset. | Jiangyan Yi, Ye Bai, Jianhua Tao, Haoxin Ma, Zhengkun Tian, Chenglong Wang, Tao Wang, Ruibo Fu |
| 2020 | ICASSP | Focusing on Attention: Prosody Transfer and Adaptative Optimization Strategy for Multi-Speaker End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Tao Wang |
| 2020 | ICASSP | Synchronous Transformers for end-to-end Speech Recognition. | Zhengkun Tian, Jiangyan Yi, Ye Bai, Jianhua Tao, Shuai Zhang, Zhengqi Wen |
| 2020 | Interspeech | Listen Attentively, and Spell Once: Whole Sentence Generation via a Non-Autoregressive Architecture for Low-Latency Speech Recognition. | Ye Bai, Jiangyan Yi, Jianhua Tao, Zhengkun Tian, Zhengqi Wen, Shuai Zhang |
| 2020 | Interspeech | Gated Recurrent Fusion of Spatial and Spectral Features for Multi-Channel Speech Separation with Deep Embedding Representations. | Cunhang Fan, Jianhua Tao, Bin Liu, Jiangyan Yi, Zhengqi Wen |
| 2020 | Interspeech | Joint Training for Simultaneous Speech Denoising and Dereverberation with Deep Embedding Representations. | Cunhang Fan, Jianhua Tao, Bin Liu, Jiangyan Yi, Zhengqi Wen |
| 2020 | Interspeech | Dynamic Soft Windowing and Language Dependent Style Token for Code-Switching End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Chunyu Qiang, Tao Wang |
| 2020 | Interspeech | Dynamic Speaker Representations Adjustment and Decoder Factorization for Speaker Adaptation in End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Tao Wang, Chunyu Qiang |
| 2020 | Interspeech | Spike-Triggered Non-Autoregressive Transformer for End-to-End Speech Recognition. | Zhengkun Tian, Jiangyan Yi, Jianhua Tao, Ye Bai, Shuai Zhang, Zhengqi Wen |
| 2020 | Interspeech | Non-Autoregressive End-to-End TTS with Coarse-to-Fine Decoding. | Tao Wang, Xuefei Liu, Jianhua Tao, Jiangyan Yi, Ruibo Fu, Zhengqi Wen |
| 2020 | Interspeech | Bi-Level Speaker Supervision for One-Shot Speech Synthesis. | Tao Wang, Jianhua Tao, Ruibo Fu, Jiangyan Yi, Zhengqi Wen, Chunyu Qiang |
| 2020 | Interspeech | Spoken Content and Voice Factorization for Few-Shot Speaker Adaptation. | Tao Wang, Jianhua Tao, Ruibo Fu, Jiangyan Yi, Zhengqi Wen, Rongxiu Zhong |
| 2020 | Interspeech | Focal Loss for Punctuation Prediction. | Jiangyan Yi, Jianhua Tao, Zhengkun Tian, Ye Bai, Cunhang Fan |
| 2019 | ICASSP | Self-attention Based Model for Punctuation Prediction Using Word and Speech Embeddings. | Jiangyan Yi, Jianhua Tao |
| 2019 | ICASSP | Language-invariant Bottleneck Features from Adversarial End-to-end Acoustic Models for Low Resource Speech Recognition. | Jiangyan Yi, Jianhua Tao, Ye Bai |
| 2019 | Interspeech | Learn Spelling from Teachers: Transferring Knowledge from Language Models to Sequence-to-Sequence Speech Recognition. | Ye Bai, Jiangyan Yi, Jianhua Tao, Zhengkun Tian, Zhengqi Wen |
| 2019 | Interspeech | A Time Delay Neural Network with Shared Weight Self-Attention for Small-Footprint Keyword Spotting. | Ye Bai, Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Zhengkun Tian, Chenghao Zhao, Cunhang Fan |
| 2019 | Interspeech | Discriminative Learning for Monaural Speech Separation Using Deep Embedding Features. | Cunhang Fan, Bin Liu, Jianhua Tao, Jiangyan Yi, Zhengqi Wen |
| 2019 | Interspeech | Self-Attention Transducers for End-to-End Speech Recognition. | Zhengkun Tian, Jiangyan Yi, Jianhua Tao, Ye Bai, Zhengqi Wen |
| 2018 | ICASSP | End-to-End Continuous Emotion Recognition from Video Using 3D Convlstm Networks. | Jian Huang, Ya Li, Jianhua Tao, Zheng Lian, Jiangyan Yi |
| 2018 | ICASSP | Adversarial Multilingual Training for Low-Resource Speech Recognition. | Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Ye Bai |
| 2017 | Interspeech | Distilling Knowledge from an Ensemble of Models for Punctuation Prediction. | Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Ya Li |