| 2026 | AAAI | AStar: Boosting Multimodal Reasoning with Automated Structured Thinking. | Jinyang Wu, Mingkuan Feng, Guocheng Zhai, Shuai Zhang, Zheng Lian, Fangrui Lv, Pengpeng Shao, Ruihan Jin, Zhengqi Wen, Jianhua Tao |
| 2026 | AAAI | PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis. | Heng Xie, Kang Zhu, Zhengqi Wen, Jianhua Tao, Xuefei Liu, Ruibo Fu, Changsheng Li |
| 2026 | ACL | ReFL: Reflective Feedback Learning for Hallucination Detection of Large Language Models. | Cunhang Fan, Jun Zhang, Xue Zhang, Shuai Zhang, Zhao Lv, Jianhua Tao, Zhengqi Wen |
| 2026 | ACL | Two-Stage Regularization-Based Structured Pruning for LLMs. | Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Hongjian Fang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao |
| 2026 | ACL | Calibration-Aware Policy Optimization for Reasoning LLMs. | Ziqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang |
| 2026 | ACL | Beyond Examples: Towards Automated Thought-level In-Context Reasoning for Large Language Models. | Jinyang Wu, Mingkuan Feng, Shuai Zhang, Feihu Che, Zhengqi Wen, Chonghua Liao, Ling Yang, Haoran Luo, Zheng Lian, Jianhua Tao |
| 2026 | ACL | TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning. | Jinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao |
| 2026 | ACL | SPARK: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning. | Jinyang Wu, Shuo Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao |
| 2026 | ACL | ATLAS: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning. | Jinyang Wu, Guocheng Zhai, Ruihan Jin, Jiahao Yuan, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao |
| 2026 | ACL | CAIR: Causal Adaptive Information-based Reinforcement Learning for Multimodal Emotion Reasoning. | Fengyu Zhang, Bin Liu, Jianhua Tao, Zhuofan Wen, Shun Chen, Hailiang Yao, Zhengqi Wen |
| 2025 | AAAI | Code-switching Mediated Sentence-level Semantic Learning. | Shuai Zhang, Jiangyan Yi, Zhengqi Wen, Jianhua Tao, Feihu Che, Jinyang Wu, Ruibo Fu |
| 2025 | ASRU | Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation. | Hongming Guo, Ruibo Fu, Yizhong Geng, Shuchen Shi, Tao Wang, Chunyu Qiang, Ya Li, Zhengqi Wen, Yukun Liu, Xuefei Liu, Chenxing Li |
| 2025 | CVPR | ImViD: Immersive Volumetric Videos for Enhanced VR Engagement. | Zhengxian Yang, Shi Pan, Shengqi Wang, Haoxiang Wang, Li Lin, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu |
| 2025 | EMNLP | RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing. | Ruihan Jin, Pengpeng Shao, Zhengqi Wen, Jinyang Wu, Mingkuan Feng, Shuai Zhang, Jianhua Tao |
| 2025 | ICASSP | DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech. | Xin Qi, Ruibo Fu, Zhengqi Wen, Tao Wang, Chunyu Qiang, Jianhua Tao, Chenxing Li, Yi Lu, Shuchen Shi, Zhiyong Wang, Xiaopeng Wang, Yuankun Xie, Yukun Liu, Xuefei Liu, Guanjun Li |
| 2025 | ICASSP | Mixture of Experts Fusion for Fake Audio Detection Using Frozen wav2vec 2.0. | Zhiyong Wang, Ruibo Fu, Zhengqi Wen, Jianhua Tao, Xiaopeng Wang, Yuankun Xie, Xin Qi, Shuchen Shi, Yi Lu, Yukun Liu, Chenxing Li, Xuefei Liu, Guanjun Li |
| 2025 | ICASSP | DetailTTS: Learning Residual Detail Information for Zero-shot Text-to-speech. | Cong Wang, Yichen Han, Yizhong Geng, Yingming Gao, Fengping Wang, Bingsong Bai, Qifei Li, Jinlong Xue, Yayue Deng, Zhengqi Wen, Ya Li |
| 2025 | ICASSP | MTPareto: A MultiModal Targeted Pareto Framework for Fake News Detection. | Kaiying Yan, Moyang Liu, Yukun Liu, Ruibo Fu, Zhengqi Wen, Jianhua Tao, Xuefei Liu, Guanjun Li |
| 2025 | IJCAI | M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction. | Cunhang Fan, Ying Chen, Jian Zhou, Zexu Pan, Jingjing Zhang, Youdian Gao, Xiaoke Yang, Zhengqi Wen, Zhao Lv |
| 2024 | Interspeech | Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio. | Yi Lu, Yuankun Xie, Ruibo Fu, Zhengqi Wen, Jianhua Tao, Zhiyong Wang, Xin Qi, Xuefei Liu, Yongwei Li, Yukun Liu, Xiaopeng Wang, Shuchen Shi |
| 2024 | Interspeech | PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation. | Shuchen Shi, Ruibo Fu, Zhengqi Wen, Jianhua Tao, Tao Wang, Chunyu Qiang, Yi Lu, Xin Qi, Xuefei Liu, Yukun Liu, Yongwei Li, Zhiyong Wang, Xiaopeng Wang |
| 2024 | Interspeech | Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection. | Xiaopeng Wang, Ruibo Fu, Zhengqi Wen, Zhiyong Wang, Yuankun Xie, Yukun Liu, Jianhua Tao, Xuefei Liu, Yongwei Li, Xin Qi, Yi Lu, Shuchen Shi |
| 2024 | Interspeech | Generalized Fake Audio Detection via Deep Stable Learning. | Zhiyong Wang, Ruibo Fu, Zhengqi Wen, Yuankun Xie, Yukun Liu, Xiaopeng Wang, Xuefei Liu, Yongwei Li, Jianhua Tao, Xin Qi, Yi Lu, Shuchen Shi |
| 2024 | Interspeech | Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy. | Yuankun Xie, Ruibo Fu, Zhengqi Wen, Zhiyong Wang, Xiaopeng Wang, Haonan Cheng, Long Ye, Jianhua Tao |
| 2024 | Interspeech | Residual Speaker Representation for One-Shot Voice Conversion. | Le Xu, Jiangyan Yi, Tao Wang, Yong Ren, Rongxiu Zhong, Zhengqi Wen, Jianhua Tao |
| 2024 | Interspeech | TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking. | Junzuo Zhou, Jiangyan Yi, Tao Wang, Jianhua Tao, Ye Bai, Chu Yuan Zhang, Yong Ren, Zhengqi Wen |
| 2023 | ICASSP | Learning From Yourself: A Self-Distillation Method For Fake Speech Detection. | Jun Xue, Cunhang Fan, Jiangyan Yi, Chenglong Wang, Zhengqi Wen, Dan Zhang, Zhao Lv |
| 2022 | ICASSP | Context-Aware Mask Prediction Network for End-to-End Text-Based Speech Editing. | Tao Wang, Jiangyan Yi, Liqun Deng, Ruibo Fu, Jianhua Tao, Zhengqi Wen |
| 2022 | ICASSP | ADD 2022: the first Audio Deep Synthesis Detection Challenge. | Jiangyan Yi, Ruibo Fu, Jianhua Tao, Shuai Nie, Haoxin Ma, Chenglong Wang, Tao Wang, Zhengkun Tian, Ye Bai, Cunhang Fan, Shan Liang, Shiming Wang, Shuai Zhang, Xinrui Yan, Le Xu, Zhengqi Wen, Haizhou Li |
| 2021 | ICASSP | Decoupling Pronunciation and Language for End-to-End Code-Switching Automatic Speech Recognition. | Shuai Zhang, Jiangyan Yi, Zhengkun Tian, Ye Bai, Jianhua Tao, Zhengqi Wen |
| 2021 | ICASSP | Bi-Level Style and Prosody Decoupling Modeling for Personalized End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Tao Wang, Chunyu Qiang |
| 2021 | ICASSP | Prosody and Voice Factorization for Few-Shot Speaker Adaptation in the Challenge M2voc 2021. | Tao Wang, Ruibo Fu, Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Chunyu Qiang, Shiming Wang |
| 2021 | Interspeech | End-to-End Spelling Correction Conditioned on Acoustic Feature for Code-Switching Speech Recognition. | Shuai Zhang, Jiangyan Yi, Zhengkun Tian, Ye Bai, Jianhua Tao, Xuefei Liu, Zhengqi Wen |
| 2021 | Interspeech | FSR: Accelerating the Inference Process of Transducer-Based Models by Applying Fast-Skip Regularization. | Zhengkun Tian, Jiangyan Yi, Ye Bai, Jianhua Tao, Shuai Zhang, Zhengqi Wen |
| 2020 | ICASSP | Focusing on Attention: Prosody Transfer and Adaptative Optimization Strategy for Multi-Speaker End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Tao Wang |
| 2020 | ICASSP | Synchronous Transformers for end-to-end Speech Recognition. | Zhengkun Tian, Jiangyan Yi, Ye Bai, Jianhua Tao, Shuai Zhang, Zhengqi Wen |
| 2020 | Interspeech | Listen Attentively, and Spell Once: Whole Sentence Generation via a Non-Autoregressive Architecture for Low-Latency Speech Recognition. | Ye Bai, Jiangyan Yi, Jianhua Tao, Zhengkun Tian, Zhengqi Wen, Shuai Zhang |
| 2020 | Interspeech | Gated Recurrent Fusion of Spatial and Spectral Features for Multi-Channel Speech Separation with Deep Embedding Representations. | Cunhang Fan, Jianhua Tao, Bin Liu, Jiangyan Yi, Zhengqi Wen |
| 2020 | Interspeech | Joint Training for Simultaneous Speech Denoising and Dereverberation with Deep Embedding Representations. | Cunhang Fan, Jianhua Tao, Bin Liu, Jiangyan Yi, Zhengqi Wen |
| 2020 | Interspeech | Dynamic Soft Windowing and Language Dependent Style Token for Code-Switching End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Chunyu Qiang, Tao Wang |
| 2020 | Interspeech | Dynamic Speaker Representations Adjustment and Decoder Factorization for Speaker Adaptation in End-to-End Speech Synthesis. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Jiangyan Yi, Tao Wang, Chunyu Qiang |
| 2020 | Interspeech | ARVC: An Auto-Regressive Voice Conversion System Without Parallel Training Data. | Zheng Lian, Zhengqi Wen, Xinyong Zhou, Songbai Pu, Shengkai Zhang, Jianhua Tao |
| 2020 | Interspeech | Spike-Triggered Non-Autoregressive Transformer for End-to-End Speech Recognition. | Zhengkun Tian, Jiangyan Yi, Jianhua Tao, Ye Bai, Shuai Zhang, Zhengqi Wen |
| 2020 | Interspeech | Non-Autoregressive End-to-End TTS with Coarse-to-Fine Decoding. | Tao Wang, Xuefei Liu, Jianhua Tao, Jiangyan Yi, Ruibo Fu, Zhengqi Wen |
| 2020 | Interspeech | Bi-Level Speaker Supervision for One-Shot Speech Synthesis. | Tao Wang, Jianhua Tao, Ruibo Fu, Jiangyan Yi, Zhengqi Wen, Chunyu Qiang |
| 2020 | Interspeech | Spoken Content and Voice Factorization for Few-Shot Speaker Adaptation. | Tao Wang, Jianhua Tao, Ruibo Fu, Jiangyan Yi, Zhengqi Wen, Rongxiu Zhong |
| 2019 | ICASSP | Phoneme Dependent Speaker Embedding and Model Factorization for Multi-speaker Speech Synthesis and Adaptation. | Ruibo Fu, Jianhua Tao, Zhengqi Wen, Yibin Zheng |
| 2019 | Interspeech | Learn Spelling from Teachers: Transferring Knowledge from Language Models to Sequence-to-Sequence Speech Recognition. | Ye Bai, Jiangyan Yi, Jianhua Tao, Zhengkun Tian, Zhengqi Wen |
| 2019 | Interspeech | A Time Delay Neural Network with Shared Weight Self-Attention for Small-Footprint Keyword Spotting. | Ye Bai, Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Zhengkun Tian, Chenghao Zhao, Cunhang Fan |
| 2019 | Interspeech | Discriminative Learning for Monaural Speech Separation Using Deep Embedding Features. | Cunhang Fan, Bin Liu, Jianhua Tao, Jiangyan Yi, Zhengqi Wen |
| 2019 | Interspeech | Self-Attention Transducers for End-to-End Speech Recognition. | Zhengkun Tian, Jiangyan Yi, Jianhua Tao, Ye Bai, Zhengqi Wen |
| 2019 | Interspeech | Forward-Backward Decoding for Regularizing End-to-End TTS. | Yibin Zheng, Xi Wang, Lei He, Shifeng Pan, Frank K. Soong, Zhengqi Wen, Jianhua Tao |
| 2018 | ICASSP | Adversarial Multilingual Training for Low-Resource Speech Recognition. | Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Ye Bai |
| 2018 | Interspeech | Transfer Learning Based Progressive Neural Networks for Acoustic Modeling in Statistical Parametric Speech Synthesis. | Ruibo Fu, Jianhua Tao, Yibin Zheng, Zhengqi Wen |
| 2018 | Interspeech | Deep Metric Learning for the Target Cost in Unit-Selection Speech Synthesizer. | Ruibo Fu, Jianhua Tao, Yibin Zheng, Zhengqi Wen |
| 2018 | Interspeech | On the Application and Compression of Deep Time Delay Neural Network for Embedded Statistical Parametric Speech Synthesis. | Yibin Zheng, Jianhua Tao, Zhengqi Wen, Ruibo Fu |
| 2018 | Interspeech | BLSTM-CRF Based End-to-End Prosodic Boundary Prediction with Context Sensitive Embeddings in a Text-to-Speech Front-End. | Yibin Zheng, Jianhua Tao, Zhengqi Wen, Ya Li |
| 2017 | Interspeech | Distilling Knowledge from an Ensemble of Models for Punctuation Prediction. | Jiangyan Yi, Jianhua Tao, Zhengqi Wen, Ya Li |
| 2017 | Interspeech | Investigating Efficient Feature Representation Methods and Training Objective for BLSTM-Based Phone Duration Prediction. | Yibin Zheng, Jianhua Tao, Zhengqi Wen, Ya Li, Bin Liu |
| 2016 | ICASSP | Long short term memory recurrent neural network based encoding method for emotion recognition in video. | Linlin Chao, Jianhua Tao, Minghao Yang, Ya Li, Zhengqi Wen |
| 2016 | Interspeech | The Parameterized Phoneme Identity Feature as a Continuous Real-Valued Vector for Neural Network Based Speech Synthesis. | Zhengqi Wen, Ya Li, Jianhua Tao |
| 2016 | Interspeech | Improving Prosodic Boundaries Prediction for Mandarin Speech Synthesis by Using Enhanced Embedding Feature and Model Fusion Approach. | Yibin Zheng, Ya Li, Zhengqi Wen, Xingguang Ding, Jianhua Tao |
| 2015 | Interspeech | A novel method of artificial bandwidth extension using deep architecture. | Bin Liu, Jianhua Tao, Zhengqi Wen, Ya Li, Danish Bukhari |
| 2015 | Interspeech | Combining extreme learning machine and decision tree for duration prediction in HMM based speech synthesis. | Yang Wang, Minghao Yang, Zhengqi Wen, Jianhua Tao |
| 2014 | ICASSP | A novel hybrid mandarin speech synthesis system using different base units for model training and concatenation. | Ran Zhang, Jianhua Tao, Ya Li, Zhengqi Wen |
| 2014 | Interspeech | A hierarchical viterbi algorithm for Mandarin hybrid speech synthesis system. | Ran Zhang, Zhengqi Wen, Jianhua Tao, Ya Li, Bing Liu, Xiaoyan Lou |
| 2012 | Interspeech | Pitch-Scaled Analysis based Residual Reconstruction for Speech Analysis and Synthesis. | Zhengqi Wen, Hideki Kawahara, Jianhua Tao |
| 2012 | Interspeech | Amplitude Spectrum based Excitation Model for HMM-based Speech Synthesis. | Zhengqi Wen, Jianhua Tao |
| 2011 | Interspeech | Inverse Filtering Based Harmonic Plus Noise Excitation Model for HMM-Based Speech Synthesis. | Zhengqi Wen, Jianhua Tao |