| 2026 | AAAI | DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models. | Yuanyuan Wang, Dongchao Yang, Yiwen Shao, Hangting Chen, Jiankun Zhao, Zhiyong Wu, Helen Meng, Xixin Wu |
| 2026 | ACL | Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization. | Rongjie Huang, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2026 | ACL | UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment. | Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Steven Y. Guo, Helen M. Meng, Xixin Wu |
| 2025 | ACL | Generate, Discriminate, Evolve: Enhancing Context Faithfulness via Fine-Grained Sentence-Level Self-Evolution. | Kun Li, Tianhua Zhang, Yunxiang Li, Hongyin Luo, Abdalla Mohamed Salama Sayed Moustafa, Xixin Wu, James R. Glass, Helen M. Meng |
| 2025 | ACL | Decoding on Graphs: Faithful and Sound Reasoning on Knowledge Graphs through Generation of Well-Formed Chains. | Kun Li, Tianhua Zhang, Xixin Wu, Hongyin Luo, James R. Glass, Helen M. Meng |
| 2025 | ACL | Autoregressive Speech Synthesis without Vector Quantization. | Lingwei Meng, Long Zhou, Shujie Liu, Sanyuan Chen, Bing Han, Shujie Hu, Yanqing Liu, Jinyu Li, Sheng Zhao, Xixin Wu, Helen M. Meng, Furu Wei |
| 2025 | EMNLP | RAG-Zeval: Enhancing RAG Responses Evaluator through End-to-End Reasoning and Ranking-Based Reinforcement Learning. | Kun Li, Yunxiang Li, Tianhua Zhang, Hongyin Luo, Xixin Wu, James R. Glass, Helen M. Meng |
| 2025 | ICASSP | Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC. | Jiawen Kang, Lingwei Meng, Mingyu Cui, Yuejiao Wang, Xixin Wu, Xunying Liu, Helen Meng |
| 2025 | ICASSP | DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions. | Weidong Chen, Shan Yang, Guangzhi Li, Xixin Wu |
| 2025 | ICASSP | Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation. | Haohan Guo, Fenglong Xie, Dongchao Yang, Xixin Wu, Helen Meng |
| 2025 | ICASSP | Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions. | Lingwei Meng, Shujie Hu, Jiawen Kang, Zhaoqing Li, Yuejiao Wang, Wenxuan Wu, Xixin Wu, Xunying Liu, Helen Meng |
| 2025 | ICASSP | AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions. | Yuanyuan Wang, Hangting Chen, Dongchao Yang, Zhiyong Wu, Xixin Wu |
| 2025 | ICASSP | Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data. | Jingran Xie, Shun Lei, Yue Yu, Yang Xiang, Hui Wang, Xixin Wu, Zhiyong Wu |
| 2025 | ICML | ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling. | Dongchao Yang, Songxiang Liu, Haohan Guo, Jiankun Zhao, Yuanyuan Wang, Helin Wang, Zeqian Ju, Xubo Liu, Xueyuan Chen, Xu Tan, Xixin Wu, Helen M. Meng |
| 2025 | Interspeech | On the Within-class Variation Issue in Alzheimer's Disease Detection. | Jiawen Kang, Dongrui Han, Lingwei Meng, Jingyan Zhou, Jinchao Li, Xixin Wu, Helen Meng |
| 2025 | Interspeech | DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model. | Xueyuan Chen, Dongchao Yang, Wenxuan Wu, Minglin Wu, Jing Xu, Xixin Wu, Zhiyong Wu, Helen Meng |
| 2025 | Interspeech | EEG-based Speech Decoding Based on Multi-mode Joint Modeling. | Peiran Li, Fei Chen, Xixin Wu |
| 2025 | Interspeech | Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction. | Wenxuan Wu, Shuai Wang, Xixin Wu, Helen Meng, Haizhou Li |
| 2025 | Interspeech | Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving. | Jingran Xie, Xiang Li, Hui Wang, Yue Yu, Yang Xiang, Xixin Wu, Zhiyong Wu |
| 2025 | Interspeech | WAKE: Watermarking Audio with Key Enrichment. | Yaoxun Xu, Jianwei Yu, Hangting Chen, Zhiyong Wu, Xixin Wu, Dong Yu, Rongzhi Gu, Yi Luo |
| 2025 | Interspeech | Defending Unauthorized Voice Cloning with Watermark-Aware Codecs. | Jiankun Zhao, Lingwei Meng, Chengxi Deng, Helen Meng, Xixin Wu |
| 2024 | AAAI | SimCalib: Graph Neural Network Calibration Based on Similarity between Nodes. | Boshi Tang, Zhiyong Wu, Xixin Wu, Qiaochu Huang, Jun Chen, Shun Lei, Helen Meng |
| 2024 | EMNLP | Adaptive Query Rewriting: Aligning Rewriters through Marginal Probability of Conversational Answers. | Tianhua Zhang, Kun Li, Hongyin Luo, Xixin Wu, James R. Glass, Helen Meng |
| 2024 | ICASSP | Cross-Speaker Encoding Network for Multi-Talker Speech Recognition. | Jiawen Kang, Lingwei Meng, Mingyu Cui, Haohan Guo, Xixin Wu, Xunying Liu, Helen Meng |
| 2024 | ICASSP | Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction. | Xueyuan Chen, Yuejiao Wang, Xixin Wu, Disong Wang, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2024 | ICASSP | Stylespeech: Self-Supervised Style Enhancing with VQ-VAE-Based Pre-Training for Expressive Audiobook Speech Synthesis. | Xueyuan Chen, Xi Wang, Shaofei Zhang, Lei He, Zhiyong Wu, Xixin Wu, Helen Meng |
| 2024 | ICASSP | Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts. | Shun Lei, Yixuan Zhou, Liyang Chen, Dan Luo, Zhiyong Wu, Xixin Wu, Shiyin Kang, Tao Jiang, Yahui Zhou, Yuxing Han, Helen Meng |
| 2024 | ICASSP | Unifying One-Shot Voice Conversion and Cloning with Disentangled Speech Representations. | Hui Lu, Xixin Wu, Haohan Guo, Songxiang Liu, Zhiyong Wu, Helen Meng |
| 2024 | ICASSP | UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization. | Yuejiao Wang, Xixin Wu, Disong Wang, Lingwei Meng, Helen Meng |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | IJCNN | Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy. | Wenxuan Wu, Xueyuan Chen, Xixin Wu, Haizhou Li, Helen Meng |
| 2024 | Interspeech | CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction. | Xueyuan Chen, Dongchao Yang, Dingdong Wang, Xixin Wu, Zhiyong Wu, Helen Meng |
| 2024 | Interspeech | Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models. | Weiqin Li, Peiji Yang, Yicheng Zhong, Yixuan Zhou, Zhisheng Wang, Zhiyong Wu, Xixin Wu, Helen Meng |
| 2024 | Interspeech | Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System. | Lingwei Meng, Jiawen Kang, Yuejiao Wang, Zengrui Jin, Xixin Wu, Xunying Liu, Helen Meng |
| 2024 | Interspeech | Large Language Model-based FMRI Encoding of Language Functions for Subjects with Neurocognitive Disorder. | Yuejiao Wang, Xianmin Gong, Lingwei Meng, Xixin Wu, Helen Meng |
| 2024 | Interspeech | Prompting Large Language Models with Mispronunciation Detection and Diagnosis Abilities. | Minglin Wu, Jing Xu, Xixin Wu, Helen Meng |
| 2024 | Interspeech | Seamless Language Expansion: Enhancing Multilingual Mastery in Self-Supervised Models. | Jing Xu, Minglin Wu, Xixin Wu, Helen Meng |
| 2024 | Interspeech | SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models. | Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng |
| 2024 | NAACL | Natural Language Embedded Programs for Hybrid Language Symbolic Reasoning. | Tianhua Zhang, Jiaxin Ge, Hongyin Luo, Yung-Sung Chuang, Mingye Gao, Yuan Gong, Yoon Kim, Xixin Wu, Helen Meng, Jim Glass |
| 2024 | NAACL | Rethinking Machine Ethics - Can LLMs Perform Moral Reasoning through the Lens of Moral Theories? | Jingyan Zhou, Minda Hu, Junan Li, Xiaoying Zhang, Xixin Wu, Irwin King, Helen Meng |
| 2023 | EMNLP | Search Augmented Instruction Learning. | Hongyin Luo, Tianhua Zhang, Yung-Sung Chuang, Yuan Gong, Yoon Kim, Xixin Wu, Helen Meng, James R. Glass |
| 2023 | ICASSP | Leveraging Pretrained Representations With Task-Related Keywords for Alzheimer's Disease Detection. | Jinchao Li, Kaitao Song, Junan Li, Bo Zheng, Dongsheng Li, Xixin Wu, Xunying Liu, Helen Meng |
| 2023 | ICASSP | VF-Taco2: Towards Fast and Lightweight Synthesis for Autoregressive Models with Variation Autoencoder and Feature Distillation. | Yuhao Liu, Cheng Gong, Longbiao Wang, Xixin Wu, Qiuyu Liu, Jianwu Dang |
| 2023 | ICASSP | A Hierarchical Regression Chain Framework for Affective Vocal Burst Recognition. | Jinchao Li, Xixin Wu, Kaitao Song, Dongsheng Li, Xunying Liu, Helen Meng |
| 2023 | ICASSP | A Sidecar Separator Can Convert A Single-Talker Speech Recognition System to A Multi-Talker One. | Lingwei Meng, Jiawen Kang, Mingyu Cui, Yuejiao Wang, Xixin Wu, Helen Meng |
| 2023 | Interspeech | PunCantonese: A Benchmark Corpus for Low-Resource Cantonese Punctuation Restoration from Speech Transcripts. | Yunxiang Li, Pengfei Liu, Xixin Wu, Helen Meng |
| 2023 | Interspeech | Unified Modeling of Multi-Talker Overlapped Speech Recognition and Diarization with a Sidecar Separator. | Lingwei Meng, Jiawen Kang, Mingyu Cui, Haibin Wu, Xixin Wu, Helen Meng |
| 2023 | Interspeech | Integrated and Enhanced Pipeline System to Support Spoken Language Analytics for Screening Neurocognitive Disorders. | Helen Meng, Brian Mak, Man-Wai Mak, Helene H. Fung, Xianmin Gong, Timothy C. Y. Kwok, Xunying Liu, Vincent C. T. Mok, Patrick C. M. Wong, Jean Woo, Xixin Wu, Ka Ho Wong, Sean Shensheng Xu, Naijun Zheng, Ranzo Huang, Jiawen Kang, Xiaoquan Ke, Junan Li, Jinchao Li, Yi Wang |
| 2022 | ICASSP | A Multitask Learning Framework for Speaker Change Detection with Content Information from Unsupervised Speech Decomposition. | Hang Su, Danyang Zhao, Long Dang, Minglei Li, Xixin Wu, Xunying Liu, Helen Meng |
| 2022 | ICASSP | Speaker Identity Preservation in Dysarthric Speech Reconstruction by Adversarial Speaker Adaptation. | Disong Wang, Songxiang Liu, Xixin Wu, Hui Lu, Lifa Sun, Xunying Liu, Helen Meng |
| 2022 | ICASSP | Neural Architecture Search for Speech Emotion Recognition. | Xixin Wu, Shoukang Hu, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2022 | ICASSP | Characterizing the Adversarial Vulnerability of Speech self-Supervised Learning. | Haibin Wu, Bo Zheng, Xu Li, Xixin Wu, Hung-Yi Lee, Helen Meng |
| 2022 | ICASSP | The CUHK-Tencent Speaker Diarization System for the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge. | Naijun Zheng, Na Li, Xixin Wu, Lingwei Meng, Jiawen Kang, Haibin Wu, Chao Weng, Dan Su, Helen Meng |
| 2022 | Interspeech | Improving Mandarin Prosodic Structure Prediction with Multi-level Contextual Information. | Jie Chen, Changhe Song, Deyi Tuo, Xixin Wu, Shiyin Kang, Zhiyong Wu, Helen Meng |
| 2022 | Interspeech | A Multi-Scale Time-Frequency Spectrogram Discriminator for GAN-based Non-Autoregressive TTS. | Haohan Guo, Hui Lu, Xixin Wu, Helen Meng |
| 2022 | Interspeech | A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS. | Haohan Guo, Feng-Long Xie, Frank K. Soong, Xixin Wu, Helen Meng |
| 2022 | Interspeech | Exploring linguistic feature and model combination for speech recognition based automatic AD detection. | Yi Wang, Tianzi Wang, Zi Ye, Lingwei Meng, Shoukang Hu, Xixin Wu, Xunying Liu, Helen Meng |
| 2022 | Interspeech | Spoofing-Aware Speaker Verification by Multi-Level Fusion. | Haibin Wu, Lingwei Meng, Jiawen Kang, Jinchao Li, Xu Li, Xixin Wu, Hung-yi Lee, Helen Meng |
| 2021 | Interspeech | Deliberation-Based Multi-Pass Speech Synthesis. | Qingyun Dou, Xixin Wu, Moquan Wan, Yiting Lu, Mark J. F. Gales |
| 2021 | Interspeech | Channel-Wise Gated Res2Net: Towards Robust Detection of Synthetic Speech Attacks. | Xu Li, Xixin Wu, Hui Lu, Xunying Liu, Helen Meng |
| 2021 | Interspeech | VAENAR-TTS: Variational Auto-Encoder Based Non-AutoRegressive Text-to-Speech Synthesis. | Hui Lu, Zhiyong Wu, Xixin Wu, Xu Li, Shiyin Kang, Xunying Liu, Helen Meng |
| 2021 | Interspeech | Learning Explicit Prosody Models and Deep Speaker Embeddings for Atypical Voice Conversion. | Disong Wang, Songxiang Liu, Lifa Sun, Xixin Wu, Xunying Liu, Helen Meng |
| 2020 | ICASSP | Code-Switched Speech Synthesis Using Bilingual Phonetic Posteriorgram with Only Monolingual Corpora. | Yuewen Cao, Songxiang Liu, Xixin Wu, Shiyin Kang, Peng Liu, Zhiyong Wu, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2020 | ICASSP | End-To-End Accent Conversion Without Using Native Utterances. | Songxiang Liu, Disong Wang, Yuewen Cao, Lifa Sun, Xixin Wu, Shiyin Kang, Zhiyong Wu, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2020 | ICASSP | Adversarial Attacks on GMM I-Vector Based Speaker Verification Systems. | Xu Li, Jinghua Zhong, Xixin Wu, Jianwei Yu, Xunying Liu, Helen Meng |
| 2020 | ICASSP | End-To-End Voice Conversion Via Cross-Modal Knowledge Distillation for Dysarthric Speech Reconstruction. | Disong Wang, Jianwei Yu, Xixin Wu, Songxiang Liu, Lifa Sun, Xunying Liu, Helen Meng |
| 2020 | Interspeech | Non-Native Children's Automatic Speech Recognition: The INTERSPEECH 2020 Shared Task ALTA Systems. | Kate M. Knill, Linlin Wang, Yu Wang, Xixin Wu, Mark J. F. Gales |
| 2020 | Interspeech | Investigating Robustness of Adversarial Samples Detection for Automatic Speaker Verification. | Xu Li, Na Li, Jinghua Zhong, Xixin Wu, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2020 | Interspeech | Ensemble Approaches for Uncertainty in Spoken Language Assessment. | Xixin Wu, Kate M. Knill, Mark J. F. Gales, Andrey Malinin |
| 2020 | Interspeech | Speaker-Aware Linear Discriminant Analysis in Speaker Verification. | Naijun Zheng, Xixin Wu, Jinghua Zhong, Xunying Liu, Helen Meng |
| 2019 | EMNLP | Coupling Global and Local Context for Unsupervised Aspect Extraction. | Ming Liao, Jing Li, Haisong Zhang, Lingzhi Wang, Xixin Wu, Kam-Fai Wong |
| 2019 | ICASSP | End-to-end Code-switched TTS with Mix of Monolingual Recordings. | Yuewen Cao, Xixin Wu, Songxiang Liu, Jianwei Yu, Xu Li, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2019 | ICASSP | Learning Discriminative Features from Spectrograms Using Center Loss for Speech Emotion Recognition. | Dongyang Dai, Zhiyong Wu, Runnan Li, Xixin Wu, Jia Jia, Helen Meng |
| 2019 | ICASSP | Bayesian and Gaussian Process Neural Networks for Large Vocabulary Continuous Speech Recognition. | Shoukang Hu, Max W. Y. Lam, Xurong Xie, Shansong Liu, Jianwei Yu, Xixin Wu, Xunying Liu, Helen Meng |
| 2019 | ICASSP | Quasi-fully Convolutional Neural Network with Variational Inference for Speech Synthesis. | Mu Wang, Xixin Wu, Zhiyong Wu, Shiyin Kang, Deyi Tuo, Guangzhi Li, Dan Su, Dong Yu, Helen Meng |
| 2019 | ICASSP | Speech Emotion Recognition Using Capsule Networks. | Xixin Wu, Songxiang Liu, Yuewen Cao, Xu Li, Jianwei Yu, Dongyang Dai, Xi Ma, Shoukang Hu, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2019 | ICASSP | Recurrent Neural Network Language Model Training Using Natural Gradient. | Jianwei Yu, Max W. Y. Lam, Xie Chen, Shoukang Hu, Songxiang Liu, Xixin Wu, Xunying Liu, Helen Meng |
| 2019 | Interspeech | Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-Trained BERT. | Dongyang Dai, Zhiyong Wu, Shiyin Kang, Xixin Wu, Jia Jia, Dan Su, Dong Yu, Helen Meng |
| 2019 | Interspeech | LF-MMI Training of Bayesian and Gaussian Process Time Delay Neural Networks for Speech Recognition. | Shoukang Hu, Xurong Xie, Shansong Liu, Max W. Y. Lam, Jianwei Yu, Xixin Wu, Xunying Liu, Helen Meng |
| 2019 | Interspeech | Jointly Trained Conversion Model and WaveNet Vocoder for Non-Parallel Voice Conversion Using Mel-Spectrograms and Phonetic Posteriorgrams. | Songxiang Liu, Yuewen Cao, Xixin Wu, Lifa Sun, Xunying Liu, Helen Meng |
| 2019 | Interspeech | Unsupervised Methods for Audio Classification from Lecture Discussion Recordings. | Hang Su, Borislav Dzodzo, Xixin Wu, Xunying Liu, Helen Meng |
| 2019 | Interspeech | Comparative Study of Parametric and Representation Uncertainty Modeling for Recurrent Neural Network Language Models. | Jianwei Yu, Max W. Y. Lam, Shoukang Hu, Xixin Wu, Xu Li, Yuewen Cao, Xunying Liu, Helen Meng |
| 2018 | ICASSP | Feature Based Adaptation for Speaking Style Synthesis. | Xixin Wu, Lifa Sun, Shiyin Kang, Songxiang Liu, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2018 | Interspeech | Unsupervised Discovery of Non-native Phonetic Patterns in L2 English Speech for Mispronunciation Detection and Diagnosis. | Xu Li, Shaoguang Mao, Xixin Wu, Kun Li, Xunying Liu, Helen Meng |
| 2018 | Interspeech | Voice Conversion Across Arbitrary Speakers Based on a Single Target-Speaker Utterance. | Songxiang Liu, Jinghua Zhong, Lifa Sun, Xixin Wu, Xunying Liu, Helen Meng |
| 2018 | Interspeech | Rapid Style Adaptation Using Residual Error Embedding for Expressive Speech Synthesis. | Xixin Wu, Yuewen Cao, Mu Wang, Songxiang Liu, Shiyin Kang, Zhiyong Wu, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2018 | Interspeech | Development of the CUHK Dysarthric Speech Recognition System for the UA Speech Corpus. | Jianwei Yu, Xurong Xie, Shansong Liu, Shoukang Hu, Max W. Y. Lam, Xixin Wu, Ka Ho Wong, Xunying Liu, Helen Meng |
| 2015 | ACII | Understanding speaking styles of internet speech data with LSTM and low-resource training. | Xixin Wu, Zhiyong Wu, Yishuang Ning, Jia Jia, Lianhong Cai, Helen M. Meng |