| 2025 | CIKM | AdaHet-MKD: An Adaptive Heterogeneous Multi-teacher Knowledge Distillation for Medical Image Analysis. | Helin Wang, Wei Du, Ning Liu, Qian Li, Yanyu Xu, Lizhen Cui |
| 2025 | ICASSP | SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer. | Helin Wang, Jiarui Hai, Yen-Ju Lu, Karan Thakkar, Mounya Elhilali, Najim Dehak |
| 2025 | ICASSP | SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis. | Helin Wang, Meng Yu, Jiarui Hai, Chen Chen, Yuchen Hu, Rilin Chen, Najim Dehak, Dong Yu |
| 2025 | ICCV | DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs. | Jiahe Zhao, Rongkun Zheng, Yi Wang, Helin Wang, Hengshuang Zhao |
| 2025 | ICLR | Audio Large Language Models Can Be Descriptive Speech Quality Evaluators. | Chen Chen, Yuchen Hu, Siyin Wang, Helin Wang, Zhehuai Chen, Chao Zhang, Chao-Han Huck Yang, Eng Siong Chng |
| 2025 | ICML | ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling. | Dongchao Yang, Songxiang Liu, Haohan Guo, Jiankun Zhao, Yuanyuan Wang, Helin Wang, Zeqian Ju, Xubo Liu, Xueyuan Chen, Xu Tan, Xixin Wu, Helen M. Meng |
| 2025 | Interspeech | EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer. | Jiarui Hai, Yong Xu, Hao Zhang, Chenxing Li, Helin Wang, Mounya Elhilali, Dong Yu |
| 2024 | COLING | Finding Spoken Identifications: Using GPT-4 Annotation for an Efficient and Fast Dataset Creation Pipeline. | Maliha Jahan, Helin Wang, Thomas Thebaud, Yinglun Sun, Giang Ha Le, Zsuzsanna Fagyal, Odette Scharenborg, Mark Hasegawa-Johnson, Laureano Moro-Velzquez, Najim Dehak |
| 2024 | ICASSP | DPM-TSE: A Diffusion Probabilistic Model for Target Sound Extraction. | Jiarui Hai, Helin Wang, Dongchao Yang, Karan Thakkar, Najim Dehak, Mounya Elhilali |
| 2024 | Interspeech | DreamVoice: Text-Guided Voice Conversion. | Jiarui Hai, Karan Thakkar, Helin Wang, Zengyi Qin, Mounya Elhilali |
| 2024 | Interspeech | Noise-robust Speech Separation with Fast Generative Correction. | Helin Wang, Jess Villalba, Laureano Moro-Velzquez, Jiarui Hai, Thomas Thebaud, Najim Dehak |
| 2024 | IGARSS | A Paradigm for Generating Operational Seamless Land Surface Temperature Products. | Jie Cheng, Shugui Zhou, Quan Zhang, Xiangchen Meng, Weihan Liu, Shengyue Dong, Aixia Yang, Qi Zeng, Manqing Liu, Zhengyang Wang, Mengfei Guo, Chenze Wu, Hao Sun, Helin Wang |
| 2023 | ICASSP | Masked Spectrogram Prediction for Self-Supervised Audio Pre-Training. | Dading Chong, Helin Wang, Peilin Zhou, Qingcheng Zeng |
| 2023 | Interspeech | DuTa-VC: A Duration-aware Typical-to-atypical Voice Conversion Approach with Diffusion Probabilistic Model. | Helin Wang, Thomas Thebaud, Jess Villalba, Myra Sydnor, Becky Lammers, Najim Dehak, Laureano Moro-Velzquez |
| 2023 | Interspeech | NoreSpeech: Knowledge Distillation based Conditional Diffusion Model for Noise-robust Expressive TTS. | Dongchao Yang, Songxiang Liu, Helin Wang, Jianwei Yu, Chao Weng, Yuexian Zou |
| 2022 | ICASSP | A Mutual Learning Framework for Few-Shot Sound Event Detection. | Dongchao Yang, Helin Wang, Yuexian Zou, Zhongjie Ye, Wenwu Wang |
| 2022 | Interspeech | Improving Target Sound Extraction with Timestamp Information. | Helin Wang, Dongchao Yang, Chao Weng, Jianwei Yu, Yuexian Zou |
| 2022 | Interspeech | RaDur: A Reference-aware and Duration-robust Network for Target Sound Detection. | Dongchao Yang, Helin Wang, Zhongjie Ye, Yuexian Zou, Wenwu Wang |
| 2022 | Interspeech | Calibrate and Refine! A Novel and Agile Framework for ASR Error Robust Intent Detection. | Peilin Zhou, Dading Chong, Helin Wang, Qingcheng Zeng |
| 2021 | AAAI | Audio-Oriented Multimodal Machine Comprehension via Dynamic Inter- and Intra-modality Attention. | Zhiqi Huang, Fenglin Liu, Xian Wu, Shen Ge, Helin Wang, Wei Fan, Yuexian Zou |
| 2021 | ICASSP | A Global-Local Attention Framework for Weakly Labelled Audio Tagging. | Helin Wang, Yuexian Zou, Wenwu Wang |
| 2021 | ICASSP | Contrastive Self-Supervised Learning for Text-Independent Speaker Verification. | Haoran Zhang, Yuexian Zou, Helin Wang |
| 2021 | Interspeech | TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation. | Helin Wang, Bo Wu, Lianwu Chen, Meng Yu, Jianwei Yu, Yong Xu, Shi-Xiong Zhang, Chao Weng, Dan Su, Dong Yu |
| 2021 | Interspeech | SpecAugment++: A Hidden Space Data Augmentation Method for Acoustic Scene Classification. | Helin Wang, Yuexian Zou, Wenwu Wang |
| 2021 | Interspeech | Unsupervised Multi-Target Domain Adaptation for Acoustic Scene Classification. | Dongchao Yang, Helin Wang, Yuexian Zou |
| 2020 | Interspeech | Environmental Sound Classification with Parallel Temporal-Spectral Attention. | Helin Wang, Yuexian Zou, Dading Chong, Wenwu Wang |
| 2019 | ACII | What Affects the Performance of Convolutional Neural Networks for Audio Event Classification. | Helin Wang, Dading Chong, Dongyan Huang, Yuexian Zou |
| 2017 | SMC | Gait generation and control of biped robot with moving torso based on virtual constraint. | Helin Wang, Hao Zhang, Qijun Chen |