| 2026 | ACL | FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining. | Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen |
| 2025 | ICASSP | SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs. | Wenxi Chen, Ziyang Ma, Xiquan Li, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Kai Yu, Xie Chen |
| 2025 | ICASSP | DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning. | Xiquan Li, Wenxi Chen, Ziyang Ma, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Qiuqiang Kong, Xie Chen |
| 2025 | ICASSP | PicoAudio: Enabling Precise Temporal Controllability in Text-to-Audio Generation. | Zeyu Xie, Xuenan Xu, Zhizheng Wu, Mengyue Wu |
| 2025 | ICASSP | AudioTime: A Temporally-aligned Audio-text Benchmark Dataset. | Zeyu Xie, Xuenan Xu, Zhizheng Wu, Mengyue Wu |
| 2025 | ICASSP | Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance. | Yaoyun Zhang, Xuenan Xu, Mengyue Wu |
| 2024 | ICASSP | Enhancing Audio Generation Diversity with Visual Information. | Zeyu Xie, Baihan Li, Xuenan Xu, Mengyue Wu, Kai Yu |
| 2024 | ICASSP | A Detailed Audio-Text Data Simulation Pipeline Using Single-Event Sounds. | Xuenan Xu, Xiaohang Xu, Zeyu Xie, Pingyue Zhang, Mengyue Wu, Kai Yu |
| 2024 | Interspeech | DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation. | Baihan Li, Zeyu Xie, Xuenan Xu, Yiwei Guo, Ming Yan, Ji Zhang, Kai Yu, Mengyue Wu |
| 2024 | Interspeech | FakeSound: Deepfake General Audio Detection. | Zeyu Xie, Baihan Li, Xuenan Xu, Zheng Liang, Kai Yu, Mengyue Wu |
| 2024 | Interspeech | Efficient Audio Captioning with Encoder-Level Knowledge Distillation. | Xuenan Xu, Haohe Liu, Mengyue Wu, Wenwu Wang, Mark D. Plumbley |
| 2024 | Interspeech | Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models. | Xuenan Xu, Pingyue Zhang, Ming Yan, Ji Zhang, Mengyue Wu |
| 2023 | ICASSP | Diverse and Vivid Sound Generation from Text Descriptions. | Guangwei Li, Xuenan Xu, Lingfeng Dai, Mengyue Wu, Kai Yu |
| 2023 | ICASSP | Investigating Pooling Strategies and Loss Functions for Weakly-Supervised Text-to-Audio Grounding via Contrastive Learning. | Xuenan Xu, Mengyue Wu, Kai Yu |
| 2023 | Interspeech | Enhance Temporal Relations in Audio Captioning with Sound Event Detection. | Zeyu Xie, Xuenan Xu, Mengyue Wu, Kai Yu |
| 2022 | ICASSP | Category-Adapted Sound Event Enhancement with Weakly Labeled Data. | Guangwei Li, Xuenan Xu, Heinrich Dinkel, Mengyue Wu, Kai Yu |
| 2022 | ICASSP | Navigating Audio-Visual Event Detection Across Mismatched Modalities. | Guangwei Li, Xuenan Xu, Mengyue Wu, Kai Yu |
| 2022 | ICASSP | Audio-Text Retrieval in Context. | Siyu Lou, Xuenan Xu, Mengyue Wu, Kai Yu |
| 2022 | ICASSP | Diversity-Controllable and Accurate Audio Captioning Based on Neural Condition. | Xuenan Xu, Mengyue Wu, Kai Yu |
| 2022 | ICASSP | Can Audio Captions Be Evaluated With Image Caption Metrics? | Zelin Zhou, Zhiling Zhang, Xuenan Xu, Zeyu Xie, Mengyue Wu, Kenny Q. Zhu |
| 2021 | ICASSP | Text-to-Audio Grounding: Building Correspondence Between Captions and Sound Events. | Xuenan Xu, Heinrich Dinkel, Mengyue Wu, Kai Yu |
| 2021 | ICASSP | Investigating Local and Global Information for Automated Audio Captioning with Transfer Learning. | Xuenan Xu, Heinrich Dinkel, Mengyue Wu, Zeyu Xie, Kai Yu |
| 2021 | Interspeech | A Lightweight Framework for Online Voice Activity Detection in the Wild. | Xuenan Xu, Heinrich Dinkel, Mengyue Wu, Kai Yu |
| 2020 | CHI | Creating and Evaluating a Goal Setting Prototype for MOOCs. | Nathan Magyar, Xuenan Xu, Molly Maher |