| 2025 | ACL | ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors. | Yuguo Yin, Yuxin Xie, Wenyuan Yang, Dongchao Yang, Jinghan Ru, Xianwei Zhuang, Liming Liang, Yuexian Zou |
| 2025 | CVPR | VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification. | Xianwei Zhuang, Zhihong Zhu, Yuxin Xie, Liming Liang, Yuexian Zou |
| 2025 | ICASSP | Audio-Faces Intra-Frame Alignment with Graph Attention Networks for Active Speaker Detection. | Yongkang Yin, Xusheng Yang, Liming Liang, Xu Li, Yuexian Zou |
| 2025 | Interspeech | FoleyMaster: High-Quality Video-to-Audio Synthesis via MLLM-Augmented Prompt Tuning and Joint Semantic-Temporal Adaptation. | Liming Liang, Luo Chen, Yuehan Jin, Xianwei Zhuang, Yuxin Xie, Yongkang Yin, Yuexian Zou |
| 2025 | Interspeech | SpeechSEC: A Unified Multi-Task Framework for Speech Synthesis, Editing, and Continuation. | Liming Liang, Dongchao Yang, Xianwei Zhuang, Yuxin Xie, Luo Chen, Yuehan Jin, Yuexian Zou |
| 2024 | ACL | PCAD: Towards ASR-Robust Spoken Language Understanding via Prototype Calibration and Asymmetric Decoupling. | Xianwei Zhuang, Xuxin Cheng, Liming Liang, Yuxin Xie, Zhichang Wang, Zhiqi Huang, Yuexian Zou |
| 2024 | EMNLP | Game on Tree: Visual Hallucination Mitigation via Coarse-to-Fine View Tree and Game Theory. | Xianwei Zhuang, Zhihong Zhu, Zhanpeng Chen, Yuxin Xie, Liming Liang, Yuexian Zou |
| 2024 | Interspeech | GPA: Global and Prototype Alignment for Audio-Text Retrieval. | Yuxin Xie, Zhihong Zhu, Xianwei Zhuang, Liming Liang, Zhichang Wang, Yuexian Zou |
| 2024 | NAACL | MaCSC: Towards Multimodal-augmented Pre-trained Language Models via Conceptual Prototypes and Self-balancing Calibration. | Xianwei Zhuang, Zhichang Wang, Xuxin Cheng, Yuxin Xie, Liming Liang, Yuexian Zou |