| 2025 | CVPR | ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark. | Ronghao Dang, Yuqian Yuan, Wenqi Zhang, Yifei Xin, Boqiang Zhang, Long Li, Liuyi Wang, Qinyang Zeng, Xin Li, Lidong Bing |
| 2025 | EMNLP | Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents. | Long Li, Weiwen Xu, Jiayan Guo, Ruochen Zhao, Xingxuan Li, Yuqian Yuan, Boqiang Zhang, Yuming Jiang, Yifei Xin, Ronghao Dang, Yu Rong, Deli Zhao, Tian Feng, Lidong Bing |
| 2025 | ICCV | Addressing Representation Collapse in Vector Quantized Models with One Linear Layer. | Yongxin Zhu, Bocheng Li, Yifei Xin, Zhihua Xia, Linli Xu |
| 2024 | ACL | Soul-Mix: Enhancing Multimodal Machine Translation with Manifold Mixup. | Xuxin Cheng, Ziyu Yao, Yifei Xin, Hao An, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2024 | Interspeech | DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval. | Yifei Xin, Xuxin Cheng, Zhihong Zhu, Xusheng Yang, Yuexian Zou |
| 2024 | Interspeech | Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation. | Yifei Xin, Zhihong Zhu, Xuxin Cheng, Xusheng Yang, Yuexian Zou |
| 2024 | Interspeech | MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning. | Hang Zhao, Yifei Xin, Zhesong Yu, Bilei Zhu, Lu Lu, Zejun Ma |
| 2023 | ICASSP | Improving Speech Enhancement via Event-Based Query. | Yifei Xin, Xiulian Peng, Yan Lu |
| 2023 | ICASSP | Improving Weakly Supervised Sound Event Detection with Causal Intervention. | Yifei Xin, Dongchao Yang, Fan Cui, Yujun Wang, Yuexian Zou |
| 2023 | ICASSP | Improving Text-Audio Retrieval by Text-Aware Attention Pooling and Prior Matrix Revised Loss. | Yifei Xin, Dongchao Yang, Yuexian Zou |
| 2023 | Interspeech | Masked Audio Modeling with CLAP and Multi-Objective Learning. | Yifei Xin, Xiulian Peng, Yan Lu |
| 2023 | Interspeech | Background-aware Modeling for Weakly Supervised Sound Event Detection. | Yifei Xin, Dongchao Yang, Yuexian Zou |
| 2023 | Interspeech | Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions. | Yifei Xin, Yuexian Zou |
| 2022 | Interspeech | Audio Pyramid Transformer with Domain Adaption for Weakly Supervised Sound Event Detection and Audio Classification. | Yifei Xin, Dongchao Yang, Yuexian Zou |