| 2026 | AAAI | Task-Aware 3D Affordance Segmentation via 2D Guidance and Geometric Refinement. | Lian He, Meng Liu, Qilang Ye, Yu Zhou, Xiang Deng, Gangyi Ding |
| 2026 | AAAI | SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition. | Qilang Ye, Yu Zhou, Lian He, Jie Zhang, Xuanming Guo, Jiayu Zhang, Mingkui Tan, Weicheng Xie, Yue Sun, Tao Tan, Xiaochen Yuan, Ghada Khoriba, Zitong Yu |
| 2026 | AAAI | When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion? | Qilang Ye, Wei Zeng, Meng Liu, Jie Zhang, Yupeng Hu, Zitong Yu, Yu Zhou |
| 2026 | ACL | Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification. | Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu |
| 2026 | ACL | MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding. | Jie Zhang, Qilang Ye, Hao Zhou, Haochen Liang, Fei Luo |
| 2024 | ECCV | CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios. | Qilang Ye, Zitong Yu, Rui Shao, Xinyu Xie, Philip Torr, Xiaochun Cao |