| 2025 | AAAI | Pseudo Informative Episode Construction for Few-Shot Class-Incremental Learning. | Chaofan Chen, Xiaoshan Yang, Changsheng Xu |
| 2025 | AAAI | Pilot: Building the Federated Multimodal Instruction Tuning Framework. | Baochen Xiong, Xiaoshan Yang, Yaguang Song, Yaowei Wang, Changsheng Xu |
| 2025 | ICIG | M | Shaobo Xie, Han Jiang, Chenlin Zhao, Xiaoshan Yang |
| 2025 | IJCAI | Graph Prompts: Adapting Video Graph for Video Question Answering. | Yiming Li, Xiaoshan Yang, Bing-Kun Bao, Changsheng Xu |
| 2024 | CVPR | Modality-Collaborative Test-Time Adaptation for Action Recognition. | Baochen Xiong, Xiaoshan Yang, Yaguang Song, Yaowei Wang, Changsheng Xu |
| 2024 | ICML | Libra: Building Decoupled Vision System on Large Language Models. | Yifan Xu, Xiaoshan Yang, Yaguang Song, Changsheng Xu |
| 2024 | MMM | Part-Aware Prompt Tuning for Weakly Supervised Referring Expression Grounding. | Chenlin Zhao, Jiabo Ye, Yaguang Song, Ming Yan, Xiaoshan Yang, Changsheng Xu |
| 2023 | CVPR | Active Exploration of Multimodal Complementarity for Few-Shot Action Recognition. | Yuyang Wanyan, Xiaoshan Yang, Chaofan Chen, Changsheng Xu |
| 2023 | MMM | Health-Oriented Multimodal Food Question Answering. | Jianghai Wang, Menghao Hu, Yaguang Song, Xiaoshan Yang |
| 2022 | AAAI | Cross-Modal Federated Human Activity Recognition via Modality-Agnostic and Modality-Specific Representation Learning. | Xiaoshan Yang, Baochen Xiong, Yi Huang, Changsheng Xu |
| 2022 | CVPR | Dynamic Scene Graph Generation via Anticipatory Pre-training. | Yiming Li, Xiaoshan Yang, Changsheng Xu |
| 2022 | CVPR | Shifting More Attention to Visual Backbone: Query-modulated Refinement Networks for End-to-End Visual Grounding. | Jiabo Ye, Junfeng Tian, Ming Yan, Xiaoshan Yang, Xuwu Wang, Ji Zhang, Liang He, Xin Lin |
| 2021 | CVPR | ECKPN: Explicit Class Knowledge Propagation Network for Transductive Few-Shot Learning. | Chaofan Chen, Xiaoshan Yang, Changsheng Xu, Xuhui Huang, Zhe Ma |
| 2020 | AAAI | Find Objects and Focus on Highlights: Mining Object Semantics for Video Highlight Detection via Graph Neural Networks. | Yingying Zhang, Junyu Gao, Xiaoshan Yang, Chang Liu, Yan Li, Changsheng Xu |
| 2020 | MMM | Structured Neural Motifs: Scene Graph Parsing via Enhanced Context. | Yiming Li, Xiaoshan Yang, Changsheng Xu |
| 2020 | MMM | Multi-hop Interactive Cross-Modal Retrieval. | Xuecheng Ning, Xiaoshan Yang, Changsheng Xu |
| 2019 | ICIP | Exploring Feature Representation and Training Strategies in Temporal Action Localization. | Tingting Xie, Xiaoshan Yang, Tianzhu Zhang, Changsheng Xu, Ioannis Patras |
| 2019 | PRICAI | Time-Guided High-Order Attention Model of Longitudinal Heterogeneous Healthcare Data. | Yi Huang, Xiaoshan Yang, Changsheng Xu |
| 2017 | PSIVT | Video Highlight Detection via Deep Ranking Modeling. | Yifan Jiao, Xiaoshan Yang, Tianzhu Zhang, Shucheng Huang, Changsheng Xu |
| 2011 | CVPR | Intrinsic images using optimization. | Jianbing Shen, Xiaoshan Yang, Yunde Jia, Xuelong Li |