| 2026 | AAAI | What to Trust? A Trust-aware Knowledge-guided Method for Zero-shot Object State Understanding in Videos. | Yayun Qi, Xinxiao Wu |
| 2026 | AAAI | TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents. | Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li |
| 2025 | AAAI | Video Summarization Using Denoising Diffusion Probabilistic Model. | Zirui Shang, Yubo Zhu, Hongxi Li, Shuo Yang, Xinxiao Wu |
| 2025 | ICCV | LLM-Enhanced Action-Aware Multi-Modal Prompt Tuning for Image-Text Matching. | Mengxiao Tian, Xinxiao Wu, Shuo Yang |
| 2025 | IJCAI | METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection. | Yongqi Wang, Xinxiao Wu, Shuo Yang |
| 2024 | AAAI | Relational Distant Supervision for Image Captioning without Image-Text Pairs. | Yayun Qi, Wentian Zhao, Xinxiao Wu |
| 2024 | AAAI | Multi-Modal Prompting for Open-Vocabulary Video Visual Relationship Detection. | Shuo Yang, Yongqi Wang, Xiaofeng Ji, Xinxiao Wu |
| 2024 | IROS | Event-based Few-shot Fine-grained Human Action Recognition. | Zonglin Yang, Yan Yang, Yuheng Shi, Hao Yang, Ruikun Zhang, Liu Liu, Xinxiao Wu, Liyuan Pan |
| 2024 | WACV | DiffCLIP: Leveraging Stable Diffusion for Language Grounded 3D Classification. | Sitian Shen, Zilin Zhu, Linqian Fan, Harry Zhang, Xinxiao Wu |
| 2023 | CVPR | Meta-Causal Learning for Single Domain Generalization. | Jin Chen, Zhi Gao, Xinxiao Wu, Jiebo Luo |
| 2023 | IJCAI | Teaching What You Should Teach: A Data-Based Distillation Method. | Shitong Shao, Huanran Chen, Zhen Huang, Linrui Gong, Shuai Wang, Xinxiao Wu |
| 2022 | AAAI | Adaptive Image-to-Video Scene Graph Generation via Knowledge Reasoning and Adversarial Learning. | Jin Chen, Xiaofeng Ji, Xinxiao Wu |
| 2022 | ACCV | Exploring Spatial-Temporal Instance Relationships in an Intermediate Domain for Image-to-Video Object Detection. | Zihan Wen, Jin Chen, Xinxiao Wu |
| 2022 | ECCV | Bootstrap Generalization Ability from Loss Landscape Perspective. | Huanran Chen, Shitong Shao, Ziyi Wang, Zirui Shang, Jin Chen, Xiaofeng Ji, Xinxiao Wu |
| 2022 | IJCAI | Entity-aware and Motion-aware Transformers for Language-driven Action Localization. | Shuo Yang, Xinxiao Wu |
| 2021 | AAAI | Spatial-temporal Causal Inference for Partial Image-to-video Adaptation. | Jin Chen, Xinxiao Wu, Yao Hu, Jiebo Luo |
| 2021 | AAAI | Anticipating Future Relations via Graph Growing for Action Prediction. | Xinxiao Wu, Jianwei Zhao, Ruiqi Wang |
| 2020 | AAAI | Joint Commonsense and Relation Reasoning for Image and Video Captioning. | Jingyi Hou, Xinxiao Wu, Xiaoxun Zhang, Yayun Qi, Yunde Jia, Jiebo Luo |
| 2020 | AAAI | MemCap: Memorizing Style Knowledge for Image Captioning. | Wentian Zhao, Xinxiao Wu, Xiaoxun Zhang |
| 2019 | ICCV | Joint Syntax Representation Learning and Visual Cue Translation for Video Captioning. | Jingyi Hou, Xinxiao Wu, Wentian Zhao, Jiebo Luo, Yunde Jia |
| 2018 | AAAI | Unsupervised Deep Learning of Mid-Level Video Representation for Action Recognition. | Jingyi Hou, Xinxiao Wu, Jin Chen, Jiebo Luo, Yunde Jia |
| 2018 | IJCAI | Exploiting Images for Video Recognition with Hierarchical Generative Adversarial Networks. | Feiwu Yu, Xinxiao Wu, Yuchao Sun, Lixin Duan |
| 2017 | ICIG | Heterogeneous Multi-group Adaptation for Event Recognition in Consumer Videos. | Mingyu Yao, Xinxiao Wu, Mei Chen, Yunde Jia |
| 2015 | ICDM | Incremental Discriminant Learning for Heterogeneous Domain Adaptation. | Peng Han, Xinxiao Wu |
| 2015 | ICDM | Finding Event Videos via Image Search Engine. | Han Wang, Xinxiao Wu |
| 2015 | ICIG | A Multiple Image Group Adaptation Approach for Event Recognition in Consumer Videos. | Dengfeng Zhang, Wei Liang, Hao Song, Zhen Dong, Xinxiao Wu |
| 2015 | ICONIP | Heterogeneous Discriminant Analysis for Cross-View Action Recognition. | Wanchen Sui, Xinxiao Wu, Yang Feng, Wei Liang, Yunde Jia |
| 2014 | ACCV | Weakly Supervised Action Recognition and Localization Using Web Images. | Cuiwei Liu, Xinxiao Wu, Yunde Jia |
| 2014 | ACCV | Video Annotation by Incremental Learning from Grouped Heterogeneous Sources. | Han Wang, Hao Song, Xinxiao Wu, Yunde Jia |
| 2014 | ICPR | Multi-group Adaptation for Event Recognition from Videos. | Yang Feng, Xinxiao Wu, Han Wang, Jing Liu |
| 2014 | ICPR | Modeling the Relationship of Action, Object, and Scene. | Jing Liu, Xinxiao Wu, Yang Feng |
| 2013 | ICCV | Cross-View Action Recognition over Heterogeneous Feature Spaces. | Xinxiao Wu, Han Wang, Cuiwei Liu, Yunde Jia |
| 2012 | ECCV | View-Invariant Action Recognition Using Latent Kernelized Structural SVM. | Xinxiao Wu, Yunde Jia |
| 2012 | ICPR | Action recognition with discriminative mid-level features. | Cuiwei Liu, Yu Kong, Xinxiao Wu, Yunde Jia |
| 2012 | ICPR | Annotating videos from the web images. | Han Wang, Xinxiao Wu, Yunde Jia |
| 2011 | CVPR | Action recognition using context and appearance distribution features. | Xinxiao Wu, Dong Xu, Lixin Duan, Jiebo Luo |
| 2009 | ICCV | Incremental discriminative-analysis of canonical correlations for action recognition. | Xinxiao Wu, Wei Liang, Yunde Jia |