| 2025 | ICCV | HPSv3: Towards Wide-Spectrum Human Preference Score. | Yuhang Ma, Xiaoshi Wu, Keqiang Sun, Hongsheng Li |
| 2024 | ECCV | Be-Your-Outpainter: Mastering Video Outpainting Through Input-Specific Adaptation. | Fu-Yun Wang, Xiaoshi Wu, Zhaoyang Huang, Xiaoyu Shi, Dazhong Shen, Guanglu Song, Yu Liu, Hongsheng Li |
| 2024 | ECCV | Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models. | Xiaoshi Wu, Yiming Hao, Manyuan Zhang, Keqiang Sun, Zhaoyang Huang, Guanglu Song, Yu Liu, Hongsheng Li |
| 2023 | CVPR | CORA: Adapting CLIP for Open-Vocabulary Detection with Region Prompting and Anchor Pre-Matching. | Xiaoshi Wu, Feng Zhu, Rui Zhao, Hongsheng Li |
| 2023 | ICCV | Human Preference Score: Better Aligning Text-to-image Models with Human Preference. | Xiaoshi Wu, Keqiang Sun, Feng Zhu, Rui Zhao, Hongsheng Li |
| 2022 | CVPR | Uni-Perceiver: Pre-training Unified Architecture for Generic Perception for Zero-shot and Few-shot Tasks. | Xizhou Zhu, Jinguo Zhu, Hao Li, Xiaoshi Wu, Hongsheng Li, Xiaohua Wang, Jifeng Dai |
| 2021 | ICCV | Towers of Babel: Combining Images, Language, and 3D Geometry for Learning Multimodal Vision. | Xiaoshi Wu, Hadar Averbuch-Elor, Jin Sun, Noah Snavely |