| 2026 | WACV | BREEN: Bridge Data-Efficient Encoder-Free Multimodal Learning with Learnable Queries. | Tianle Li, Yongming Rao, Winston Hu, Yu Cheng |
| 2025 | CVPR | Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models. | Yuhao Dong, Zuyan Liu, Hai-Long Sun, Jingkang Yang, Winston Hu, Yongming Rao, Ziwei Liu |
| 2025 | CVPR | Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model. | Benlin Liu, Yuhao Dong, Yiqin Wang, Zixian Ma, Yansong Tang, Luming Tang, Yongming Rao, Wei-Chiu Ma, Ranjay Krishna |
| 2025 | ICCV | SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs. | Jiahui Wang, Zuyan Liu, Yongming Rao, Jiwen Lu |
| 2025 | ICLR | Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution. | Zuyan Liu, Yuhao Dong, Ziwei Liu, Winston Hu, Jiwen Lu, Yongming Rao |
| 2025 | ICML | RBench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation. | Meng-Hao Guo, Jiajun Xu, Yi Zhang, Jiaxi Song, Haoyang Peng, Yi-Xuan Deng, Xinzhi Dong, Kiyohiro Nakayama, Zhengyang Geng, Chen Wang, Bolin Ni, Guo-Wei Yang, Yongming Rao, Houwen Peng, Han Hu, Gordon Wetzstein, Shimin Hu |
| 2024 | CVPR | Sherpa3D: Boosting High-Fidelity Text-to-3D Generation via Coarse 3D Prior. | Fangfu Liu, Diankun Wu, Yi Wei, Yongming Rao, Yueqi Duan |
| 2024 | CVPR | Generative Multimodal Models are In-Context Learners. | Quan Sun, Yufeng Cui, Xiaosong Zhang, Fan Zhang, Qiying Yu, Yueze Wang, Yongming Rao, Jingjing Liu, Tiejun Huang, Xinlong Wang |
| 2024 | CVPR | X-3D: Explicit 3D Structure Modeling for Point Cloud Recognition. | Shuofeng Sun, Yongming Rao, Jiwen Lu, Haibin Yan |
| 2024 | ECCV | Efficient Inference of Vision Instruction-Following Models with Elastic Cache. | Zuyan Liu, Benlin Liu, Jiahui Wang, Yuhao Dong, Guangyi Chen, Yongming Rao, Ranjay Krishna, Jiwen Lu |
| 2023 | CVPR | FLAG3D: A 3D Fitness Activity Dataset with Language Instruction. | Yansong Tang, Jinpeng Liu, Aoyang Liu, Bin Yang, Wenxun Dai, Yongming Rao, Jiwen Lu, Jie Zhou, Xiu Li |
| 2023 | CVPR | DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked Diffusion. | Wenliang Zhao, Yongming Rao, Weikang Shi, Zuyan Liu, Jie Zhou, Jiwen Lu |
| 2023 | ICCV | Take-A-Photo: 3D-to-2D Generative Pre-training of Point Cloud Models. | Ziyi Wang, Xumin Yu, Yongming Rao, Jie Zhou, Jiwen Lu |
| 2023 | ICCV | TCOVIS: Temporally Consistent Online Video Instance Segmentation. | Junlong Li, Bingyao Yu, Yongming Rao, Jie Zhou, Jiwen Lu |
| 2023 | ICCV | Unleashing Text-to-Image Diffusion Models for Visual Perception. | Wenliang Zhao, Yongming Rao, Zuyan Liu, Benlin Liu, Jie Zhou, Jiwen Lu |
| 2023 | ICLR | PLOT: Prompt Learning with Optimal Transport for Vision-Language Models. | Guangyi Chen, Weiran Yao, Xiangchen Song, Xinyue Li, Yongming Rao, Kun Zhang |
| 2022 | CoRL | SurroundDepth: Entangling Surrounding Views for Self-Supervised Multi-Camera Depth Estimation. | Yi Wei, Linqing Zhao, Wenzhao Zheng, Zheng Zhu, Yongming Rao, Guan Huang, Jiwen Lu, Jie Zhou |
| 2022 | CVPR | Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion. | Tianpei Gu, Guangyi Chen, Junlong Li, Chunze Lin, Yongming Rao, Jie Zhou, Jiwen Lu |
| 2022 | CVPR | DenseCLIP: Language-Guided Dense Prediction with Context-Aware Prompting. | Yongming Rao, Wenliang Zhao, Guangyi Chen, Yansong Tang, Zheng Zhu, Guan Huang, Jie Zhou, Jiwen Lu |
| 2022 | CVPR | SemAffiNet: Semantic-Affine Transformation for Point Cloud Segmentation. | Ziyi Wang, Yongming Rao, Xumin Yu, Jie Zhou, Jiwen Lu |
| 2022 | CVPR | FineDiving: A Fine-grained Dataset for Procedure-aware Action Quality Assessment. | Jinglin Xu, Yongming Rao, Xumin Yu, Guangyi Chen, Jie Zhou, Jiwen Lu |
| 2022 | CVPR | Back to Reality: Weakly-supervised 3D Object Detection with Shape-guided Label Enhancement. | Xiuwei Xu, Yifan Wang, Yu Zheng, Yongming Rao, Jie Zhou, Jiwen Lu |
| 2022 | CVPR | Point-BERT: Pre-training 3D Point Cloud Transformers with Masked Point Modeling. | Xumin Yu, Lulu Tang, Yongming Rao, Tiejun Huang, Jie Zhou, Jiwen Lu |
| 2022 | ECCV | AMixer: Adaptive Weight Mixing for Self-attention Free Vision Transformers. | Yongming Rao, Wenliang Zhao, Jie Zhou, Jiwen Lu |
| 2022 | ECCV | LiDAR Distillation: Bridging the Beam-Induced Domain Gap for 3D Object Detection. | Yi Wei, Zibu Wei, Yongming Rao, Jiaxin Li, Jie Zhou, Jiwen Lu |
| 2021 | AAAI | Multi-Proxy Wasserstein Classifier for Image Classification. | Benlin Liu, Yongming Rao, Jiwen Lu, Jie Zhou, Cho-Jui Hsieh |
| 2021 | CVPR | PV-RAFT: Point-Voxel Correlation Fields for Scene Flow Estimation of Point Clouds. | Yi Wei, Ziyi Wang, Yongming Rao, Jiwen Lu, Jie Zhou |
| 2021 | ICCV | Counterfactual Attention Learning for Fine-Grained Visual Categorization and Re-identification. | Yongming Rao, Guangyi Chen, Jiwen Lu, Jie Zhou |
| 2021 | ICCV | RandomRooms: Unsupervised Pre-training from Synthetic Shapes and Randomized Layouts for 3D Object Detection. | Yongming Rao, Benlin Liu, Yi Wei, Jiwen Lu, Cho-Jui Hsieh, Jie Zhou |
| 2021 | ICCV | NerfingMVS: Guided Optimization of Neural Radiance Fields for Indoor Multi-view Stereo. | Yi Wei, Shaohui Liu, Yongming Rao, Wang Zhao, Jiwen Lu, Jie Zhou |
| 2021 | ICCV | PoinTr: Diverse Point Cloud Completion with Geometry-Aware Transformers. | Xumin Yu, Yongming Rao, Ziyi Wang, Zuyan Liu, Jiwen Lu, Jie Zhou |
| 2021 | ICCV | Group-aware Contrastive Regression for Action Quality Assessment. | Xumin Yu, Yongming Rao, Wenliang Zhao, Jiwen Lu, Jie Zhou |
| 2021 | ICCV | Towards Interpretable Deep Metric Learning with Structural Matching. | Wenliang Zhao, Yongming Rao, Ziyi Wang, Jiwen Lu, Jie Zhou |
| 2020 | CVPR | Deep Face Super-Resolution With Iterative Collaboration Between Attentive Recovery and Landmark Estimation. | Cheng Ma, Zhenyu Jiang, Yongming Rao, Jiwen Lu, Jie Zhou |
| 2020 | CVPR | Structure-Preserving Super Resolution With Gradient Guidance. | Cheng Ma, Yongming Rao, Yean Cheng, Ce Chen, Jiwen Lu, Jie Zhou |
| 2020 | CVPR | Global-Local Bidirectional Reasoning for Unsupervised Representation Learning of 3D Point Clouds. | Yongming Rao, Jiwen Lu, Jie Zhou |
| 2020 | ECCV | Temporal Coherence or Temporal Motion: Which Is More Critical for Video-Based Person Re-identification? | Guangyi Chen, Yongming Rao, Jiwen Lu, Jie Zhou |
| 2020 | ECCV | MetaDistiller: Network Self-Boosting via Meta-Learned Top-Down Distillation. | Benlin Liu, Yongming Rao, Jiwen Lu, Jie Zhou, Cho-Jui Hsieh |
| 2019 | CVPR | Spherical Fractal Convolutional Neural Networks for Point Cloud Recognition. | Yongming Rao, Jiwen Lu, Jie Zhou |
| 2019 | CVPR | COIN: A Large-Scale Dataset for Comprehensive Instructional Video Analysis. | Yansong Tang, Dajun Ding, Yongming Rao, Yu Zheng, Danyang Zhang, Lili Zhao, Jiwen Lu, Jie Zhou |
| 2018 | CVPR | Learning Globally Optimized Object Detector via Policy Gradient. | Yongming Rao, Dahua Lin, Jiwen Lu, Jie Zhou |
| 2017 | ICCV | Attention-Aware Deep Reinforcement Learning for Video Face Recognition. | Yongming Rao, Jiwen Lu, Jie Zhou |
| 2017 | ICCV | Learning Discriminative Aggregation Network for Video-Based Face Recognition. | Yongming Rao, Ji Lin, Jiwen Lu, Jie Zhou |
| 2017 | ICDE | V-Tree: Efficient kNN Search on Moving Objects with Road-Network Constraints. | Bilong Shen, Ying Zhao, Guoliang Li, Weimin Zheng, Yue Qin, Bo Yuan, Yongming Rao |