| 2025 | CVPR | Magma: A Foundation Model for Multimodal AI Agents. | Jianwei Yang, Reuben Tan, Qianhui Wu, Ruijie Zheng, Baolin Peng, Yongyuan Liang, Yu Gu, Mu Cai, Seonghyeon Ye, Joel Jang, Yuquan Deng, Jianfeng Gao |
| 2025 | ICCV | LLaVA-Prumerge: Adaptive Token Reduction for Efficient Large Multimodal Models. | Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan |
| 2025 | ICLR | LLaRA: Supercharging Robot Learning Data for Vision-Language Policy. | Xiang Li, Cristina Mata, Jongwoo Park, Kumara Kahatapitiya, Yoo Sung Jang, Jinghuan Shang, Kanchana Ranasinghe, Ryan D. Burgert, Mu Cai, Yong Jae Lee, Michael S. Ryoo |
| 2025 | ICLR | Matryoshka Multimodal Models. | Mu Cai, Jianwei Yang, Jianfeng Gao, Yong Jae Lee |
| 2025 | WACV | An Investigation on LLMs' Visual Understanding Ability Using SVG for Image-Text Bridging. | Mu Cai, Zeyi Huang, Yuheng Li, Utkarsh Ojha, Haohan Wang, Yong Jae Lee |
| 2024 | ACL | CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples. | Jianrui Zhang, Mu Cai, Tengyang Xie, Yong Jae Lee |
| 2024 | CVPR | ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts. | Mu Cai, Haotian Liu, Siva Karthik Mustikovela, Gregory P. Meyer, Yuning Chai, Dennis Park, Yong Jae Lee |
| 2024 | ECCV | Removing Distributional Discrepancies in Captions Improves Image-Text Alignment. | Yuheng Li, Haotian Liu, Mu Cai, Yijun Li, Eli Shechtman, Zhe Lin, Yong Jae Lee, Krishna Kumar Singh |
| 2024 | EMNLP | VGBench: Evaluating Large Language Models on Vector Graphics Understanding and Generation. | Bocheng Zou, Mu Cai, Jianrui Zhang, Yong Jae Lee |
| 2024 | IROS | Cross-Modal Self-Supervised Learning with Effective Contrastive Units for LiDAR Point Clouds. | Mu Cai, Chenxu Luo, Yong Jae Lee, Xiaodong Yang |
| 2023 | ICCV | A Sentence Speaks a Thousand Images: Domain Generalization through Distilling CLIP with Language Guidance. | Zeyi Huang, Andy Zhou, Zijian Lin, Mu Cai, Haohan Wang, Yong Jae Lee |
| 2023 | WACV | Out-of-distribution Detection via Frequency-regularized Generative Models. | Mu Cai, Yixuan Li |
| 2022 | ECCV | Masked Discrimination for Self-supervised Learning on Point Clouds. | Haotian Liu, Mu Cai, Yong Jae Lee |
| 2022 | ICLR | VOS: Learning What You Don't Know by Virtual Outlier Synthesis. | Xuefeng Du, Zhaoning Wang, Mu Cai, Yixuan Li |
| 2021 | ICCV | Frequency Domain Image Translation: More Photo-realistic, Better Identity-preserving. | Mu Cai, Hong Zhang, Huijuan Huang, Qichuan Geng, Yixuan Li, Gao Huang |
| 2020 | IROS | A Game-Theoretic Strategy-Aware Interaction Algorithm with Validation on Real Traffic Data. | Liting Sun, Mu Cai, Wei Zhan, Masayoshi Tomizuka |