| 2026 | ACL | Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement. | Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal |
| 2026 | EACL | RotBench: Evaluating Multi-modal Large Language Models on Identifying Image Rotation. | Tianyi Niu, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal |
| 2025 | EMNLP | Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning. | Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal |
| 2025 | ICCV | M3DocVQA: Multi-Modal Multi-Page Multi-Document Understanding. | Jaemin Cho, Debanjan Mahata, Ozan Irsoy, Yujie He, Mohit Bansal |
| 2025 | ICCV | CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting. | Atin Pothiraj, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal |
| 2025 | ICLR | DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback. | Zaid Khan, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal |
| 2025 | ICLR | Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model. | Han Lin, Jaemin Cho, Abhay Zala, Mohit Bansal |
| 2025 | VISIGRAPP | Editing Scene Illumination and Material Appearance of Light-Field Images. | Jaemin Cho, Dongyoung Choi, Dahyun Kang, Gun Bang, Min H. Kim |
| 2024 | CVPR | Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation. | Jaemin Cho, Linjie Li, Zhengyuan Yang, Zhe Gan, Lijuan Wang, Mohit Bansal |
| 2024 | CVPR | Rethinking Interactive Image Segmentation with Low Latency, High Quality, and Diverse Prompts. | Qin Liu, Jaemin Cho, Mohit Bansal, Marc Niethammer |
| 2024 | ECCV | DOCCI: Descriptions of Connected and Contrasting Images. | Yasumasa Onoe, Sunayana Rane, Zachary Berger, Yonatan Bitton, Jaemin Cho, Roopal Garg, Alexander Ku, Zarana Parekh, Jordi Pont-Tuset, Garrett Tanzer, Su Wang, Jason Baldridge |
| 2024 | ECCV | Contrastive Region Guidance: Improving Grounding in Vision-Language Models Without Training. | David Wan, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal |
| 2024 | ICLR | Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation. | Jaemin Cho, Yushi Hu, Jason M. Baldridge, Roopal Garg, Peter Anderson, Ranjay Krishna, Mohit Bansal, Jordi Pont-Tuset, Su Wang |
| 2023 | CHI | Dimensional alt text: Enhancing Spatial Understanding through Dimensional Layering of Image Descriptions for Screen Reader Users. | Jaemin Cho, Hee Jae Kim |
| 2023 | CVPR | Hierarchical Video-Moment Retrieval and Step-Captioning. | Abhay Zala, Jaemin Cho, Satwik Kottur, Xilun Chen, Barlas Oguz, Yashar Mehdad, Mohit Bansal |
| 2023 | ICCV | DALL-EVAL: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models. | Jaemin Cho, Abhay Zala, Mohit Bansal |
| 2023 | WACV | PERCEIVER-VL: Efficient Vision-and-Language Modeling with Iterative Latent Attention. | Zineng Tang, Jaemin Cho, Jie Lei, Mohit Bansal |
| 2022 | AAAI | MuMuQA: Multimedia Multi-Hop News Question Answering via Cross-Media Knowledge Extraction and Grounding. | Revanth Gangi Reddy, Xilin Rui, Manling Li, Xudong Lin, Haoyang Wen, Jaemin Cho, Lifu Huang, Mohit Bansal, Avirup Sil, Shih-Fu Chang, Alexander G. Schwing, Heng Ji |
| 2022 | CVPR | VL-ADAPTER: Parameter-Efficient Transfer Learning for Vision-and-Language Tasks. | Yi-Lin Sung, Jaemin Cho, Mohit Bansal |
| 2022 | NAACL | Fine-grained Image Captioning with CLIP Reward. | Jaemin Cho, Seunghyun Yoon, Ajinkya Kale, Franck Dernoncourt, Trung Bui, Mohit Bansal |
| 2021 | ICML | Unifying Vision-and-Language Tasks via Text Generation. | Jaemin Cho, Jie Lei, Hao Tan, Mohit Bansal |
| 2020 | EMNLP | X-LXMERT: Paint, Caption and Answer Questions with Multi-Modal Transformers. | Jaemin Cho, Jiasen Lu, Dustin Schwenk, Hannaneh Hajishirzi, Aniruddha Kembhavi |
| 2019 | EMNLP | Mixture Content Selection for Diverse Sequence Generation. | Jaemin Cho, Min Joon Seo, Hannaneh Hajishirzi |
| 2018 | NAACL | A Hierarchical Latent Structure for Variational Conversation Modeling. | Yookoon Park, Jaemin Cho, Gunhee Kim |