| 2025 | CVPR | Evaluating Model Perception of Color Illusions in Photorealistic Scenes. | Lingjun Mao, Zineng Tang, Alane Suhr |
| 2025 | ICCV | TULIP: Contrastive Image-Text Learning with Richer Vision Understanding. | Zineng Tang, Long Lian, Seun Eisape, Xudong Wang, Roei Herzig, Adam Yala, Alane Suhr, Trevor Darrell, David M. Chan |
| 2024 | CVPR | CoDi-2: In-Context, Interleaved, and Interactive Any-to-Any Generation. | Zineng Tang, Ziyi Yang, Mahmoud Khademi, Yang Liu, Chenguang Zhu, Mohit Bansal |
| 2024 | EMNLP | Grounding Language in Multi-Perspective Referential Communication. | Zineng Tang, Lingjun Mao, Alane Suhr |
| 2023 | CVPR | Unifying Vision, Text, and Layout for Universal Document Processing. | Zineng Tang, Ziyi Yang, Guoxin Wang, Yuwei Fang, Yang Liu, Chenguang Zhu, Michael Zeng, Cha Zhang, Mohit Bansal |
| 2023 | WACV | PERCEIVER-VL: Efficient Vision-and-Language Modeling with Iterative Latent Attention. | Zineng Tang, Jaemin Cho, Jie Lei, Mohit Bansal |
| 2021 | ACL | Continuous Language Generative Flow. | Zineng Tang, Shiyue Zhang, Hyounghun Kim, Mohit Bansal |
| 2021 | NAACL | DeCEMBERT: Learning from Noisy Instructional Videos via Dense Captions and Entropy Minimization. | Zineng Tang, Jie Lei, Mohit Bansal |
| 2020 | ACL | Dense-Caption Matching and Frame-Selection Gating for Temporal Localization in VideoQA. | Hyounghun Kim, Zineng Tang, Mohit Bansal |
| 2019 | CIKM | Deep Colorization by Variation. | Zineng Tang |