Skip to content

Zhe Gan

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

97

Venues

13

Active years

2015–2025

Best venue rank

A*

Where they publish

Papers

97 indexed papers, newest first.

YearVenueTitleAuthors
2025AAAIProactive Pseudo-Intervention: Pre-informed Contrastive Learning For Interpretable Vision Models.Dong Wang, Yuewei Yang, Liqun Chen, Zhe Gan, Ricardo Henao, Lawrence Carin
2025ACLImprove Vision Language Model Chain-of-thought Reasoning.Ruohong Zhang, Bowen Zhang, Yanghao Li, Haotian Zhang, Zhiqing Sun, Zhe Gan, Yinfei Yang, Ruoming Pang, Yiming Yang
2025CVPRMultimodal Autoregressive Pre-training of Large Vision Encoders.Enrico Fini, Mustafa Shukor, Xiujun Li, Philipp Dufter, Michal Klein, David Haldimann, Sai Aitharaju, Victor G. Turrisi da Costa, Louis Bthune, Zhe Gan, Alexander Toshev, Marcin Eichner, Moin Nabi, Yinfei Yang, Joshua M. Susskind, Alaaeldin El-Nouby
2025CVPRFrom Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons.Andrew Szot, Bogdan Mazoure, Omar Attia, Aleksei Timofeev, Harsh Agrawal, R. Devon Hjelm, Zhe Gan, Zsolt Kira, Alexander Toshev
2025ICCVUniVG: A Generalist Diffusion Model for Unified Image Generation and Editing.Tsu-Jui Fu, Yusu Qian, Chen Chen, Wenze Hu, Zhe Gan, Yinfei Yang
2025ICLRRevisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models.Zhengfeng Lai, Vasileios Saveris, Chen Chen, Hong-You Chen, Haotian Zhang, Bowen Zhang, Wenze Hu, Juan Lao Tebar, Zhe Gan, Peter Grasch, Meng Cao, Yinfei Yang
2025ICLRFerret-UI 2: Mastering Universal User Interface Understanding Across Platforms.Zhangheng Li, Keen You, Haotian Zhang, Di Feng, Harsh Agrawal, Xiujun Li, Mohana Prasad Sathya Moorthy, Jeffrey Nichols, Yinfei Yang, Zhe Gan
2025ICLRMIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs.Yusu Qian, Hanrong Ye, Jean-Philippe Fauconnier, Peter Grasch, Yinfei Yang, Zhe Gan
2025ICLRMMEgo: Towards Building Egocentric Multimodal LLMs for Video QA.Hanrong Ye, Haotian Zhang, Erik A. Daxberger, Lin Chen, Zongyu Lin, Yanghao Li, Bowen Zhang, Haoxuan You, Dan Xu, Zhe Gan, Jiasen Lu, Yinfei Yang
2025ICLRMM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning.Haotian Zhang, Mingfei Gao, Zhe Gan, Philipp Dufter, Nina Wenzel, Forrest Huang, Dhruti Shah, Xianzhi Du, Bowen Zhang, Yanghao Li, Sam Dodge, Keen You, Zhen Yang, Aleksei Timofeev, Mingze Xu, Hong-You Chen, Jean-Philippe Fauconnier, Zhengfeng Lai, Haoxuan You, Zirui Wang, et al.
2025ICMLContrastive Localized Language-Image Pre-Training.Hong-You Chen, Zhengfeng Lai, Haotian Zhang, Xinze Wang, Marcin Eichner, Keen You, Meng Cao, Bowen Zhang, Yinfei Yang, Zhe Gan
2024CVPRDiagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation.Jaemin Cho, Linjie Li, Zhengyuan Yang, Zhe Gan, Lijuan Wang, Mohit Bansal
2024ECCVVeCLIP: Improving CLIP Training via Visual-Enriched Captions.Zhengfeng Lai, Haotian Zhang, Bowen Zhang, Wentao Wu, Haoping Bai, Aleksei Timofeev, Xianzhi Du, Zhe Gan, Jiulong Shan, Chen-Nee Chuah, Yinfei Yang, Meng Cao
2024ECCVMM1: Methods, Analysis and Insights from Multimodal LLM Pre-training.Brandon McKinzie, Zhe Gan, Jean-Philippe Fauconnier, Sam Dodge, Bowen Zhang, Philipp Dufter, Dhruti Shah, Xianzhi Du, Futang Peng, Anton Belyi, Haotian Zhang, Karanjeet Singh, Doug Kang, Hongyu H, Max Schwarzer, Tom Gunter, Xiang Kong, Aonan Zhang, Jianyu Wang, Chong Wang, Nan Du, Tao Lei, Sam Wiseman, Mark Lee, Zirui Wang, Ruoming Pang, Peter Grasch, Alexander Toshev, Yinfei Yang
2024ECCVGRiT: A Generative Region-to-Text Transformer for Object Understanding.Jialian Wu, Jianfeng Wang, Zhengyuan Yang, Zhe Gan, Zicheng Liu, Junsong Yuan, Lijuan Wang
2024ECCVFerret-UI: Grounded Mobile UI Understanding with Multimodal LLMs.Keen You, Haotian Zhang, Eldon Schoop, Floris Weers, Amanda Swearngin, Jeffrey Nichols, Yinfei Yang, Zhe Gan
2024EMNLPPre-trained Language Models Do Not Help Auto-regressive Text-to-Image Generation.Yuhui Zhang, Brandon McKinzie, Zhe Gan, Vaishaal Shankar, Alexander Toshev
2024ICLRGuiding Instruction-based Image Editing via Multimodal Large Language Models.Tsu-Jui Fu, Wenze Hu, Xianzhi Du, William Yang Wang, Yinfei Yang, Zhe Gan
2024ICLRCompressing LLMs: The Truth is Rarely Pure and Never Simple.Ajay Kumar Jaiswal, Zhe Gan, Xianzhi Du, Bowen Zhang, Zhangyang Wang, Yinfei Yang
2024ICLRFerret: Refer and Ground Anything Anywhere at Any Granularity.Haoxuan You, Haotian Zhang, Zhe Gan, Xianzhi Du, Bowen Zhang, Zirui Wang, Liangliang Cao, Shih-Fu Chang, Yinfei Yang
2023CVPRAn Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling.Tsu-Jui Fu, Linjie Li, Zhe Gan, Kevin Lin, William Yang Wang, Lijuan Wang, Zicheng Liu
2023CVPRLAVENDER: Unifying Video-Language Understanding as Masked Language Modeling.Linjie Li, Zhe Gan, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Ce Liu, Lijuan Wang
2023CVPRReCo: Region-Controlled Text-to-Image Generation.Zhengyuan Yang, Jianfeng Wang, Zhe Gan, Linjie Li, Kevin Lin, Chenfei Wu, Nan Duan, Zicheng Liu, Ce Liu, Michael Zeng, Lijuan Wang
2023CVPRNon-Contrastive Learning Meets Language-Image Pre-Training.Jinghao Zhou, Li Dong, Zhe Gan, Lijuan Wang, Furu Wei
2023CVPRGeneralized Decoding for Pixel, Image, and Language.Xueyan Zou, Zi-Yi Dou, Jianwei Yang, Zhe Gan, Linjie Li, Chunyuan Li, Xiyang Dai, Harkirat Behl, Jianfeng Wang, Lu Yuan, Nanyun Peng, Lijuan Wang, Yong Jae Lee, Jianfeng Gao
2023EMNLPAn Empirical Study of Multimodal Model Merging.Yi-Lin Sung, Linjie Li, Kevin Lin, Zhe Gan, Mohit Bansal, Lijuan Wang
2023ICLRPrompting GPT-3 To Be Reliable.Chenglei Si, Zhe Gan, Zhengyuan Yang, Shuohang Wang, Jianfeng Wang, Jordan L. Boyd-Graber, Lijuan Wang
2022AAAIEfficient Robust Training via Backward Smoothing.Jinghui Chen, Yu Cheng, Zhe Gan, Quanquan Gu, Jingjing Liu
2022AAAIPlaying Lottery Tickets with Vision and Language.Zhe Gan, Yen-Chun Chen, Linjie Li, Tianlong Chen, Yu Cheng, Shuohang Wang, Jingjing Liu, Lijuan Wang, Zicheng Liu
2022AAAIAn Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA.Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Yumao Lu, Zicheng Liu, Lijuan Wang
2022CVPRScaling Up Vision-Language Pretraining for Image Captioning.Xiaowei Hu, Zhe Gan, Jianfeng Wang, Zhengyuan Yang, Zicheng Liu, Yumao Lu, Lijuan Wang
2022CVPRAn Empirical Study of Training End-to-End Vision-and-Language Transformers.Zi-Yi Dou, Yichong Xu, Zhe Gan, Jianfeng Wang, Shuohang Wang, Lijuan Wang, Chenguang Zhu, Pengchuan Zhang, Lu Yuan, Nanyun Peng, Zicheng Liu, Michael Zeng
2022CVPRInjecting Semantic Concepts into End-to-End Image Captioning.Zhiyuan Fang, Jianfeng Wang, Xiaowei Hu, Lin Liang, Zhe Gan, Lijuan Wang, Yezhou Yang, Zicheng Liu
2022CVPRSwinBERT: End-to-End Transformers with Sparse Attention for Video Captioning.Kevin Lin, Linjie Li, Chung-Ching Lin, Faisal Ahmed, Zhe Gan, Zicheng Liu, Yumao Lu, Lijuan Wang
2022ECCVUniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling.Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Faisal Ahmed, Zicheng Liu, Yumao Lu, Lijuan Wang
2021AAAIFILTER: An Enhanced Fusion Method for Cross-lingual Language Understanding.Yuwei Fang, Shuohang Wang, Zhe Gan, Siqi Sun, Jingjing Liu
2021ACLEarlyBERT: Efficient BERT Training via Early-bird Lottery Tickets.Xiaohan Chen, Yu Cheng, Shuohang Wang, Zhe Gan, Zhangyang Wang, Jingjing Liu
2021ACLCluster-Former: Clustering-based Sparse Transformer for Question Answering.Shuohang Wang, Luowei Zhou, Zhe Gan, Yen-Chun Chen, Yuwei Fang, Siqi Sun, Yu Cheng, Jingjing Liu
2021CVPRWasserstein Contrastive Representation Distillation.Liqun Chen, Dong Wang, Zhe Gan, Jingjing Liu, Ricardo Henao, Lawrence Carin
2021CVPRLess Is More: ClipBERT for Video-and-Language Learning via Sparse Sampling.Jie Lei, Linjie Li, Luowei Zhou, Zhe Gan, Tamara L. Berg, Mohit Bansal, Jingjing Liu
2021ICCVAdversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models.Linjie Li, Jie Lei, Zhe Gan, Jingjing Liu
2021ICLRInfoBERT: Improving Robustness of Language Models from An Information Theoretic Perspective.Boxin Wang, Shuohang Wang, Yu Cheng, Zhe Gan, Ruoxi Jia, Bo Li, Jingjing Liu
2021ICLRImproving Zero-Shot Voice Style Transfer via Disentangled Representation Learning.Siyang Yuan, Pengyu Cheng, Ruiyi Zhang, Weituo Hao, Zhe Gan, Lawrence Carin
2021NAACLAPo-VAE: Text Generation in Hyperbolic Space.Shuyang Dai, Zhe Gan, Yu Cheng, Chenyang Tao, Lawrence Carin, Jingjing Liu
2021WACVMeta Module Network for Compositional Visual Reasoning.Wenhu Chen, Zhe Gan, Linjie Li, Yu Cheng, William Yang Wang, Jingjing Liu
2020AAAIWhat Makes A Good Story? Designing Composite Rewards for Visual Storytelling.Junjie Hu, Yu Cheng, Zhe Gan, Jingjing Liu, Jianfeng Gao, Graham Neubig
2020AAAIGraph-Driven Generative Models for Heterogeneous Multi-Task Learning.Wenlin Wang, Hongteng Xu, Zhe Gan, Bai Li, Guoyin Wang, Liqun Chen, Qian Yang, Wenqi Wang, Lawrence Carin
2020ACCVContrastively Smoothed Class Alignment for Unsupervised Domain Adaptation.Shuyang Dai, Yu Cheng, Yizhe Zhang, Zhe Gan, Jingjing Liu, Lawrence Carin
2020ACCVMagGAN: High-Resolution Face Attribute Editing with Mask-Guided Generative Adversarial Network.Yi Wei, Zhe Gan, Wenbo Li, Siwei Lyu, Ming-Ching Chang, Lei Zhang, Jianfeng Gao, Pengchuan Zhang
2020ACLDistilling Knowledge Learned in BERT for Text Generation.Yen-Chun Chen, Zhe Gan, Yu Cheng, Jingzhou Liu, Jingjing Liu
2020ACLDiscourse-Aware Neural Extractive Text Summarization.Jiacheng Xu, Zhe Gan, Yu Cheng, Jingjing Liu
2020ACLImproving Adversarial Text Generation by Modeling the Distant Future.Ruiyi Zhang, Changyou Chen, Zhe Gan, Wenlin Wang, Dinghan Shen, Guoyin Wang, Zheng Wen, Lawrence Carin
2020AISTATSNested-Wasserstein Self-Imitation Learning for Sequence Generation.Ruiyi Zhang, Changyou Chen, Zhe Gan, Zheng Wen, Wenlin Wang, Lawrence Carin
2020CVPRBachGAN: High-Resolution Image Synthesis From Salient Object Layout.Yandong Li, Yu Cheng, Zhe Gan, Licheng Yu, Liqiang Wang, Jingjing Liu
2020CVPRViolin: A Large-Scale Dataset for Video-and-Language Inference.Jingzhou Liu, Wenhu Chen, Yu Cheng, Zhe Gan, Licheng Yu, Yiming Yang, Jingjing Liu
2020ECCVBehind the Scene: Revealing the Secrets of Pre-trained Vision-and-Language Models.Jize Cao, Zhe Gan, Yu Cheng, Licheng Yu, Yen-Chun Chen, Jingjing Liu
2020ECCVUNITER: UNiversal Image-TExt Representation Learning.Yen-Chun Chen, Linjie Li, Licheng Yu, Ahmed El Kholy, Faisal Ahmed, Zhe Gan, Yu Cheng, Jingjing Liu
2020EMNLPContextual Text Style Transfer.Yu Cheng, Zhe Gan, Yizhe Zhang, Oussama Elachqar, Dianqi Li, Jingjing Liu
2020EMNLPMulti-Fact Correction in Abstractive Text Summarization.Yue Dong, Shuohang Wang, Zhe Gan, Yu Cheng, Jackie Chi Kit Cheung, Jingjing Liu
2020EMNLPHierarchical Graph Network for Multi-hop Question Answering.Yuwei Fang, Siqi Sun, Zhe Gan, Rohit Pillai, Shuohang Wang, Jingjing Liu
2020EMNLPHERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training.Linjie Li, Yen-Chun Chen, Yu Cheng, Zhe Gan, Licheng Yu, Jingjing Liu
2020EMNLPContrastive Distillation on Intermediate Representations for Language Model Compression.Siqi Sun, Zhe Gan, Yuwei Fang, Yu Cheng, Shuohang Wang, Jingjing Liu
2020EMNLPCross-Thought for Sentence Encoder Pre-training.Shuohang Wang, Yuwei Fang, Siqi Sun, Zhe Gan, Yu Cheng, Jingjing Liu, Jing Jiang
2020EMNLPPOINTER: Constrained Progressive Text Generation via Insertion-based Generative Pre-training.Yizhe Zhang, Guoyin Wang, Chunyuan Li, Zhe Gan, Chris Brockett, Bill Dolan
2020ICLRFreeLB: Enhanced Adversarial Training for Natural Language Understanding.Chen Zhu, Yu Cheng, Zhe Gan, Siqi Sun, Tom Goldstein, Jingjing Liu
2020ICMLGraph Optimal Transport for Cross-Domain Alignment.Liqun Chen, Zhe Gan, Yu Cheng, Linjie Li, Lawrence Carin, Jingjing Liu
2020ICMLCLUB: A Contrastive Log-ratio Upper Bound of Mutual Information.Pengyu Cheng, Weituo Hao, Shuyang Dai, Jiachang Liu, Zhe Gan, Lawrence Carin
2019AAAIHierarchically Structured Reinforcement Learning for Topically Coherent Visual Story Generation.Qiuyuan Huang, Zhe Gan, Asli Celikyilmaz, Dapeng Oliver Wu, Jianfeng Wang, Xiaodong He
2019ACLMulti-step Reasoning via Recurrent Dual Attention for Visual Dialog.Zhe Gan, Yu Cheng, Ahmed El Kholy, Linjie Li, Jingjing Liu, Jianfeng Gao
2019CVPRTactical Rewind: Self-Correction via Backtracking in Vision-And-Language Navigation.Liyiming Ke, Xiujun Li, Yonatan Bisk, Ari Holtzman, Zhe Gan, Jingjing Liu, Jianfeng Gao, Yejin Choi, Siddhartha S. Srinivasa
2019CVPRStoryGAN: A Sequential Conditional GAN for Story Visualization.Yitong Li, Zhe Gan, Yelong Shen, Jingjing Liu, Yu Cheng, Yuexin Wu, Lawrence Carin, David E. Carlson, Jianfeng Gao
2019EMNLPTIGEr: Text-to-Image Grounding for Image Caption Evaluation.Ming Jiang, Qiuyuan Huang, Lei Zhang, Xin Wang, Pengchuan Zhang, Zhe Gan, Jana Diesner, Jianfeng Gao
2019EMNLPDomain Adaptive Text Style Transfer.Dianqi Li, Yizhe Zhang, Zhe Gan, Yu Cheng, Chris Brockett, Bill Dolan, Ming-Ting Sun
2019EMNLPPatient Knowledge Distillation for BERT Model Compression.Siqi Sun, Yu Cheng, Zhe Gan, Jingjing Liu
2019EMNLPAdversarial Domain Adaptation for Machine Reading Comprehension.Huazheng Wang, Zhe Gan, Xiaodong Liu, Jingjing Liu, Jianfeng Gao, Hongning Wang
2019ICCVRelation-Aware Graph Attention Network for Visual Question Answering.Linjie Li, Zhe Gan, Yu Cheng, Jingjing Liu
2019ICLRImproving Sequence-to-Sequence Learning via Optimal Transport.Liqun Chen, Yizhe Zhang, Ruiyi Zhang, Chenyang Tao, Zhe Gan, Haichao Zhang, Bai Li, Dinghan Shen, Changyou Chen, Lawrence Carin
2019NAACLTopic-Guided Variational Auto-Encoder for Text Generation.Wenlin Wang, Zhe Gan, Hongteng Xu, Ruiyi Zhang, Guoyin Wang, Dinghan Shen, Changyou Chen, Lawrence Carin
2018AAAIAdaptive Feature Abstraction for Translating Video to Text.Yunchen Pu, Martin Renqiang Min, Zhe Gan, Lawrence Carin
2018AISTATSTopic Compositional Neural Language Model.Wenlin Wang, Zhe Gan, Wenqi Wang, Dinghan Shen, Jiaji Huang, Wei Ping, Sanjeev Satheesh, Lawrence Carin
2018CVPRAttnGAN: Fine-Grained Text to Image Generation With Attentional Generative Adversarial Networks.Tao Xu, Pengchuan Zhang, Qiuyuan Huang, Han Zhang, Zhe Gan, Xiaolei Huang, Xiaodong He
2018ICMLJointGAN: Multi-Domain Joint Distribution Learning with Generative Adversarial Nets.Yunchen Pu, Shuyang Dai, Zhe Gan, Weiyao Wang, Guoyin Wang, Yizhe Zhang, Ricardo Henao, Lawrence Carin
2017AAAIUnsupervised Learning with Truncated Gaussian Graphical Models.Qinliang Su, Xuejun Liao, Chunyuan Li, Zhe Gan, Lawrence Carin
2017ACLScalable Bayesian Learning of Recurrent Neural Networks for Language Modeling.Zhe Gan, Chunyuan Li, Changyou Chen, Yunchen Pu, Qinliang Su, Lawrence Carin
2017CVPRStyleNet: Generating Attractive Visual Captions with Styles.Chuang Gan, Zhe Gan, Xiaodong He, Jianfeng Gao, Li Deng
2017CVPRSemantic Compositional Networks for Visual Captioning.Zhe Gan, Chuang Gan, Xiaodong He, Yunchen Pu, Kenneth Tran, Jianfeng Gao, Lawrence Carin, Li Deng
2017EMNLPLearning Generic Sentence Representations Using Convolutional Neural Networks.Zhe Gan, Yunchen Pu, Ricardo Henao, Chunyuan Li, Xiaodong He, Lawrence Carin
2017ICASSPCharacter-level deep conflation for business data analytics.Zhe Gan, P. D. Singh, Ameet Joshi, Xiaodong He, Jianshu Chen, Jianfeng Gao, Li Deng
2017ICASSPAdaptive DCTNet for audio signal classification.Yin Xian, Yunchen Pu, Zhe Gan, Liang Lu, Andrew Thompson
2017ICLRAdaptive Feature Abstraction for Translating Video to Language.Yunchen Pu, Martin Renqiang Min, Zhe Gan, Lawrence Carin
2017ICMLStochastic Gradient Monomial Gamma Sampler.Yizhe Zhang, Changyou Chen, Zhe Gan, Ricardo Henao, Lawrence Carin
2017ICMLAdversarial Feature Matching for Text Generation.Yizhe Zhang, Zhe Gan, Kai Fan, Zhi Chen, Ricardo Henao, Dinghan Shen, Lawrence Carin
2016AISTATSBridging the Gap between Stochastic Gradient MCMC and Stochastic Optimization.Changyou Chen, David E. Carlson, Zhe Gan, Chunyuan Li, Lawrence Carin
2016CVPRLearning Weight Uncertainty with Stochastic Gradient MCMC for Shape Classification.Chunyuan Li, Andrew Stevens, Changyou Chen, Yunchen Pu, Zhe Gan, Lawrence Carin
2016ICMLFactored Temporal Sigmoid Belief Networks for Sequence Learning.Jiaming Song, Zhe Gan, Lawrence Carin
2015AISTATSLearning Deep Sigmoid Belief Networks with Data Augmentation.Zhe Gan, Ricardo Henao, David E. Carlson, Lawrence Carin
2015ICMLScalable Deep Poisson Factor Analysis for Topic Modeling.Zhe Gan, Changyou Chen, Ricardo Henao, David E. Carlson, Lawrence Carin