Linjie Li
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
56
Venues
14
Active years
2016–2026
Best venue rank
A*
Where they publish
Papers
56 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering. | Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang |
| 2026 | ACL | Shanks: Simultaneous Hearing and Thinking for Spoken Language Models. | Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang |
| 2026 | ACL | V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models. | Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang |
| 2026 | WACV | Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising. | Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang |
| 2025 | CVPR | LiVOS: Light Video Object Segmentation with Gated Linear Matching. | Qin Liu, Jianfeng Wang, Zhengyuan Yang, Linjie Li, Kevin Lin, Marc Niethammer, Lijuan Wang |
| 2025 | CVPR | ShowUI: One Vision-Language-Action Model for GUI Visual Agent. | Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou |
| 2025 | CVPR | Synthetic Visual Genome. | Jae Sung Park, Zixian Ma, Linjie Li, Chenhao Zheng, Cheng-Yu Hsieh, Ximing Lu, Khyathi Raghavi Chandu, Quan Kong, Norimasa Kobori, Ali Farhadi, Yejin Choi, Ranjay Krishna |
| 2025 | EMNLP | Audio-Aware Large Language Models as Judges for Speaking Styles. | Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang |
| 2025 | EMNLP | GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them? | Yiyang Zhou, Linjie Li, Shi Qiu, Zhengyuan Yang, Yuyang Zhao, Siwei Han, Yangfan He, Kangqi Li, Haonian Ji, Zihao Zhao, Haibo Tong, Lijuan Wang, Huaxiu Yao |
| 2025 | ICCV | ImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning. | Jiaqi Liao, Zhengyuan Yang, Linjie Li, Dianqi Li, Kevin Lin, Yu Cheng, Lijuan Wang |
| 2025 | ICCV | Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension. | Xiyao Wang, Zhengyuan Yang, Linjie Li, Hongjin Lu, Yuancheng Xu, Chung-Ching Lin, Kevin Lin, Furong Huang, Lijuan Wang |
| 2025 | ICLR | CertainlyUncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness. | Khyathi Raghavi Chandu, Linjie Li, Anas Awadalla, Ximing Lu, Jae Sung Park, Jack Hessel, Lijuan Wang, Yejin Choi |
| 2025 | ICLR | MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos. | Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu, Wanrong Zhu, Jiachen Li, Yue Fan, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Kevin Lin, William Yang Wang, Lijuan Wang, Xin Eric Wang |
| 2025 | ICLR | SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation. | Yining Hong, Beide Liu, Maxine Wu, Yuanhao Zhai, Kai-Wei Chang, Linjie Li, Kevin Lin, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, Ying Nian Wu, Lijuan Wang |
| 2025 | ICLR | MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models. | Peng Xia, Siwei Han, Shi Qiu, Yiyang Zhou, Zhaoyang Wang, Wenhao Zheng, Zhaorun Chen, Chenhang Cui, Mingyu Ding, Linjie Li, Lijuan Wang, Huaxiu Yao |
| 2025 | ICLR | GenXD: Generating Any 3D and 4D Scenes. | Yuyang Zhao, Chung-Ching Lin, Kevin Lin, Zhiwen Yan, Linjie Li, Zhengyuan Yang, Jianfeng Wang, Gim Hee Lee, Lijuan Wang |
| 2025 | ICLR | EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing. | Kaizhi Zheng, Xiaotong Chen, Xuehai He, Jing Gu, Linjie Li, Zhengyuan Yang, Kevin Lin, Jianfeng Wang, Lijuan Wang, Xin Eric Wang |
| 2025 | ICML | Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark. | Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Yu Cheng |
| 2025 | ICML | Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback. | Yafu Li, Xuyang Hu, Xiaoye Qu, Linjie Li, Yu Cheng |
| 2025 | IJCNN | EmoAssist: Emotional Assistant for Visual Impairment Community. | Xingyu Qi, He Li, Linjie Li, Zhenyu Wu |
| 2024 | CVPR | Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation. | Jaemin Cho, Linjie Li, Zhengyuan Yang, Zhe Gan, Lijuan Wang, Mohit Bansal |
| 2024 | CVPR | MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos. | Jielin Qiu, Jiacheng Zhu, William Han, Aditesh Kumar, Karthik Mittal, Claire Jin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Ding Zhao, Bo Li, Lijuan Wang |
| 2024 | CVPR | Disco: Disentangled Control for Realistic Human Dance Generation. | Tan Wang, Linjie Li, Kevin Lin, Yuanhao Zhai, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang |
| 2024 | CVPR | MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning. | Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang |
| 2024 | ECCV | Idea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation. | Zhengyuan Yang, Jianfeng Wang, Linjie Li, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Lijuan Wang |
| 2024 | ECCV | IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation. | Yuanhao Zhai, Kevin Lin, Linjie Li, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, David S. Doermann, Junsong Yuan, Zicheng Liu, Lijuan Wang |
| 2024 | ICLR | Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning. | Fuxiao Liu, Kevin Lin, Linjie Li, Jianfeng Wang, Yaser Yacoob, Lijuan Wang |
| 2024 | ICLR | The Generative AI Paradox: "What It Can Create, It May Not Understand". | Peter West, Ximing Lu, Nouha Dziri, Faeze Brahman, Linjie Li, Jena D. Hwang, Liwei Jiang, Jillian Fisher, Abhilasha Ravichander, Khyathi Raghavi Chandu, Benjamin Newman, Pang Wei Koh, Allyson Ettinger, Yejin Choi |
| 2024 | ICML | MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities. | Weihao Yu, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Kevin Lin, Zicheng Liu, Xinchao Wang, Lijuan Wang |
| 2024 | IJCAI | Bring Metric Functions into Diffusion Models. | Jie An, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Zicheng Liu, Lijuan Wang, Jiebo Luo |
| 2023 | ACL | NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation. | Shengming Yin, Chenfei Wu, Huan Yang, Jianfeng Wang, Xiaodong Wang, Minheng Ni, Zhengyuan Yang, Linjie Li, Shuguang Liu, Fan Yang, Jianlong Fu, Ming Gong, Lijuan Wang, Zicheng Liu, Houqiang Li, Nan Duan |
| 2023 | CVPR | An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling. | Tsu-Jui Fu, Linjie Li, Zhe Gan, Kevin Lin, William Yang Wang, Lijuan Wang, Zicheng Liu |
| 2023 | CVPR | LAVENDER: Unifying Video-Language Understanding as Masked Language Modeling. | Linjie Li, Zhe Gan, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Ce Liu, Lijuan Wang |
| 2023 | CVPR | Adaptive Human Matting for Dynamic Videos. | Chung-Ching Lin, Jiang Wang, Kun Luo, Kevin Lin, Linjie Li, Lijuan Wang, Zicheng Liu |
| 2023 | CVPR | ReCo: Region-Controlled Text-to-Image Generation. | Zhengyuan Yang, Jianfeng Wang, Zhe Gan, Linjie Li, Kevin Lin, Chenfei Wu, Nan Duan, Zicheng Liu, Ce Liu, Michael Zeng, Lijuan Wang |
| 2023 | CVPR | Generalized Decoding for Pixel, Image, and Language. | Xueyan Zou, Zi-Yi Dou, Jianwei Yang, Zhe Gan, Linjie Li, Chunyuan Li, Xiyang Dai, Harkirat Behl, Jianfeng Wang, Lu Yuan, Nanyun Peng, Lijuan Wang, Yong Jae Lee, Jianfeng Gao |
| 2023 | EMNLP | An Empirical Study of Multimodal Model Merging. | Yi-Lin Sung, Linjie Li, Kevin Lin, Zhe Gan, Mohit Bansal, Lijuan Wang |
| 2023 | ICCV | Equivariant Similarity for Vision-Language Foundation Models. | Tan Wang, Kevin Lin, Linjie Li, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang |
| 2023 | IJCAI | Learning 3D Photography Videos via Self-supervised Diffusion on Single Images. | Xiaodong Wang, Chenfei Wu, Shengming Yin, Minheng Ni, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Fan Yang, Lijuan Wang, Zicheng Liu, Yuejian Fang, Nan Duan |
| 2022 | AAAI | Playing Lottery Tickets with Vision and Language. | Zhe Gan, Yen-Chun Chen, Linjie Li, Tianlong Chen, Yu Cheng, Shuohang Wang, Jingjing Liu, Lijuan Wang, Zicheng Liu |
| 2022 | ACCV | TaE: Task-Aware Expandable Representation for Long Tail Class Incremental Learning. | Linjie Li, Zhenyu Wu, Jiaming Liu, Yang Ji |
| 2022 | CVPR | SwinBERT: End-to-End Transformers with Sparse Attention for Video Captioning. | Kevin Lin, Linjie Li, Chung-Ching Lin, Faisal Ahmed, Zhe Gan, Zicheng Liu, Yumao Lu, Lijuan Wang |
| 2022 | CVPR | Crossmodal Representation Learning for Zero-shot Action Recognition. | Chung-Ching Lin, Kevin Lin, Lijuan Wang, Zicheng Liu, Linjie Li |
| 2021 | CVPR | Less Is More: ClipBERT for Video-and-Language Learning via Sparse Sampling. | Jie Lei, Linjie Li, Luowei Zhou, Zhe Gan, Tamara L. Berg, Mohit Bansal, Jingjing Liu |
| 2021 | CVPR | UC2: Universal Cross-Lingual Cross-Modal Vision-and-Language Pre-Training. | Mingyang Zhou, Luowei Zhou, Shuohang Wang, Yu Cheng, Linjie Li, Zhou Yu, Jingjing Liu |
| 2021 | ICCV | Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models. | Linjie Li, Jie Lei, Zhe Gan, Jingjing Liu |
| 2021 | NAACL | LightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time Image-Text Retrieval. | Siqi Sun, Yen-Chun Chen, Linjie Li, Shuohang Wang, Yuwei Fang, Jingjing Liu |
| 2021 | WACV | Meta Module Network for Compositional Visual Reasoning. | Wenhu Chen, Zhe Gan, Linjie Li, Yu Cheng, William Yang Wang, Jingjing Liu |
| 2020 | ECCV | UNITER: UNiversal Image-TExt Representation Learning. | Yen-Chun Chen, Linjie Li, Licheng Yu, Ahmed El Kholy, Faisal Ahmed, Zhe Gan, Yu Cheng, Jingjing Liu |
| 2020 | EMNLP | HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training. | Linjie Li, Yen-Chun Chen, Yu Cheng, Zhe Gan, Licheng Yu, Jingjing Liu |
| 2020 | ICML | Graph Optimal Transport for Cross-Domain Alignment. | Liqun Chen, Zhe Gan, Yu Cheng, Linjie Li, Lawrence Carin, Jingjing Liu |
| 2019 | ACL | Multi-step Reasoning via Recurrent Dual Attention for Visual Dialog. | Zhe Gan, Yu Cheng, Ahmed El Kholy, Linjie Li, Jingjing Liu, Jianfeng Gao |
| 2019 | ICCV | Relation-Aware Graph Attention Network for Visual Question Answering. | Linjie Li, Zhe Gan, Yu Cheng, Jingjing Liu |
| 2017 | CogSci | Learning to See People like People: Predicting Social Perceptions of Faces. | Amanda Song, Linjie Li, Chad Atalla, Gary Cottrell |
| 2016 | CogSci | Extracting Human Face Similarity Judgments: Pairs or Triplets? | Linjie Li, Vicente L. Malave, Amanda Song, Angela J. Yu |
| 2016 | CogSci | Understanding human facial attractiveness from multiple views. | Amanda Song, Linjie Li, Vicente L. Malave, Gary Cottrell, Angela J. Yu |