Skip to content

Linjie Li

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

56

Venues

14

Active years

2016–2026

Best venue rank

A*

Where they publish

Papers

56 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAITextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering.Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang
2026ACLShanks: Simultaneous Hearing and Thinking for Spoken Language Models.Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang
2026ACLV-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models.Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang
2026WACVZero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising.Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang
2025CVPRLiVOS: Light Video Object Segmentation with Gated Linear Matching.Qin Liu, Jianfeng Wang, Zhengyuan Yang, Linjie Li, Kevin Lin, Marc Niethammer, Lijuan Wang
2025CVPRShowUI: One Vision-Language-Action Model for GUI Visual Agent.Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou
2025CVPRSynthetic Visual Genome.Jae Sung Park, Zixian Ma, Linjie Li, Chenhao Zheng, Cheng-Yu Hsieh, Ximing Lu, Khyathi Raghavi Chandu, Quan Kong, Norimasa Kobori, Ali Farhadi, Yejin Choi, Ranjay Krishna
2025EMNLPAudio-Aware Large Language Models as Judges for Speaking Styles.Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang
2025EMNLPGLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?Yiyang Zhou, Linjie Li, Shi Qiu, Zhengyuan Yang, Yuyang Zhao, Siwei Han, Yangfan He, Kangqi Li, Haonian Ji, Zihao Zhao, Haibo Tong, Lijuan Wang, Huaxiu Yao
2025ICCVImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning.Jiaqi Liao, Zhengyuan Yang, Linjie Li, Dianqi Li, Kevin Lin, Yu Cheng, Lijuan Wang
2025ICCVScaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension.Xiyao Wang, Zhengyuan Yang, Linjie Li, Hongjin Lu, Yuancheng Xu, Chung-Ching Lin, Kevin Lin, Furong Huang, Lijuan Wang
2025ICLRCertainlyUncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness.Khyathi Raghavi Chandu, Linjie Li, Anas Awadalla, Ximing Lu, Jae Sung Park, Jack Hessel, Lijuan Wang, Yejin Choi
2025ICLRMMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos.Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu, Wanrong Zhu, Jiachen Li, Yue Fan, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Kevin Lin, William Yang Wang, Lijuan Wang, Xin Eric Wang
2025ICLRSlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation.Yining Hong, Beide Liu, Maxine Wu, Yuanhao Zhai, Kai-Wei Chang, Linjie Li, Kevin Lin, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, Ying Nian Wu, Lijuan Wang
2025ICLRMMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models.Peng Xia, Siwei Han, Shi Qiu, Yiyang Zhou, Zhaoyang Wang, Wenhao Zheng, Zhaorun Chen, Chenhang Cui, Mingyu Ding, Linjie Li, Lijuan Wang, Huaxiu Yao
2025ICLRGenXD: Generating Any 3D and 4D Scenes.Yuyang Zhao, Chung-Ching Lin, Kevin Lin, Zhiwen Yan, Linjie Li, Zhengyuan Yang, Jianfeng Wang, Gim Hee Lee, Lijuan Wang
2025ICLREditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing.Kaizhi Zheng, Xiaotong Chen, Xuehai He, Jing Gu, Linjie Li, Zhengyuan Yang, Kevin Lin, Jianfeng Wang, Lijuan Wang, Xin Eric Wang
2025ICMLCan MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark.Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Yu Cheng
2025ICMLTest-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback.Yafu Li, Xuyang Hu, Xiaoye Qu, Linjie Li, Yu Cheng
2025IJCNNEmoAssist: Emotional Assistant for Visual Impairment Community.Xingyu Qi, He Li, Linjie Li, Zhenyu Wu
2024CVPRDiagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation.Jaemin Cho, Linjie Li, Zhengyuan Yang, Zhe Gan, Lijuan Wang, Mohit Bansal
2024CVPRMMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos.Jielin Qiu, Jiacheng Zhu, William Han, Aditesh Kumar, Karthik Mittal, Claire Jin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Ding Zhao, Bo Li, Lijuan Wang
2024CVPRDisco: Disentangled Control for Realistic Human Dance Generation.Tan Wang, Linjie Li, Kevin Lin, Yuanhao Zhai, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang
2024CVPRMM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning.Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang
2024ECCVIdea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation.Zhengyuan Yang, Jianfeng Wang, Linjie Li, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Lijuan Wang
2024ECCVIDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation.Yuanhao Zhai, Kevin Lin, Linjie Li, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, David S. Doermann, Junsong Yuan, Zicheng Liu, Lijuan Wang
2024ICLRMitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning.Fuxiao Liu, Kevin Lin, Linjie Li, Jianfeng Wang, Yaser Yacoob, Lijuan Wang
2024ICLRThe Generative AI Paradox: "What It Can Create, It May Not Understand".Peter West, Ximing Lu, Nouha Dziri, Faeze Brahman, Linjie Li, Jena D. Hwang, Liwei Jiang, Jillian Fisher, Abhilasha Ravichander, Khyathi Raghavi Chandu, Benjamin Newman, Pang Wei Koh, Allyson Ettinger, Yejin Choi
2024ICMLMM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities.Weihao Yu, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Kevin Lin, Zicheng Liu, Xinchao Wang, Lijuan Wang
2024IJCAIBring Metric Functions into Diffusion Models.Jie An, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Zicheng Liu, Lijuan Wang, Jiebo Luo
2023ACLNUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation.Shengming Yin, Chenfei Wu, Huan Yang, Jianfeng Wang, Xiaodong Wang, Minheng Ni, Zhengyuan Yang, Linjie Li, Shuguang Liu, Fan Yang, Jianlong Fu, Ming Gong, Lijuan Wang, Zicheng Liu, Houqiang Li, Nan Duan
2023CVPRAn Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling.Tsu-Jui Fu, Linjie Li, Zhe Gan, Kevin Lin, William Yang Wang, Lijuan Wang, Zicheng Liu
2023CVPRLAVENDER: Unifying Video-Language Understanding as Masked Language Modeling.Linjie Li, Zhe Gan, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Ce Liu, Lijuan Wang
2023CVPRAdaptive Human Matting for Dynamic Videos.Chung-Ching Lin, Jiang Wang, Kun Luo, Kevin Lin, Linjie Li, Lijuan Wang, Zicheng Liu
2023CVPRReCo: Region-Controlled Text-to-Image Generation.Zhengyuan Yang, Jianfeng Wang, Zhe Gan, Linjie Li, Kevin Lin, Chenfei Wu, Nan Duan, Zicheng Liu, Ce Liu, Michael Zeng, Lijuan Wang
2023CVPRGeneralized Decoding for Pixel, Image, and Language.Xueyan Zou, Zi-Yi Dou, Jianwei Yang, Zhe Gan, Linjie Li, Chunyuan Li, Xiyang Dai, Harkirat Behl, Jianfeng Wang, Lu Yuan, Nanyun Peng, Lijuan Wang, Yong Jae Lee, Jianfeng Gao
2023EMNLPAn Empirical Study of Multimodal Model Merging.Yi-Lin Sung, Linjie Li, Kevin Lin, Zhe Gan, Mohit Bansal, Lijuan Wang
2023ICCVEquivariant Similarity for Vision-Language Foundation Models.Tan Wang, Kevin Lin, Linjie Li, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang
2023IJCAILearning 3D Photography Videos via Self-supervised Diffusion on Single Images.Xiaodong Wang, Chenfei Wu, Shengming Yin, Minheng Ni, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Fan Yang, Lijuan Wang, Zicheng Liu, Yuejian Fang, Nan Duan
2022AAAIPlaying Lottery Tickets with Vision and Language.Zhe Gan, Yen-Chun Chen, Linjie Li, Tianlong Chen, Yu Cheng, Shuohang Wang, Jingjing Liu, Lijuan Wang, Zicheng Liu
2022ACCVTaE: Task-Aware Expandable Representation for Long Tail Class Incremental Learning.Linjie Li, Zhenyu Wu, Jiaming Liu, Yang Ji
2022CVPRSwinBERT: End-to-End Transformers with Sparse Attention for Video Captioning.Kevin Lin, Linjie Li, Chung-Ching Lin, Faisal Ahmed, Zhe Gan, Zicheng Liu, Yumao Lu, Lijuan Wang
2022CVPRCrossmodal Representation Learning for Zero-shot Action Recognition.Chung-Ching Lin, Kevin Lin, Lijuan Wang, Zicheng Liu, Linjie Li
2021CVPRLess Is More: ClipBERT for Video-and-Language Learning via Sparse Sampling.Jie Lei, Linjie Li, Luowei Zhou, Zhe Gan, Tamara L. Berg, Mohit Bansal, Jingjing Liu
2021CVPRUC2: Universal Cross-Lingual Cross-Modal Vision-and-Language Pre-Training.Mingyang Zhou, Luowei Zhou, Shuohang Wang, Yu Cheng, Linjie Li, Zhou Yu, Jingjing Liu
2021ICCVAdversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models.Linjie Li, Jie Lei, Zhe Gan, Jingjing Liu
2021NAACLLightningDOT: Pre-training Visual-Semantic Embeddings for Real-Time Image-Text Retrieval.Siqi Sun, Yen-Chun Chen, Linjie Li, Shuohang Wang, Yuwei Fang, Jingjing Liu
2021WACVMeta Module Network for Compositional Visual Reasoning.Wenhu Chen, Zhe Gan, Linjie Li, Yu Cheng, William Yang Wang, Jingjing Liu
2020ECCVUNITER: UNiversal Image-TExt Representation Learning.Yen-Chun Chen, Linjie Li, Licheng Yu, Ahmed El Kholy, Faisal Ahmed, Zhe Gan, Yu Cheng, Jingjing Liu
2020EMNLPHERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training.Linjie Li, Yen-Chun Chen, Yu Cheng, Zhe Gan, Licheng Yu, Jingjing Liu
2020ICMLGraph Optimal Transport for Cross-Domain Alignment.Liqun Chen, Zhe Gan, Yu Cheng, Linjie Li, Lawrence Carin, Jingjing Liu
2019ACLMulti-step Reasoning via Recurrent Dual Attention for Visual Dialog.Zhe Gan, Yu Cheng, Ahmed El Kholy, Linjie Li, Jingjing Liu, Jianfeng Gao
2019ICCVRelation-Aware Graph Attention Network for Visual Question Answering.Linjie Li, Zhe Gan, Yu Cheng, Jingjing Liu
2017CogSciLearning to See People like People: Predicting Social Perceptions of Faces.Amanda Song, Linjie Li, Chad Atalla, Gary Cottrell
2016CogSciExtracting Human Face Similarity Judgments: Pairs or Triplets?Linjie Li, Vicente L. Malave, Amanda Song, Angela J. Yu
2016CogSciUnderstanding human facial attractiveness from multiple views.Amanda Song, Linjie Li, Vicente L. Malave, Gary Cottrell, Angela J. Yu