Skip to content

Zhengyuan Yang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

55

Venues

13

Active years

2017–2026

Best venue rank

A*

Where they publish

Papers

55 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAITextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering.Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang
2026ACLShanks: Simultaneous Hearing and Thinking for Spoken Language Models.Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang
2026ACLV-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models.Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang
2026WACVConditional Text-to-Image Generation with Reference Guidance.Taewook Kim, Ze Wang, Zhengyuan Yang, Jiang Wang, Lijuan Wang, Zicheng Liu, Qiang Qiu
2026WACVZero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising.Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang
2025CVPRLiVOS: Light Video Object Segmentation with Gated Linear Matching.Qin Liu, Jianfeng Wang, Zhengyuan Yang, Linjie Li, Kevin Lin, Marc Niethammer, Lijuan Wang
2025CVPRShowUI: One Vision-Language-Action Model for GUI Visual Agent.Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou
2025EMNLPAudio-Aware Large Language Models as Judges for Speaking Styles.Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang
2025EMNLPGLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?Yiyang Zhou, Linjie Li, Shi Qiu, Zhengyuan Yang, Yuyang Zhao, Siwei Han, Yangfan He, Kangqi Li, Haonian Ji, Zihao Zhao, Haibo Tong, Lijuan Wang, Huaxiu Yao
2025ICCVImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning.Jiaqi Liao, Zhengyuan Yang, Linjie Li, Dianqi Li, Kevin Lin, Yu Cheng, Lijuan Wang
2025ICCVSITE: Towards Spatial Intelligence Thorough Evaluation.Wenqi Wang, Reuben Tan, Pengyue Zhu, Jianwei Yang, Zhengyuan Yang, Lijuan Wang, Andrey Kolobov, Jianfeng Gao, Boqing Gong
2025ICCVScaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension.Xiyao Wang, Zhengyuan Yang, Linjie Li, Hongjin Lu, Yuancheng Xu, Chung-Ching Lin, Kevin Lin, Furong Huang, Lijuan Wang
2025ICLRMMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos.Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu, Wanrong Zhu, Jiachen Li, Yue Fan, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Kevin Lin, William Yang Wang, Lijuan Wang, Xin Eric Wang
2025ICLRSlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation.Yining Hong, Beide Liu, Maxine Wu, Yuanhao Zhai, Kai-Wei Chang, Linjie Li, Kevin Lin, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, Ying Nian Wu, Lijuan Wang
2025ICLRTuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization.Zichen Miao, Zhengyuan Yang, Kevin Lin, Ze Wang, Zicheng Liu, Lijuan Wang, Qiang Qiu
2025ICLRGenXD: Generating Any 3D and 4D Scenes.Yuyang Zhao, Chung-Ching Lin, Kevin Lin, Zhiwen Yan, Linjie Li, Zhengyuan Yang, Jianfeng Wang, Gim Hee Lee, Lijuan Wang
2025ICLREditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing.Kaizhi Zheng, Xiaotong Chen, Xuehai He, Jing Gu, Linjie Li, Zhengyuan Yang, Kevin Lin, Jianfeng Wang, Lijuan Wang, Xin Eric Wang
2025ICMLReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding.Xingyu Fu, Minqian Liu, Zhengyuan Yang, John Corring, Yijuan Lu, Jianwei Yang, Dan Roth, Dinei A. F. Florncio, Cha Zhang
2025ICMLCan MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark.Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Yu Cheng
2025NAACLDesign2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering.Chenglei Si, Yanzhe Zhang, Ryan Li, Zhengyuan Yang, Ruibo Liu, Diyi Yang
2024AAAISGFormer: Semantic Graph Transformer for Point Cloud-Based 3D Scene Graph Generation.Changsheng Lv, Mengshi Qi, Xia Li, Zhengyuan Yang, Huadong Ma
2024CVPRDiagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation.Jaemin Cho, Linjie Li, Zhengyuan Yang, Zhe Gan, Lijuan Wang, Mohit Bansal
2024CVPRTraining Diffusion Models Towards Diverse Image Generation with Reinforcement Learning.Zichen Miao, Jiang Wang, Ze Wang, Zhengyuan Yang, Lijuan Wang, Qiang Qiu, Zicheng Liu
2024CVPRMMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos.Jielin Qiu, Jiacheng Zhu, William Han, Aditesh Kumar, Karthik Mittal, Claire Jin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Ding Zhao, Bo Li, Lijuan Wang
2024CVPRDisco: Disentangled Control for Realistic Human Dance Generation.Tan Wang, Linjie Li, Kevin Lin, Yuanhao Zhai, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang
2024CVPRMM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning.Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang
2024ECCVGRiT: A Generative Region-to-Text Transformer for Object Understanding.Jialian Wu, Jianfeng Wang, Zhengyuan Yang, Zhe Gan, Zicheng Liu, Junsong Yuan, Lijuan Wang
2024ECCVIdea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation.Zhengyuan Yang, Jianfeng Wang, Linjie Li, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Lijuan Wang
2024ECCVIDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation.Yuanhao Zhai, Kevin Lin, Linjie Li, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, David S. Doermann, Junsong Yuan, Zicheng Liu, Lijuan Wang
2024ICMLStrokeNUWA - Tokenizing Strokes for Vector Graphic Synthesis.Zecheng Tang, Chenfei Wu, Zekai Zhang, Minheng Ni, Shengming Yin, Yu Liu, Zhengyuan Yang, Lijuan Wang, Zicheng Liu, Juntao Li, Nan Duan
2024ICMLMM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities.Weihao Yu, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Kevin Lin, Zicheng Liu, Xinchao Wang, Lijuan Wang
2024IJCAIBring Metric Functions into Diffusion Models.Jie An, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Zicheng Liu, Lijuan Wang, Jiebo Luo
2023ACLNUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation.Shengming Yin, Chenfei Wu, Huan Yang, Jianfeng Wang, Xiaodong Wang, Minheng Ni, Zhengyuan Yang, Linjie Li, Shuguang Liu, Fan Yang, Jianlong Fu, Ming Gong, Lijuan Wang, Zicheng Liu, Houqiang Li, Nan Duan
2023CVPRReCo: Region-Controlled Text-to-Image Generation.Zhengyuan Yang, Jianfeng Wang, Zhe Gan, Linjie Li, Kevin Lin, Chenfei Wu, Nan Duan, Zicheng Liu, Ce Liu, Michael Zeng, Lijuan Wang
2023ICCVPromptCap: Prompt-Guided Image Captioning for VQA with GPT-3.Yushi Hu, Hang Hua, Zhengyuan Yang, Weijia Shi, Noah A. Smith, Jiebo Luo
2023ICCVEquivariant Similarity for Vision-Language Foundation Models.Tan Wang, Kevin Lin, Linjie Li, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang
2023ICLRPrompting GPT-3 To Be Reliable.Chenglei Si, Zhe Gan, Zhengyuan Yang, Shuohang Wang, Jianfeng Wang, Jordan L. Boyd-Graber, Lijuan Wang
2023IJCAILearning 3D Photography Videos via Self-supervised Diffusion on Single Images.Xiaodong Wang, Chenfei Wu, Shengming Yin, Minheng Ni, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Fan Yang, Lijuan Wang, Zicheng Liu, Yuejian Fang, Nan Duan
2022AAAIAn Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA.Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Yumao Lu, Zicheng Liu, Lijuan Wang
2022CVPRScaling Up Vision-Language Pretraining for Image Captioning.Xiaowei Hu, Zhe Gan, Jianfeng Wang, Zhengyuan Yang, Zicheng Liu, Yumao Lu, Lijuan Wang
2022ECCVUniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling.Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Faisal Ahmed, Zicheng Liu, Yumao Lu, Lijuan Wang
2022ICPRCross-modal Contrastive Distillation for Instructional Activity Anticipation.Zhengyuan Yang, Jingen Liu, Jing Huang, Xiaodong He, Tao Mei, Chenliang Xu, Jiebo Luo
2021CVPRImproving Weakly Supervised Visual Grounding by Contrastive Knowledge Distillation.Liwei Wang, Jing Huang, Yin Li, Kun Xu, Zhengyuan Yang, Dong Yu
2021CVPRTAP: Text-Aware Pre-Training for Text-VQA and Text-Caption.Zhengyuan Yang, Yijuan Lu, Jianfeng Wang, Xi Yin, Dinei Florncio, Lijuan Wang, Cha Zhang, Lei Zhang, Jiebo Luo
2021ICCVTransVG: End-to-End Visual Grounding with Transformers.Jiajun Deng, Zhengyuan Yang, Tianlang Chen, Wengang Zhou, Houqiang Li
2021ICCVSAT: 2D Semantics Assisted Training for 3D Visual Grounding.Zhengyuan Yang, Songyang Zhang, Liwei Wang, Jiebo Luo
2020ACLA Novel Graph-based Multi-modal Fusion Encoder for Neural Machine Translation.Yongjing Yin, Fandong Meng, Jinsong Su, Chulun Zhou, Zhengyuan Yang, Jie Zhou, Jiebo Luo
2020ECCVImproving One-Stage Visual Grounding by Recursive Sub-query Construction.Zhengyuan Yang, Tianlang Chen, Liwei Wang, Jiebo Luo
2020ICPRPose-based Body Language Recognition for Emotion and Psychiatric Symptom Interpretation.Zhengyuan Yang, Amanda Kay, Yuncheng Li, Wendi Cross, Jiebo Luo
2020ICPRWeakly Supervised Body Part Segmentation with Pose based Part Priors.Zhengyuan Yang, Yuncheng Li, Linjie Yang, Ning Zhang, Jiebo Luo
2019CVPRAttentive Relational Networks for Mapping Images to Scene Graphs.Mengshi Qi, Weijian Li, Zhengyuan Yang, Yunhong Wang, Jiebo Luo
2019ICCVA Fast and Accurate One-Stage Approach to Visual Grounding.Zhengyuan Yang, Boqing Gong, Liwei Wang, Wenbing Huang, Dong Yu, Jiebo Luo
2018ICPRAction Recognition with Visual Attention on Skeleton Images.Zhengyuan Yang, Yuncheng Li, Jianchao Yang, Jiebo Luo
2018ICPREnd-to-end Multi-Modal Multi-Task Vehicle Control for Self-Driving Cars with Visual Perceptions.Zhengyuan Yang, Yixuan Zhang, Jerry Yu, Junjie Cai, Jiebo Luo
2017ICIPPersonalized pose estimation for body language understanding.Zhengyuan Yang, Jiebo Luo