Zhengyuan Yang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
55
Venues
13
Active years
2017–2026
Best venue rank
A*
Where they publish
Papers
55 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering. | Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang |
| 2026 | ACL | Shanks: Simultaneous Hearing and Thinking for Spoken Language Models. | Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang |
| 2026 | ACL | V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models. | Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang |
| 2026 | WACV | Conditional Text-to-Image Generation with Reference Guidance. | Taewook Kim, Ze Wang, Zhengyuan Yang, Jiang Wang, Lijuan Wang, Zicheng Liu, Qiang Qiu |
| 2026 | WACV | Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising. | Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang |
| 2025 | CVPR | LiVOS: Light Video Object Segmentation with Gated Linear Matching. | Qin Liu, Jianfeng Wang, Zhengyuan Yang, Linjie Li, Kevin Lin, Marc Niethammer, Lijuan Wang |
| 2025 | CVPR | ShowUI: One Vision-Language-Action Model for GUI Visual Agent. | Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan Weixian Lei, Lijuan Wang, Mike Zheng Shou |
| 2025 | EMNLP | Audio-Aware Large Language Models as Judges for Speaking Styles. | Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang |
| 2025 | EMNLP | GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them? | Yiyang Zhou, Linjie Li, Shi Qiu, Zhengyuan Yang, Yuyang Zhao, Siwei Han, Yangfan He, Kangqi Li, Haonian Ji, Zihao Zhao, Haibo Tong, Lijuan Wang, Huaxiu Yao |
| 2025 | ICCV | ImageGen-CoT: Enhancing Text-to-Image in-context Learning with Chain-of-Thought Reasoning. | Jiaqi Liao, Zhengyuan Yang, Linjie Li, Dianqi Li, Kevin Lin, Yu Cheng, Lijuan Wang |
| 2025 | ICCV | SITE: Towards Spatial Intelligence Thorough Evaluation. | Wenqi Wang, Reuben Tan, Pengyue Zhu, Jianwei Yang, Zhengyuan Yang, Lijuan Wang, Andrey Kolobov, Jianfeng Gao, Boqing Gong |
| 2025 | ICCV | Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension. | Xiyao Wang, Zhengyuan Yang, Linjie Li, Hongjin Lu, Yuancheng Xu, Chung-Ching Lin, Kevin Lin, Furong Huang, Lijuan Wang |
| 2025 | ICLR | MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos. | Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu, Wanrong Zhu, Jiachen Li, Yue Fan, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Kevin Lin, William Yang Wang, Lijuan Wang, Xin Eric Wang |
| 2025 | ICLR | SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation. | Yining Hong, Beide Liu, Maxine Wu, Yuanhao Zhai, Kai-Wei Chang, Linjie Li, Kevin Lin, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, Ying Nian Wu, Lijuan Wang |
| 2025 | ICLR | Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization. | Zichen Miao, Zhengyuan Yang, Kevin Lin, Ze Wang, Zicheng Liu, Lijuan Wang, Qiang Qiu |
| 2025 | ICLR | GenXD: Generating Any 3D and 4D Scenes. | Yuyang Zhao, Chung-Ching Lin, Kevin Lin, Zhiwen Yan, Linjie Li, Zhengyuan Yang, Jianfeng Wang, Gim Hee Lee, Lijuan Wang |
| 2025 | ICLR | EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing. | Kaizhi Zheng, Xiaotong Chen, Xuehai He, Jing Gu, Linjie Li, Zhengyuan Yang, Kevin Lin, Jianfeng Wang, Lijuan Wang, Xin Eric Wang |
| 2025 | ICML | ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding. | Xingyu Fu, Minqian Liu, Zhengyuan Yang, John Corring, Yijuan Lu, Jianwei Yang, Dan Roth, Dinei A. F. Florncio, Cha Zhang |
| 2025 | ICML | Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark. | Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Yu Cheng |
| 2025 | NAACL | Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering. | Chenglei Si, Yanzhe Zhang, Ryan Li, Zhengyuan Yang, Ruibo Liu, Diyi Yang |
| 2024 | AAAI | SGFormer: Semantic Graph Transformer for Point Cloud-Based 3D Scene Graph Generation. | Changsheng Lv, Mengshi Qi, Xia Li, Zhengyuan Yang, Huadong Ma |
| 2024 | CVPR | Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation. | Jaemin Cho, Linjie Li, Zhengyuan Yang, Zhe Gan, Lijuan Wang, Mohit Bansal |
| 2024 | CVPR | Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning. | Zichen Miao, Jiang Wang, Ze Wang, Zhengyuan Yang, Lijuan Wang, Qiang Qiu, Zicheng Liu |
| 2024 | CVPR | MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos. | Jielin Qiu, Jiacheng Zhu, William Han, Aditesh Kumar, Karthik Mittal, Claire Jin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Ding Zhao, Bo Li, Lijuan Wang |
| 2024 | CVPR | Disco: Disentangled Control for Realistic Human Dance Generation. | Tan Wang, Linjie Li, Kevin Lin, Yuanhao Zhai, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang |
| 2024 | CVPR | MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning. | Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang |
| 2024 | ECCV | GRiT: A Generative Region-to-Text Transformer for Object Understanding. | Jialian Wu, Jianfeng Wang, Zhengyuan Yang, Zhe Gan, Zicheng Liu, Junsong Yuan, Lijuan Wang |
| 2024 | ECCV | Idea2Img: Iterative Self-refinement with GPT-4V for Automatic Image Design and Generation. | Zhengyuan Yang, Jianfeng Wang, Linjie Li, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Lijuan Wang |
| 2024 | ECCV | IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation. | Yuanhao Zhai, Kevin Lin, Linjie Li, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, David S. Doermann, Junsong Yuan, Zicheng Liu, Lijuan Wang |
| 2024 | ICML | StrokeNUWA - Tokenizing Strokes for Vector Graphic Synthesis. | Zecheng Tang, Chenfei Wu, Zekai Zhang, Minheng Ni, Shengming Yin, Yu Liu, Zhengyuan Yang, Lijuan Wang, Zicheng Liu, Juntao Li, Nan Duan |
| 2024 | ICML | MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities. | Weihao Yu, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Kevin Lin, Zicheng Liu, Xinchao Wang, Lijuan Wang |
| 2024 | IJCAI | Bring Metric Functions into Diffusion Models. | Jie An, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Zicheng Liu, Lijuan Wang, Jiebo Luo |
| 2023 | ACL | NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation. | Shengming Yin, Chenfei Wu, Huan Yang, Jianfeng Wang, Xiaodong Wang, Minheng Ni, Zhengyuan Yang, Linjie Li, Shuguang Liu, Fan Yang, Jianlong Fu, Ming Gong, Lijuan Wang, Zicheng Liu, Houqiang Li, Nan Duan |
| 2023 | CVPR | ReCo: Region-Controlled Text-to-Image Generation. | Zhengyuan Yang, Jianfeng Wang, Zhe Gan, Linjie Li, Kevin Lin, Chenfei Wu, Nan Duan, Zicheng Liu, Ce Liu, Michael Zeng, Lijuan Wang |
| 2023 | ICCV | PromptCap: Prompt-Guided Image Captioning for VQA with GPT-3. | Yushi Hu, Hang Hua, Zhengyuan Yang, Weijia Shi, Noah A. Smith, Jiebo Luo |
| 2023 | ICCV | Equivariant Similarity for Vision-Language Foundation Models. | Tan Wang, Kevin Lin, Linjie Li, Chung-Ching Lin, Zhengyuan Yang, Hanwang Zhang, Zicheng Liu, Lijuan Wang |
| 2023 | ICLR | Prompting GPT-3 To Be Reliable. | Chenglei Si, Zhe Gan, Zhengyuan Yang, Shuohang Wang, Jianfeng Wang, Jordan L. Boyd-Graber, Lijuan Wang |
| 2023 | IJCAI | Learning 3D Photography Videos via Self-supervised Diffusion on Single Images. | Xiaodong Wang, Chenfei Wu, Shengming Yin, Minheng Ni, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Fan Yang, Lijuan Wang, Zicheng Liu, Yuejian Fang, Nan Duan |
| 2022 | AAAI | An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA. | Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Yumao Lu, Zicheng Liu, Lijuan Wang |
| 2022 | CVPR | Scaling Up Vision-Language Pretraining for Image Captioning. | Xiaowei Hu, Zhe Gan, Jianfeng Wang, Zhengyuan Yang, Zicheng Liu, Yumao Lu, Lijuan Wang |
| 2022 | ECCV | UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling. | Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Faisal Ahmed, Zicheng Liu, Yumao Lu, Lijuan Wang |
| 2022 | ICPR | Cross-modal Contrastive Distillation for Instructional Activity Anticipation. | Zhengyuan Yang, Jingen Liu, Jing Huang, Xiaodong He, Tao Mei, Chenliang Xu, Jiebo Luo |
| 2021 | CVPR | Improving Weakly Supervised Visual Grounding by Contrastive Knowledge Distillation. | Liwei Wang, Jing Huang, Yin Li, Kun Xu, Zhengyuan Yang, Dong Yu |
| 2021 | CVPR | TAP: Text-Aware Pre-Training for Text-VQA and Text-Caption. | Zhengyuan Yang, Yijuan Lu, Jianfeng Wang, Xi Yin, Dinei Florncio, Lijuan Wang, Cha Zhang, Lei Zhang, Jiebo Luo |
| 2021 | ICCV | TransVG: End-to-End Visual Grounding with Transformers. | Jiajun Deng, Zhengyuan Yang, Tianlang Chen, Wengang Zhou, Houqiang Li |
| 2021 | ICCV | SAT: 2D Semantics Assisted Training for 3D Visual Grounding. | Zhengyuan Yang, Songyang Zhang, Liwei Wang, Jiebo Luo |
| 2020 | ACL | A Novel Graph-based Multi-modal Fusion Encoder for Neural Machine Translation. | Yongjing Yin, Fandong Meng, Jinsong Su, Chulun Zhou, Zhengyuan Yang, Jie Zhou, Jiebo Luo |
| 2020 | ECCV | Improving One-Stage Visual Grounding by Recursive Sub-query Construction. | Zhengyuan Yang, Tianlang Chen, Liwei Wang, Jiebo Luo |
| 2020 | ICPR | Pose-based Body Language Recognition for Emotion and Psychiatric Symptom Interpretation. | Zhengyuan Yang, Amanda Kay, Yuncheng Li, Wendi Cross, Jiebo Luo |
| 2020 | ICPR | Weakly Supervised Body Part Segmentation with Pose based Part Priors. | Zhengyuan Yang, Yuncheng Li, Linjie Yang, Ning Zhang, Jiebo Luo |
| 2019 | CVPR | Attentive Relational Networks for Mapping Images to Scene Graphs. | Mengshi Qi, Weijian Li, Zhengyuan Yang, Yunhong Wang, Jiebo Luo |
| 2019 | ICCV | A Fast and Accurate One-Stage Approach to Visual Grounding. | Zhengyuan Yang, Boqing Gong, Liwei Wang, Wenbing Huang, Dong Yu, Jiebo Luo |
| 2018 | ICPR | Action Recognition with Visual Attention on Skeleton Images. | Zhengyuan Yang, Yuncheng Li, Jianchao Yang, Jiebo Luo |
| 2018 | ICPR | End-to-end Multi-Modal Multi-Task Vehicle Control for Self-Driving Cars with Visual Perceptions. | Zhengyuan Yang, Yixuan Zhang, Jerry Yu, Junjie Cai, Jiebo Luo |
| 2017 | ICIP | Personalized pose estimation for body language understanding. | Zhengyuan Yang, Jiebo Luo |