Skip to content

Yuhang Zang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

30

Venues

7

Active years

2019–2026

Best venue rank

A*

Where they publish

Papers

30 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLMinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing.Junbo Niu, Zheng Liu, Zhuangcheng Gu, Bin Wang, Linke Ouyang, Zhiyuan Zhao, Tao Chu, Tianyao He, Fan Wu, Qintong Zhang, Zhenjiang Jin, Guang Liang, Rui Zhang, Wenzheng Zhang, Yuan Qu, Zhifei Ren, Yuefeng Sun, Zirui Tang, Boyu Niu, Yuanhong Zheng, Dongsheng Ma, Ziyang Miao, Hejun Dong, Siyi Qian, Junyuan Zhang, Fangdong Wang, Jingzhou Chen, Xiaomeng Zhao, Liqun Wei, Wei Li, Shasha Wang, Ruiliang Xu, Yuanyuan Cao, Lu Chen, Qianqian Wu, Huaiyu Gu, Lindong Lu, Dechen Lin, Shenguanlin, Xuanhe Zhou, Linfeng Zhang, Yuhang Zang, Xiaoyi Dong, Jiaqi Wang, Bo Zhang, Lei Bai, Pei Chu, Weijia Li, Jiang Wu, Lijun Wu, Zhenxiang Li, Guangyu Wang, Zhongying Tu, Chao Xu, Kai Chen, Bowen Zhou, Dahua Lin, Wentao Zhang, Conghui He
2025ACLTowards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings.Yubo Ma, Jinsong Li, Yuhang Zang, Xiaobao Wu, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Jiaqi Wang, Yixin Cao, Aixin Sun
2025ACLInternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model.Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Ziyu Liu, Shengyuan Ding, Shenxi Wu, Yubo Ma, Haodong Duan, Wenwei Zhang, Kai Chen, Dahua Lin, Jiaqi Wang
2025CVPRDispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction.Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025CVPRWildAvatar: Learning In-the-wild 3D Avatars from the Web.Zihao Huang, Shoukang Hu, Guangcong Wang, Tianqi Liu, Yuhang Zang, Zhiguo Cao, Wei Li, Ziwei Liu
2025CVPRByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way.Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025CVPROVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?Junbo Niu, Yifei Li, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang
2025CVPRConical Visual Concentration for Efficient Large Vision-Language Models.Long Xing, Qidong Huang, Xiaoyi Dong, Jiajie Lu, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang, Feng Wu, Dahua Lin
2025ICCVSAM2LONG: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree.Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang
2025ICCVMM-IFEngine: Towards Multimodal Instruction Following.Shengyuan Ding, Shenxi Wu, Xiangyu Zhao, Yuhang Zang, Haodong Duan, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025ICCVDeciphering Cross-Modal Alignment in Large Vision-Language Models Via Modality Integration Rate.Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Weiming Zhang, Nenghai Yu
2025ICCVVisual-RFT: Visual Reinforcement Fine-Tuning.Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang
2025ICCVX-Prompt: Generalizable Auto-Regressive Visual Learning with In-Context Prompting.Zeyi Sun, Ziyang Chu, Pan Zhang, Tong Wu, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
2025ICCVBootstrap3D: Improving Multi-View Diffusion Model with Synthetic Data.Zeyi Sun, Tong Wu, Pan Zhang, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
2025ICCVBootstrapping Grounded Chain-of-Thought in Multimodal Llms for Data-Efficient Model Adaptation.Jiaer Xia, Bingkui Tong, Yuhang Zang, Rui Shao, Kaiyang Zhou
2025ICCVLight-a-Video: Training-Free Video Relighting via Progressive Light Fusion.Yujie Zhou, Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Qidong Huang, Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Anyi Rao, Jiaqi Wang, Li Niu
2025ICLRMotionClone: Training-Free Motion Cloning for Controllable Video Generation.Pengyang Ling, Jiazi Bu, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Tong Wu, Huaian Chen, Jiaqi Wang, Yi Jin
2025ICLRMIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models.Ziyu Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Conghui He, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
2025ICMLSongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation.Zihan Liu, Shuangrui Ding, Zhixiong Zhang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025ICMLVideoRoPE: What Makes for Good Video Rotary Position Embedding?Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang, Xipeng Qiu, Dahua Lin
2024CVPRAlpha-CLIP: A CLIP Model Focusing on Wherever you Want.Zeyi Sun, Ye Fang, Tong Wu, Pan Zhang, Yuhang Zang, Shu Kong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
2024ECCVMVSGaussian: Fast Generalizable Gaussian Splatting Reconstruction from Multi-View Stereo.Tianqi Liu, Guangcong Wang, Shoukang Hu, Liao Shen, Xinyi Ye, Yuhang Zang, Zhiguo Cao, Wei Li, Ziwei Liu
2024ECCVLong-CLIP: Unlocking the Long-Text Capability of CLIP.Beichen Zhang, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Jiaqi Wang
2024ICLROvercoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization.Yuhang Zang, Hanlin Goh, Joshua M. Susskind, Chen Huang
2022ECCVOpen-Vocabulary DETR with Conditional Matching.Yuhang Zang, Wei Li, Kaiyang Zhou, Chen Huang, Chen Change Loy
2021CVPRSeesaw Loss for Long-Tailed Instance Segmentation.Jiaqi Wang, Wenwei Zhang, Yuhang Zang, Yuhang Cao, Jiangmiao Pang, Tao Gong, Kai Chen, Ziwei Liu, Chen Change Loy, Dahua Lin
2021ICCVFASA: Feature Augmentation and Sampling Adaptation for Long-Tailed Instance Segmentation.Yuhang Zang, Chen Huang, Chen Change Loy
2020AAAIKPNet: Towards Minimal Face Detector.Guanglu Song, Yu Liu, Yuhang Zang, Xiaogang Wang, Biao Leng, Qingsheng Yuan
2019AAAIScene Text Detection with Supervised Pyramid Context Network.Enze Xie, Yuhang Zang, Shuai Shao, Gang Yu, Cong Yao, Guangyao Li
2019ICCVEfficient and Accurate Arbitrary-Shaped Text Detection With Pixel Aggregation Network.Wenhai Wang, Enze Xie, Xiaoge Song, Yuhang Zang, Wenjia Wang, Tong Lu, Gang Yu, Chunhua Shen