Skip to content

Yuhang Cao

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

26

Venues

11

Active years

2017–2026

Best venue rank

A*

Where they publish

Papers

26 indexed papers, newest first.

YearVenueTitleAuthors
2026WACVOMeGa: Joint Optimization of Explicit Meshes and Gaussian Splats for Robust Scene-Level Surface Reconstruction.Yuhang Cao, Haojun Yan, Danya Yao
2025ACLTowards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings.Yubo Ma, Jinsong Li, Yuhang Zang, Xiaobao Wu, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Jiaqi Wang, Yixin Cao, Aixin Sun
2025ACLInternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model.Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Ziyu Liu, Shengyuan Ding, Shenxi Wu, Yubo Ma, Haodong Duan, Wenwei Zhang, Kai Chen, Dahua Lin, Jiaqi Wang
2025CVPRDispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction.Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025CVPRByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way.Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025CVPROVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?Junbo Niu, Yifei Li, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang
2025CVPRConical Visual Concentration for Efficient Large Vision-Language Models.Long Xing, Qidong Huang, Xiaoyi Dong, Jiajie Lu, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang, Feng Wu, Dahua Lin
2025ICCVSAM2LONG: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree.Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang
2025ICCVMM-IFEngine: Towards Multimodal Instruction Following.Shengyuan Ding, Shenxi Wu, Xiangyu Zhao, Yuhang Zang, Haodong Duan, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025ICCVDeciphering Cross-Modal Alignment in Large Vision-Language Models Via Modality Integration Rate.Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Weiming Zhang, Nenghai Yu
2025ICCVVisual-RFT: Visual Reinforcement Fine-Tuning.Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang
2025ICCVLight-a-Video: Training-Free Video Relighting via Progressive Light Fusion.Yujie Zhou, Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Qidong Huang, Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Anyi Rao, Jiaqi Wang, Li Niu
2025ICLRMIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models.Ziyu Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Conghui He, Yuanjun Xiong, Dahua Lin, Jiaqi Wang
2025ICMLSongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation.Zihan Liu, Shuangrui Ding, Zhixiong Zhang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang
2025ICMLVideoRoPE: What Makes for Good Video Rotary Position Embedding?Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang, Xipeng Qiu, Dahua Lin
2024ICASSPDiacorrect: Error Correction Back-End for Speaker Diarization.Jiangyu Han, Federico Landini, Johan Rohdin, Mireia Dez, Luks Burget, Yuhang Cao, Heng Lu, Jan Cernock
2024ICASSPXimalaya ASDR System for ICASSP 2024 in-Car Multi-Channel (ICMC) ASR Challenge.Xiang Lyu, Yuhang Cao, Pengpeng Zou, Weilin Zhou
2023ASRUPP-MET: A Real-World Personalized Prompt Based Meeting Transcription System.Xiang Lyu, Yuhang Cao, Qing Wang, Jingjing Yin, Yuguang Yang, Pengpeng Zou, Yanni Hu, Heng Lu
2023ICCVV3Det: Vast Vocabulary Visual Detection Dataset.Jiaqi Wang, Pan Zhang, Tao Chu, Yuhang Cao, Yujie Zhou, Tong Wu, Bin Wang, Conghui He, Dahua Lin
2022FPLTRAM: An Open-Source Template-based Reconfigurable Architecture Modeling Framework.Yunhui Qiu, Yuhang Cao, Yuan Dai, Wenbo Yin, Lingli Wang
2022ICASSPThe USTC-Ximalaya System for the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription (M2met) Challenge.Maokui He, Xiang Lv, Weilin Zhou, Jingjing Yin, Xiaoqi Zhang, Yuxuan Wang, Shutong Niu, Yuhang Cao, Heng Lu, Jun Du, Chin-Hui Lee
2021CVPRSeesaw Loss for Long-Tailed Instance Segmentation.Jiaqi Wang, Wenwei Zhang, Yuhang Zang, Yuhang Cao, Jiangmiao Pang, Tao Gong, Kai Chen, Ziwei Liu, Chen Change Loy, Dahua Lin
2020CVPRPrime Sample Attention in Object Detection.Yuhang Cao, Kai Chen, Chen Change Loy, Dahua Lin
2020ECCVSide-Aware Boundary Localization for More Precise Object Detection.Jiaqi Wang, Wenwei Zhang, Yuhang Cao, Kai Chen, Jiangmiao Pang, Tao Gong, Jianping Shi, Chen Change Loy, Dahua Lin
2019InterspeechInvestigation of Cost Function for Supervised Monaural Speech Separation.Yun Liu, Hui Zhang, Xueliang Zhang, Yuhang Cao
2017InterspeechSpeaker Direction-of-Arrival Estimation Based on Frequency-Independent Beampattern.Feng Guo, Yuhang Cao, Zheng Liu, Jiaen Liang, Baoqing Li, Xiaobing Yuan