Yuhang Cao
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
26
Venues
11
Active years
2017–2026
Best venue rank
A*
Where they publish
Papers
26 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | WACV | OMeGa: Joint Optimization of Explicit Meshes and Gaussian Splats for Robust Scene-Level Surface Reconstruction. | Yuhang Cao, Haojun Yan, Danya Yao |
| 2025 | ACL | Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings. | Yubo Ma, Jinsong Li, Yuhang Zang, Xiaobao Wu, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Jiaqi Wang, Yixin Cao, Aixin Sun |
| 2025 | ACL | InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model. | Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Ziyu Liu, Shengyuan Ding, Shenxi Wu, Yubo Ma, Haodong Duan, Wenwei Zhang, Kai Chen, Dahua Lin, Jiaqi Wang |
| 2025 | CVPR | Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction. | Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang |
| 2025 | CVPR | ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way. | Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang |
| 2025 | CVPR | OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding? | Junbo Niu, Yifei Li, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang |
| 2025 | CVPR | Conical Visual Concentration for Efficient Large Vision-Language Models. | Long Xing, Qidong Huang, Xiaoyi Dong, Jiajie Lu, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang, Feng Wu, Dahua Lin |
| 2025 | ICCV | SAM2LONG: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree. | Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang |
| 2025 | ICCV | MM-IFEngine: Towards Multimodal Instruction Following. | Shengyuan Ding, Shenxi Wu, Xiangyu Zhao, Yuhang Zang, Haodong Duan, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Dahua Lin, Jiaqi Wang |
| 2025 | ICCV | Deciphering Cross-Modal Alignment in Large Vision-Language Models Via Modality Integration Rate. | Qidong Huang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Weiming Zhang, Nenghai Yu |
| 2025 | ICCV | Visual-RFT: Visual Reinforcement Fine-Tuning. | Ziyu Liu, Zeyi Sun, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang |
| 2025 | ICCV | Light-a-Video: Training-Free Video Relighting via Progressive Light Fusion. | Yujie Zhou, Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Qidong Huang, Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Anyi Rao, Jiaqi Wang, Li Niu |
| 2025 | ICLR | MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models. | Ziyu Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Haodong Duan, Conghui He, Yuanjun Xiong, Dahua Lin, Jiaqi Wang |
| 2025 | ICML | SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation. | Zihan Liu, Shuangrui Ding, Zhixiong Zhang, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang |
| 2025 | ICML | VideoRoPE: What Makes for Good Video Rotary Position Embedding? | Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang, Xipeng Qiu, Dahua Lin |
| 2024 | ICASSP | Diacorrect: Error Correction Back-End for Speaker Diarization. | Jiangyu Han, Federico Landini, Johan Rohdin, Mireia Dez, Luks Burget, Yuhang Cao, Heng Lu, Jan Cernock |
| 2024 | ICASSP | Ximalaya ASDR System for ICASSP 2024 in-Car Multi-Channel (ICMC) ASR Challenge. | Xiang Lyu, Yuhang Cao, Pengpeng Zou, Weilin Zhou |
| 2023 | ASRU | PP-MET: A Real-World Personalized Prompt Based Meeting Transcription System. | Xiang Lyu, Yuhang Cao, Qing Wang, Jingjing Yin, Yuguang Yang, Pengpeng Zou, Yanni Hu, Heng Lu |
| 2023 | ICCV | V3Det: Vast Vocabulary Visual Detection Dataset. | Jiaqi Wang, Pan Zhang, Tao Chu, Yuhang Cao, Yujie Zhou, Tong Wu, Bin Wang, Conghui He, Dahua Lin |
| 2022 | FPL | TRAM: An Open-Source Template-based Reconfigurable Architecture Modeling Framework. | Yunhui Qiu, Yuhang Cao, Yuan Dai, Wenbo Yin, Lingli Wang |
| 2022 | ICASSP | The USTC-Ximalaya System for the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription (M2met) Challenge. | Maokui He, Xiang Lv, Weilin Zhou, Jingjing Yin, Xiaoqi Zhang, Yuxuan Wang, Shutong Niu, Yuhang Cao, Heng Lu, Jun Du, Chin-Hui Lee |
| 2021 | CVPR | Seesaw Loss for Long-Tailed Instance Segmentation. | Jiaqi Wang, Wenwei Zhang, Yuhang Zang, Yuhang Cao, Jiangmiao Pang, Tao Gong, Kai Chen, Ziwei Liu, Chen Change Loy, Dahua Lin |
| 2020 | CVPR | Prime Sample Attention in Object Detection. | Yuhang Cao, Kai Chen, Chen Change Loy, Dahua Lin |
| 2020 | ECCV | Side-Aware Boundary Localization for More Precise Object Detection. | Jiaqi Wang, Wenwei Zhang, Yuhang Cao, Kai Chen, Jiangmiao Pang, Tao Gong, Jianping Shi, Chen Change Loy, Dahua Lin |
| 2019 | Interspeech | Investigation of Cost Function for Supervised Monaural Speech Separation. | Yun Liu, Hui Zhang, Xueliang Zhang, Yuhang Cao |
| 2017 | Interspeech | Speaker Direction-of-Arrival Estimation Based on Frequency-Independent Beampattern. | Feng Guo, Yuhang Cao, Zheng Liu, Jiaen Liang, Baoqing Li, Xiaobing Yuan |