Skip to content

Fengyun Rao

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

17

Venues

5

Active years

2022–2026

Best venue rank

A*

Where they publish

Papers

17 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIMMhops-R1: Multimodal Multi-hop Reasoning.Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu
2025CVPRNumber it: Temporal Grounding Videos like Flipping Manga.Yongliang Wu, Xinting Hu, Yuyang Sun, Yizhou Zhou, Wenbo Zhu, Fengyun Rao, Bernt Schiele, Xu Yang
2025CVPRMMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling.Jian Yang, Dacheng Yin, Yizhou Zhou, Fengyun Rao, Wei Zhai, Yang Cao, Zheng-Jun Zha
2025CVPRInstruction-augmented Multimodal Alignment for Image-Text and Element Matching.Xinli Yue, Jianhui Sun, Junda Lu, Liangchao Yao, Fan Xia, Tianyi Wang, Fengyun Rao, Jing Lyu, Yuetang Deng
2025CVPRHarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal Synchronization.Zitang Zhou, Ke Mei, Yu Lu, Tianyi Wang, Fengyun Rao
2025ICCVFrom Trial to Triumph: Advancing Long Video Understanding via Visual Context Sample Scaling and Self-Reward Alignment.Yucheng Suo, Fan Ma, Linchao Zhu, Tianyi Wang, Fengyun Rao, Yi Yang
2025ICCVInstruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs.Zitian Wang, Yue Liao, Kang Rong, Fengyun Rao, Yibo Yang, Si Liu
2025ICCVHQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models.Zhixiang Wei, Guangting Wang, Xiaoxiao Ma, Ke Mei, Huaian Chen, Yi Jin, Fengyun Rao
2025ICCVR1-Onevision: Advancing Generalized Multimodal Reasoning Through Cross-Modal Formalization.Yi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, Bo Zhang, Wei Chen
2025ICLRPerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training.Cong Chen, Mingyu Liu, Chenchen Jing, Yizhou Zhou, Fengyun Rao, Hao Chen, Bo Zhang, Chunhua Shen
2024AAAIImage Captioning with Multi-Context Synthetic Data.Feipeng Ma, Yizhou Zhou, Fengyun Rao, Yueyi Zhang, Xiaoyan Sun
2024AAAISpatial-Semantic Collaborative Cropping for User Generated Content.Yukun Su, Yiwen Cao, Jingliang Deng, Fengyun Rao, Qingyao Wu
2024CVPRTask Navigator: Decomposing Complex Tasks for Multimodal Large Language Models.Feipeng Ma, Yizhou Zhou, Yueyi Zhang, Siying Wu, Zheyu Zhang, Zilong He, Fengyun Rao, Xiaoyan Sun
2024CVPRInter-X: Towards Versatile Human-Human Interaction Analysis.Liang Xu, Xintao Lv, Yichao Yan, Xin Jin, Shuwen Wu, Congsheng Xu, Yifan Liu, Yizhou Zhou, Fengyun Rao, Xingdong Sheng, Yunhui Liu, Wenjun Zeng, Xiaokang Yang
2024CVPRReGenNet: Towards Human Action-Reaction Synthesis.Liang Xu, Yizhou Zhou, Yichao Yan, Xin Jin, Wenhan Zhu, Fengyun Rao, Xiaokang Yang, Wenjun Zeng
2022CVPRTencent-MVSE: A Large-Scale Benchmark Dataset for Multi-Modal Video Similarity Evaluation.Zhaoyang Zeng, Yongsheng Luo, Zhenhua Liu, Fengyun Rao, Dian Li, Weidong Guo, Zhen Wen
2022ECCVCA-SSL: Class-Agnostic Semi-Supervised Learning for Detection and Segmentation.Lu Qi, Jason Kuen, Zhe Lin, Jiuxiang Gu, Fengyun Rao, Dian Li, Weidong Guo, Zhen Wen, Ming-Hsuan Yang, Jiaya Jia