Fengyun Rao
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
17
Venues
5
Active years
2022–2026
Best venue rank
A*
Where they publish
Papers
17 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | MMhops-R1: Multimodal Multi-hop Reasoning. | Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu |
| 2025 | CVPR | Number it: Temporal Grounding Videos like Flipping Manga. | Yongliang Wu, Xinting Hu, Yuyang Sun, Yizhou Zhou, Wenbo Zhu, Fengyun Rao, Bernt Schiele, Xu Yang |
| 2025 | CVPR | MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling. | Jian Yang, Dacheng Yin, Yizhou Zhou, Fengyun Rao, Wei Zhai, Yang Cao, Zheng-Jun Zha |
| 2025 | CVPR | Instruction-augmented Multimodal Alignment for Image-Text and Element Matching. | Xinli Yue, Jianhui Sun, Junda Lu, Liangchao Yao, Fan Xia, Tianyi Wang, Fengyun Rao, Jing Lyu, Yuetang Deng |
| 2025 | CVPR | HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal Synchronization. | Zitang Zhou, Ke Mei, Yu Lu, Tianyi Wang, Fengyun Rao |
| 2025 | ICCV | From Trial to Triumph: Advancing Long Video Understanding via Visual Context Sample Scaling and Self-Reward Alignment. | Yucheng Suo, Fan Ma, Linchao Zhu, Tianyi Wang, Fengyun Rao, Yi Yang |
| 2025 | ICCV | Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs. | Zitian Wang, Yue Liao, Kang Rong, Fengyun Rao, Yibo Yang, Si Liu |
| 2025 | ICCV | HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models. | Zhixiang Wei, Guangting Wang, Xiaoxiao Ma, Ke Mei, Huaian Chen, Yi Jin, Fengyun Rao |
| 2025 | ICCV | R1-Onevision: Advancing Generalized Multimodal Reasoning Through Cross-Modal Formalization. | Yi Yang, Xiaoxuan He, Hongkun Pan, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Dacheng Yin, Fengyun Rao, Minfeng Zhu, Bo Zhang, Wei Chen |
| 2025 | ICLR | PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training. | Cong Chen, Mingyu Liu, Chenchen Jing, Yizhou Zhou, Fengyun Rao, Hao Chen, Bo Zhang, Chunhua Shen |
| 2024 | AAAI | Image Captioning with Multi-Context Synthetic Data. | Feipeng Ma, Yizhou Zhou, Fengyun Rao, Yueyi Zhang, Xiaoyan Sun |
| 2024 | AAAI | Spatial-Semantic Collaborative Cropping for User Generated Content. | Yukun Su, Yiwen Cao, Jingliang Deng, Fengyun Rao, Qingyao Wu |
| 2024 | CVPR | Task Navigator: Decomposing Complex Tasks for Multimodal Large Language Models. | Feipeng Ma, Yizhou Zhou, Yueyi Zhang, Siying Wu, Zheyu Zhang, Zilong He, Fengyun Rao, Xiaoyan Sun |
| 2024 | CVPR | Inter-X: Towards Versatile Human-Human Interaction Analysis. | Liang Xu, Xintao Lv, Yichao Yan, Xin Jin, Shuwen Wu, Congsheng Xu, Yifan Liu, Yizhou Zhou, Fengyun Rao, Xingdong Sheng, Yunhui Liu, Wenjun Zeng, Xiaokang Yang |
| 2024 | CVPR | ReGenNet: Towards Human Action-Reaction Synthesis. | Liang Xu, Yizhou Zhou, Yichao Yan, Xin Jin, Wenhan Zhu, Fengyun Rao, Xiaokang Yang, Wenjun Zeng |
| 2022 | CVPR | Tencent-MVSE: A Large-Scale Benchmark Dataset for Multi-Modal Video Similarity Evaluation. | Zhaoyang Zeng, Yongsheng Luo, Zhenhua Liu, Fengyun Rao, Dian Li, Weidong Guo, Zhen Wen |
| 2022 | ECCV | CA-SSL: Class-Agnostic Semi-Supervised Learning for Detection and Segmentation. | Lu Qi, Jason Kuen, Zhe Lin, Jiuxiang Gu, Fengyun Rao, Dian Li, Weidong Guo, Zhen Wen, Ming-Hsuan Yang, Jiaya Jia |