| 2025 | 3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding. | Tatiana Zemskova, Dmitry A. Yudin |
| 2025 | MOSCATO: Predicting Multiple Object State Change through Actions. | Parnian Zameni, Yuhan Shen, Ehsan Elhamifar |
| 2025 | The Overlooked Value of Test-Time Reference Sets in Visual Place Recognition. | Mubariz Zaffar, Liangliang Nan, Sebastian Scherer, Julian F. P. Kooij |
| 2025 | Structure-Guided Diffusion Models for High-Fidelity Portrait Shadow Removal. | Wanchang Yu, Qing Zhang, Rongjia Zheng, Wei-Shi Zheng |
| 2025 | DistillDrive: End-to-End Multi-Mode Autonomous Driving Distillation by Isomorphic Hetero-Source Planning Model. | Rui Yu, Xianghang Zhang, Runkai Zhao, Huaicheng Yan, Meng Wang |
| 2025 | Omnipaint: Mastering Object-Oriented Editing Via Disentangled Insertion-Removal Inpainting. | Yongsheng Yu, Ziyun Zeng, Haitian Zheng, Jiebo Luo |
| 2025 | CAFE: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning. | Hao Yu, Zhuokai Zhao, Shen Yan, Lukasz Korycki, Jianyu Wang, Baosheng He, Jiayi Liu, Lizhu Zhang, Xiangjun Fan, Hanchao Yu |
| 2025 | HERO: Human Reaction Generation from Videos. | Chengjun Yu, Wei Zhai, Yuhang Yang, Yang Cao, Zheng-Jun Zha |
| 2025 | Zeroth-Order Fine-Tuning of LLMs in Random Subspaces. | Ziming Yu, Pan Zhou, Sike Wang, Jia Li, Mi Tian, Hua Huang |
| 2025 | GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning. | Kelin Yu, Sheng Zhang, Harshit Soora, Furong Huang, Heng Huang, Pratap Tokekar, Ruohan Gao |
| 2025 | From Easy to Hard: Progressive Active Learning Framework for Infrared Small Target Detection with Single Point Supervision. | Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Sicheng Zhao, Yimian Dai, Xiangyu Yue |
| 2025 | NaVIP: A Low-Cost, Infrastructure-Free Indoor Navigation Solution for Visually Impaired Persons. | Jun Yu, Yitian Yang, Vinod Namboodiri |
| 2025 | DocThinker: Explainable Multimodal Large Language Models with Rule-Based Reinforcement Learning for Document Understanding. | Wenwen Yu, Zhibo Yang, Yuliang Liu, Xiang Bai |
| 2025 | MIND-RAG: Multimodal Context-Aware and Intent-Aware Retrieval-Augmented Generation for Educational Publications. | Jiayang Yu, Yuxi Xie, Guixuan Zhang, Jie Liu, Zhi Zeng, Ying Huang, Shuwu Zhang |
| 2025 | Dynamic Reconstruction of Hand-Object Interaction with Distributed Force-Aware Contact Representation. | Zhenjun Yu, Wenqiang Xu, Pengfei Xie, Yutong Li, Brian W. Anthony, Zhuorui Zhang, Cewu Lu |
| 2025 | VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos. | Jiashuo Yu, Yue Wu, Meng Chu, Zhifei Ren, Zizheng Huang, Pei Chu, Ruijie Zhang, Yinan He, Qirui Li, Songze Li, Zhenxiang Li, Zhongying Tu, Conghui He, Yu Qiao, Yali Wang, Yi Wang, Limin Wang |
| 2025 | Mastering Collaborative Multi-Modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness. | Qifan Yu, Zhebei Shen, Zhongqi Yue, Yang Wu, Bosheng Qin, Wenqiao Zhang, Yunfei Li, Juncheng Li, Siliang Tang, Yueting Zhuang |
| 2025 | Axis-Level Symmetry Detection with Group-Equivariant Representation. | Wongyun Yu, Ahyun Seo, Minsu Cho |
| 2025 | Foundation Models for Multimodal MRI Synthesis with Language Guidance. | Mahmut Yurt, Xiaozhi Cao, Zihan Zhou, Kawin Setsompop, Shreyas Vasanawala, John M. Pauly |
| 2025 | GameFactorly: Creating New Games with Generative Interactive Videos. | Jiwen Yu, Yiran Qin, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu |
| 2025 | Backdoor Defense via Enhanced Splitting and Trap Isolation. | Hongrui Yu, Lu Qi, Wanyu Lin, Jian Chen, Hailong Sun, Chengbin Sun |
| 2025 | Language Driven Occupancy Prediction. | Zhu Yu, Bowen Pang, Lizhe Liu, Runmin Zhang, Qiang Li, Si-Yuan Cao, Maochun Luo, Mingxia Chen, Sheng Yang, Hui-Liang Shen |
| 2025 | WarpHE4D: Dense 4D Head Map Toward Full Head Reconstruction. | Jongseob Yun, Yong-Hoon Kwon, Min-Gyu Park, Ju-Mi Kang, Min-Ho Lee, Inho Chang, Ju Hong Yoon, Kuk-Jin Yoon |
| 2025 | FedMeNF: Privacy-Preserving Federated Meta-Learning for Neural Fields. | Junhyeog Yun, Minui Hong, Gunhee Kim |
| 2025 | Auto-Controlled Image Perception in MLLMs via Visual Perception Tokens. | Runpeng Yu, Xinyin Ma, Xinchao Wang |