| 2025 | Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations. | Jeong Hun Yeo, Minsu Kim, Chae Won Kim, Stavros Petridis, Yong Man Ro |
| 2025 | ATAS: Any-to-Any Self-Distillation for Enhanced Open-Vocabulary Dense Prediction. | Juan Yeo, Soonwoo Cha, Jiwoo Song, Hyunbin Jin, Taesup Kim |
| 2025 | Alleviating Textual Reliance in Medical Language-Guided Segmentation via Prototype-Driven Semantic Approximation. | Shuchang Ye, Usman Naseem, Mingyuan Meng, Jinman Kim |
| 2025 | Where am I? Cross-View Geo-localization with Natural Language Descriptions. | Junyan Ye, Honglin Lin, Leyan Ou, Dairong Chen, Zihao Wang, Qi Zhu, Conghui He, Weijia Li |
| 2025 | Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis. | Junyan Ye, Jun He, Weijia Li, Zhutao Lv, Yi Lin, Jinhua Yu, Haote Yang, Conghui He |
| 2025 | GeoSplatting: Towards Geometry Guided Gaussian Splatting for Physically-Based Inverse Rendering. | Kai Ye, Chong Gao, Guanbin Li, Wenzheng Chen, Baoquan Chen |
| 2025 | TextSSR: Diffusion-Based Data Synthesis for Scene Text Recognition. | Xingsong Ye, Yongkun Du, Yunbo Tao, Zhineng Chen |
| 2025 | ESCNet: Edge-Semantic Collaborative Network for Camouflaged Object Detection. | Sheng Ye, Xin Chen, Yan Zhang, Xianming Lin, Liujuan Cao |
| 2025 | SlimComm: Doppler-Guided Sparse Queries for Bandwidth-Efficient Cooperative 3-D Perception. | Melih Yazgan, Qiyuan Wu, Iramm Hamdard, Shiqi Li, J. Marius Zoellner |
| 2025 | Purge-Gate: Backpropagation-Free Test-Time Adaptation for Point Clouds Classification via Token Purging. | Moslem Yazdanpanah, Ali Bahri, Mehrdad Noori, Sahar Dastani, Gustavo Adolfo Vargas Hakim, David Osowiechi, Ismail Ben Ayed, Christian Desrosiers |
| 2025 | GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields. | Shunsuke Yasuki, Taiki Miyanishi, Nakamasa Inoue, Shuhei Kurita, Koya Sakamoto, Daichi Azuma, Masato Taki, Yutaka Matsuo |
| 2025 | UMDATrack: Unified Multi-Domain Adaptive Tracking under Adverse Weather Conditions. | Siyuan Yao, Rui Zhu, Ziqi Wang, Wenqi Ren, Yanyang Yan, Xiaochun Cao |
| 2025 | Diving into the Fusion of Monocular Priors for Generalized Stereo Matching. | Chengtang Yao, Lidong Yu, Zhidan Liu, Jiaxi Zeng, Yuwei Wu, Yunde Jia |
| 2025 | Unsupervised Visible-Infrared Person Re-Identification Under Unpaired Settings. | Haoyu Yao, Bin Yang, Wenke Huang, Bo Du, Mang Ye |
| 2025 | Towards Fine-Grained Interactive Segmentation in Images and Videos. | Yuan Yao, Qiushi Yang, Miaomiao Cui, Liefeng Bo |
| 2025 | SV4D 2.0: Enhancing Spatio-Temporal Consistency in Multi-View Video Diffusion for High-Quality 4D Generation. | Chun-Han Yao, Yiming Xie, Vikram Voleti, Huaizu Jiang, Varun Jampani |
| 2025 | MagicCity: Geometry-Aware 3D City Generation from Satellite Imagery with Multi-View Consistency. | Xingbo Yao, Xuanmin Wang, Hao Wu, Chengliang Ping, Doudou Zhang, Hui Xiong |
| 2025 | Denoising Token Prediction in Masked Autoregressive Models. | Ting Yao, Yehao Li, Yingwei Pan, Zhaofan Qiu, Tao Mei |
| 2025 | MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI. | Huanjin Yao, Jiaxing Huang, Yawen Qiu, Michael K. Chen, Wenzheng Liu, Wei Zhang, Wenjie Zeng, Xikun Zhang, Jingyi Zhang, YuXin Song, Wenhao Wu, Dacheng Tao |
| 2025 | NavMorph: A Self-Evolving World Model for Vision-and-Language Navigation in Continuous Environments. | Xuan Yao, Junyu Gao, Changsheng Xu |
| 2025 | Learning Streaming Video Representation via Multitask Training. | Yibin Yan, Jilan Xu, Shangzhe Di, Yikun Liu, Yudi Shi, Qirui Chen, Zeqian Li, Yifei Huang, Weidi Xie |
| 2025 | TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control. | Zhenyu Yan, Jian Wang, Aoqiang Wang, Yuhan Li, Wenxiang Shang, Zhu Hangcheng |
| 2025 | LazyMAR: Accelerating Masked Autoregressive Models Via Feature Caching. | Feihong Yan, Qingyan Wei, Jiayi Tang, Jiajun Li, Yulin Wang, Xuming Hu, Huiqi Li, Linfeng Zhang |
| 2025 | DuCos: Duality Constrained Depth Super-Resolution via Foundation Model. | Zhiqiang Yan, Zhengxue Wang, Haoye Dong, Jun Li, Jian Yang, Gim Hee Lee |
| 2025 | Turboreg: Turboclique for Robust and Efficient Point Cloud Registration. | Shaocheng Yan, Pengcheng Shi, Zhenjun Zhao, Kaixin Wang, Kuang Cao, Ji Wu, Jiayuan Li |