| 2025 | To Ask or Not to Ask? Detecting Absence of Information in Vision and Language Navigation. | Savitha Sam Abraham, Sourav Garg, Feras Dayoub |
| 2025 | UAL-Bench: The First Comprehensive Unusual Activity Localization Benchmark. | Hasnat Md Abdullah, Tian Liu, Kangda Wei, Shu Kong, Ruihong Huang |
| 2025 | Video-to-Text Pedestrian Monitoring (VTPM): Leveraging Large Language Models for Privacy-Preserve Pedestrian Activity Monitoring at Intersections. | Ahmed S. Abdelrahman, Mohamed A. Abdel-Aty, Dongdong Wang |
| 2025 | Interpreting the Unexpected: A Multimodal Framework for Out-of-Label Hazard Detection and Explanation in Autonomous Driving. | Mahdi Abbariki, Maged Shoman |
| 2025 | ActionDiffusion: An Action-Aware Diffusion Model for Procedure Planning in Instructional Videos. | Lei Shi, Paul C. Brkner, Andreas Bulling |
| 2025 | DMRN: A Dynamical Multi-Order Response Network for the Robust Lung Airway Segmentation. | Sheng Zhang, Jinge Wu, Junzhi Ning, Guang Yang |
| 2025 | Automated Evaluation of Large Vision-Language Models on Self-Driving Corner Cases. | Kai Chen, Yanze Li, Wenhua Zhang, Yanxin Liu, Pengxiang Li, Ruiyuan Gao, Lanqing Hong, Meng Tian, Xinhai Zhao, Zhenguo Li, Dit-Yan Yeung, Huchuan Lu, Xu Jia |
| 2025 | Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning? | Shuo Chen, Zhen Han, Bailan He, Jianzhe Liu, Mark Buckley, Yao Qin, Philip Torr, Volker Tresp, Jindong Gu |
| 2025 | SEM-Net: Efficient Pixel Modelling for Image Inpainting with Spatially Enhanced SSM. | Shuang Chen, Haozheng Zhang, Amir Atapour-Abarghouei, Hubert P. H. Shum |
| 2025 | Enhancing Vision-Language Few-Shot Adaptation with Negative Learning. | Ce Zhang, Simon Stepputtis, Katia P. Sycara, Yaqi Xie |
| 2025 | MVAD: A Multiple Visual Artifact Detector for Video Streaming. | Chen Feng, Duolikun Danier, Fan Zhang, Alex Mackin, Andrew Collins, David Bull |
| 2025 | TreeFormer: Single-View Plant Skeleton Estimation via Tree-Constrained Graph Generation. | Xinpeng Liu, Hiroaki Santo, Yosuke Toda, Fumio Okura |
| 2025 | VLMine: Long-Tail Data Mining with Vision Language Models. | Mao Ye, Gregory P. Meyer, Zaiwei Zhang, Dennis Park, Siva Karthik Mustikovela, Yuning Chai, Eric M. Wolff |
| 2025 | ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion. | Ying Shen, Daniel Bis, Cynthia Lu, Ismini Lourentzou |
| 2025 | LIPIDS: Learning-based Illumination Planning In Discretized (Light) Space for Photometric Stereo. | Ashish Tiwari, Mihirkumar Sutariya, Shanmuganathan Raman |
| 2025 | HexaGen3D: StableDiffusion is One Step Away from Fast and Diverse Text-to-3D Generation. | Antoine Mercier, Ramin Nakhli, Mahesh Reddy, Rajeev Yasarla, Hong Cai, Fatih Porikli, Guillaume Berger |
| 2025 | High-Pass Kernel Prediction for Efficient Video Deblurring. | Bo Ji, Angela Yao |
| 2025 | Towards Real-Time Open-Vocabulary Video Instance Segmentation. | Bin Yan, Martin Sundermeyer, David Joseph Tan, Huchuan Lu, Federico Tombari |
| 2025 | SenCLIP: Enhancing Zero-Shot Land-Use Mapping for Sentinel-2 with Ground-Level Prompting. | Pallavi Jain, Dino Ienco, Roberto Interdonato, Tristan Berchoux, Diego Marcos |
| 2025 | DyRoNet: Dynamic Routing and Low-Rank Adapters for Autonomous Driving Streaming Perception. | Xiang Huang, Zhi-Qi Cheng, Jun-Yan He, Chenyang Li, Wangmeng Xiang, Baigui Sun |
| 2025 | SIGN-GAIL: Rewarding Online Signature Generation for Digital Imitation. | Anurag Pandey, Arnav Bhavsar, Aditya Nigam, Divya Acharya, Basu Verma, Balaji Rao K |
| 2025 | Continuous Spatio-Temporal Memory Networks for 4D Cardiac Cine MRI Segmentation. | Meng Ye, Bingyu Xin, Leon Axel, Dimitris N. Metaxas |
| 2025 | Ad | Lei Zhu, Yanyu Xu, Yong Liu, Rick Siow Mong Goh, Xinxing Xu |
| 2025 | Multimodal Interpretable Depression Analysis Using Visual, Physiological, Audio and Textual Data. | Puneet Kumar, Shreshtha Misra, Zhuhong Shao, Bin Zhu, Balasubramanian Raman, Xiaobai Li |
| 2025 | PK-YOLO: Pretrained Knowledge Guided YOLO for Brain Tumor Detection in Multiplanar MRI Slices. | Ming Kang, Fung Fung Ting, Raphal C.-W. Phan, Chee-Ming Ting |