| 2026 | Less is More: Agentic Prompt Design for Safe VLM Action Selection. | Elahe Yahyapour, Chengbo Ai |
| 2026 | Revisiting Vision-Language Foundations for No-Reference Image Quality Assessment. | Ankit Yadav, Ta Duc Huy, Lingqiao Liu |
| 2026 | QuadraNet V2: Efficient and Sustainable Training of High-Order Neural Networks with Quadratic Adaptation. | Chenhui Xu, Fuxun Yu, Jinjun Xiong, Xiang Chen |
| 2026 | Occlusion Boundary and Depth: Mutual Enhancement via Multi-Task Learning. | Lintao Xu, Yinghao Wang, Chaohui Wang |
| 2026 | Controllable Image Synthesis for Endoscopy: Leveraging Text and Spatial Guidance in Diffusion Models. | Lu Xu, Anuja Vats, Marius Pedersen, Kiran B. Raja |
| 2026 | Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions. | Jintang Xue, Ganning Zhao, Jie-En Yao, Hong-En Chen, Yue Hu, Meida Chen, Suya You, C.-C. Jay Kuo |
| 2026 | TalkingHeadBench: A Multi-Modal Benchmark & Analysis of Talking-Head DeepFake Detection. | Xinqi Xiong, Prakrut Patel, Qingyuan Fan, Amisha Wadhwa, Sarathy Selvam, Xiao Guo, Luchao Qi, Xiaoming Liu, Roni Sengupta |
| 2026 | SGW-GAN: Sliced Gromov-Wasserstein Guided GANs for Retinal Fundus Image Enhancement. | Yujian Xiong, Xuanzhao Dong, Wenhui Zhu, Xin Li, Oana M. Dumitrascu, Yalin Wang |
| 2026 | Zero-shot Hierarchical Plant Segmentation via Foundation Segmentation Models and Text-to-image Attention. | Junhao Xing, Ryohei Miyakawa, Yang Yang, Xinpeng Liu, Risa Shinoda, Hiroaki Santo, Yosuke Toda, Fumio Okura |
| 2026 | Sketch-guided Cage-based 3D Gaussian Splatting Deformation. | Tianhao Xie, Noam Aigerman, Eugene Belilovsky, Tiberiu Popa |
| 2026 | RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding. | Xi Xiao, Yunbei Zhang, Janet Wang, Lin Zhao, Yuxiang Wei, Hengjia Li, Yanshu Li, Xiao Wang, Swalpa Kumar Roy, Hao Xu, Tianyang Wang |
| 2026 | Self-Supervised Visual Prompting for Cross-Domain Road Damage Detection. | Xi Xiao, Zhuxuanzi Wang, Mingqiao Mo, Chen Liu, Chenrui Ma, Yanshu Li, Smita Krishnaswamy, Xiao Wang, Tianyang Wang |
| 2026 | DODA: Adapting Object Detectors to Dynamic Agricultural Environments in Real-Time with Diffusion. | Shuai Xiang, Pieter M. Blok, James Burridge, Haozhou Wang, Wei Guo |
| 2026 | Overcoming Fine-Grained Visual Challenges in Animal Re-Identification via Semantic Feature Alignment. | Yihao Wu, Di Zhao, Yuzhuo Li, Matthew Alajas, Alistair S. Glen, Jingfeng Zhang, Gillian Dobbie, Daniel Wilson, Yun Sing Koh |
| 2026 | RoLID-11K: A Dashcam Dataset for Small-Object Roadside Litter Detection. | Tao Wu, Qing Xu, Xiangjian He, Oakleigh Weekes, James Brown, Wenting Duan |
| 2026 | Exploiting Label-Independent Regularization from Spatial Patterns for Whole Slide Image Analysis. | Weiyi Wu, Xinwen Xu, Chongyang Gao, Xingjian Diao, Siting Li, Jiang Gui |
| 2026 | 2S-CEDiff: A Two-Stage Diffusion Framework for Generating High-Fidelity Contrast-Enhanced CT Images from Non-Contrast Scans. | Yibang Wu, Tzung-Dau Wang, Shang-Hong Lai |
| 2026 | Harnessing Object Grounding for Time-Sensitive Video Understanding. | Tz-Ying Wu, Sharath Nittur Sridhar, Subarna Tripathi |
| 2026 | KMOPS: Keypoint-Driven Method for Multi-Object Pose and Metric Size Estimation from Stereo Images. | Ying-Kun Wu, Yi Shen, Tzuhsuan Huang, I-Sheng Fang, Jun-Cheng Chen |
| 2026 | ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos. | Peiran Wu, Yunze Liu, Miao Liu, Junxiao Shen |
| 2026 | Equivariant Sampling for Improving Diffusion Model-based Image Restoration. | Chenxu Wu, Qingpeng Kong, Peiang Zhao, Wendi Yang, Wenxin Ma, Fenghe Tang, Zihang Jiang, S. Kevin Zhou |
| 2026 | MarineEval: Assessing the Marine Intelligence of Vision-Language Models. | Yuk-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai-Kit Yeung |
| 2026 | ORCA: Object Recognition and Comprehension for Archiving Marine Species. | Yuk-Kwan Wong, Haixin Liang, Zeyu Ma, Yiwei Chen, Ziqiang Zheng, Rinaldi Gotama, Pascal Sebastian, Lauren D. Sparks, Sai-Kit Yeung |
| 2026 | Towards Unconstrained Cross-View Pose Estimation. | Alexander Wollam, Kyle Ashley, Maxim Shugaev, Oliver Arend, Ilya Semenov, Hadis Dashtestani, Sumved Ravi, Nathan Jacobs |
| 2026 | Advancing Player Identification and Tracking with Global ID Fusion (GIF). | Karol Wojtulewicz, Minxing Liu, Niklas Carlsson |