| 2025 | Dynamic Group Normalization: Spatio-Temporal Adaptation to Evolving Data Statistics. | Yair Smadar, Assaf Hoogi |
| 2025 | Transformer-Based Lung Infection Severity Prediction with Cross Attention and Conditional TransMix Augmentation. | Bouthaina Slika, Fadi Dornaika, Fares Bougourzi, Karim Hammoudi |
| 2025 | PRaDA: Projective Radial Distortion Averaging. | Daniil Sinitsyn, Linus Hrenstam-Nielsen, Daniel Cremers |
| 2025 | MARVEL-40M+: Multi-Level Visual Elaboration for High-Fidelity Text-to-3D Content Creation. | Sankalp Sinha, Mohammad Sadil Khan, Muhammad Usama, Shino Sam, Didier Stricker, Sk Aziz Ali, Muhammad Zeshan Afzal |
| 2025 | TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents. | Kunal Singh, Shreyas Singh, Mukund Khanna |
| 2025 | ProtoPatchNet: An Interpretable Patch-Based Prototypical Network. | Mohana Singh, Vivek B. S., Jayavardhana Gubbi, R. Venkatesh Babu |
| 2025 | GLASS: Guided Latent Slot Diffusion for Object-Centric Learning. | Krishnakant Singh, Simone Schaub-Meyer, Stefan Roth |
| 2025 | Few-Shot Adaptation of Grounding DINO for Agricultural Domain. | Rajhans Singh, Rafael Bidese-Puhl, Kshitiz Dhakal, Sudhir Sornapudi |
| 2025 | Improving Open-World Object Localization by Discovering Background. | Ashish Singh, Michael Jones, Kuan-Chuan Peng, Anoop Cherian, Moitreya Chatterjee, Erik G. Learned-Miller |
| 2025 | LoRACLR: Contrastive Adaptation for Customization of Diffusion Models. | Enis Simsar, Thomas Hofmann, Federico Tombari, Pinar Yanardag |
| 2025 | Attacking Attention of Foundation Models Disrupts Downstream Tasks. | Hondamunige Prasanna Silva, Federico Becattini, Lorenzo Seidenari |
| 2025 | Conformal Prediction for Zero-Shot Models. | Julio Silva-Rodrguez, Ismail Ben Ayed, Jose Dolz |
| 2025 | PiCaZo: Pixel-Aligned Contrastive Learning for Zero-Shot Domain Adaptation. | Aniruddh Sikdar, Arya Kishor, Ishika Kadam, Suresh Sundaram |
| 2025 | Search and Detect: Training-Free Long Tail Object Detection via Web-Image Retrieval. | Mankeerat Sidhu, Hetarth Chopra, Ansel Blume, Jeonghwan Kim, Revanth Gangi Reddy, Heng Ji |
| 2025 | Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks. | Nina Shvetsova, Arsha Nagrani, Bernt Schiele, Hilde Kuehne, Christian Rupprecht |
| 2025 | Color Alignment in Diffusion. | Ka-Chun Shum, Binh-Son Hua, Duc Thanh Nguyen, Sai-Kit Yeung |
| 2025 | Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding. | Yan Shu, Zheng Liu, Peitian Zhang, Minghao Qin, Junjie Zhou, Zhengyang Liang, Tiejun Huang, Bo Zhao |
| 2025 | ERUPT: Efficient Rendering with Unposed Patch Transformer. | Maxim V. Shugaev, Vincent Chen, Maxim Karrenbach, Kyle Ashley, Bridget Kennedy, Naresh P. Cuntoor |
| 2025 | PatchContrast: Self-Supervised Pre-Training for 3D Object Detection. | Oren Shrout, Ori Nizan, Yizhak Ben-Shabat, Ayellet Tal |
| 2025 | Self-Supervised Spatial Correspondence Across Modalities. | Ayush Shrivastava, Andrew Owens |
| 2025 | Out-of-Distribution Segmentation in Autonomous Driving: Problems and State of the Art. | Youssef Shoeb, Azarm Nowzad, Hanno Gottschalk |
| 2025 | FedAWA: Adaptive Optimization of Aggregation Weights in Federated Learning Using Client Vectors. | Changlong Shi, He Zhao, Bingjie Zhang, Mingyuan Zhou, Dandan Guo, Yi Chang |
| 2025 | Chain of Semantics Programming in 3D Gaussian Splatting Representation for 3D Vision Grounding. | Jiaxin Shi, Mingyue Xiang, Hao Sun, Yixuan Huang, Zhi Weng |
| 2025 | Self-supervised ControlNet with Spatio-Temporal Mamba for Real-world Video Super-resolution. | Shijun Shi, Jing Xu, Lijing Lu, Zhihang Li, Kai Hu |
| 2025 | CRISP: Object Pose and Shape Estimation with Test-Time Adaptation. | Jingnan Shi, Rajat Talak, Harry Zhang, David Jin, Luca Carlone |