| 2025 | GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks. | Haoqiang Kang, Enna Sachdeva, Piyush Gupta, Sangjae Bae, Kwonjoon Lee |
| 2025 | Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding. | Seil Kang, Jinyeong Kim, Junhyeok Kim, Seong Jae Hwang |
| 2025 | Zero-Shot Head Swapping in Real-World Scenarios. | Taewoong Kang, Sohyun Jeong, Hyojin Jang, Jaegul Choo |
| 2025 | Structure from Collision. | Takuhiro Kaneko |
| 2025 | ToF-360 - A Panoramic Time-of-flight RGB-D Dataset for Single Capture Indoor Semantic 3D Reconstruction. | Hideaki Kanayama, Mahdi Chamseddine, Suresh Guttikonda, So Okumura, Soichiro Yokota, Didier Stricker, Jason R. Rambach |
| 2025 | Doppelgangers and Adversarial Vulnerability. | George I. Kamberov |
| 2025 | California Crop Yield Benchmark: Combining Satellite Image, Climate, Evapotranspiration, and Soil Data Layers for County-Level Yield Forecasting of Over 70 Crops. | Hamid Kamangir, Mona Hajiesmaeeli, J. Mason Earles |
| 2025 | Understanding the Effect of using Semantically Meaningful Tokens for Visual Representation Learning. | Neha Mukund Kalibhat, Priyatham Kattakinda, Sumit Nawathe, Arman Zarei, Nikita Seleznev, Samuel Sharpe, Senthil Kumar, Soheil Feizi |
| 2025 | EvOcc: Accurate Semantic Occupancy for Automated Driving Using Evidence Theory. | Jonas Klble, Sascha Wirges, Maxim Tatarchenko, Eddy Ilg |
| 2025 | CTC: Contribution to Classification of Complex Features. | Sophia Kalanovska, Michael Luck, Christopher Hampson |
| 2025 | Thin-Shell-SfT: Fine-Grained Monocular Non-rigid 3D Surface Tracking with Neural Deformation Fields. | Navami Kairanda, Marc Habermann, Shanthika Naik, Christian Theobalt, Vladislav Golyanik |
| 2025 | Towards Optimizing Large-Scale Multi-Graph Matching in Bioimaging. | Max Kahl, Sebastian Stricker, Lisa Hutschenreiter, Florian Bernard, Carsten Rother, Bogdan Savchynskyy |
| 2025 | What's in the Image? A Deep-Dive into the Vision of Vision Language Models. | Omri Kaduri, Shai Bagon, Tali Dekel |
| 2025 | On the Consistency of Video Large Language Models in Temporal Comprehension. | Minjoon Jung, Junbin Xiao, Byoung-Tak Zhang, Angela Yao |
| 2025 | Two is Better than One: Efficient Ensemble Defense for Robust and Compact Models. | Yoojin Jung, Byung Cheol Song |
| 2025 | TailedCore: Few-Shot Sampling for Unsupervised Long-Tail Noisy Anomaly Detection. | Yoon Gyo Jung, Jaewoo Park, Jaeho Yoon, Kuan-Chuan Peng, Wonchul Kim, Andrew Beng Jin Teoh, Octavia I. Camps |
| 2025 | Multi-Group Proportional Representations for Text-to-Image Models. | Sangwon Jung, Alex Oesterling, Claudio Mayrink Verdun, Sajani Vithana, Taesup Moon, Flvio P. Calmon |
| 2025 | Exposure-slot: Exposure-centric Representations Learning with Slot-in-Slot Attention for Region-aware Exposure Correction. | Donggoo Jung, Daehyun Kim, Guanghui Wang, Tae Hyun Kim |
| 2025 | Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning. | Ji Hyeok Jung, Eun Tae Kim, Seo Yeon Kim, Joo Ho Lee, Bumsoo Kim, Buru Chang |
| 2025 | CaddieSet: A Golf Swing Dataset with Human Joint Features and Ball Information. | Seunghyeon Jung, Seoyoung Hong, Jiwoo Jeong, Seungwon Jeong, Jaerim Choi, Hoki Kim, Woojin Lee |
| 2025 | EDM: Equirectangular Projection-Oriented Dense Kernelized Feature Matching. | Dongki Jung, Jaehoon Choi, Yonghan Lee, Somi Jeong, Taejae Lee, Dinesh Manocha, Suyong Yeon |
| 2025 | Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding Registration. | Kim Jun-Seong, GeonU Kim, Kim Yu-Ji, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh |
| 2025 | DirectTriGS: Triplane-based Gaussian Splatting Field Representation for 3D Generation. | Xiaoliang Ju, Hongsheng Li |
| 2025 | Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention. | Kyungmin Jo, Jooyeol Yun, Jaegul Choo |
| 2025 | DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment. | Cijo Jose, Tho Moutakanni, Dahyun Kang, Federico Baldassarre, Timothe Darcet, Hu Xu, Daniel Li, Marc Szafraniec, Michal Ramamonjisoa, Maxime Oquab, Oriane Simoni, Huy V. Vo, Patrick Labatut, Piotr Bojanowski |