| 2024 | Building Usage Classification in Indian Cities: Utilizing Street View Images and Object Detection Models. | Yamini Sahu, Vasu Dhull, Satyajeet Shashwat, Vaibhav Kumar |
| 2024 | Tails Tell Tales: Chapter-Wide Manga Transcriptions with Character Names. | Ragav Sachdeva, Gyungin Shin, Andrew Zisserman |
| 2024 | Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-supervised Learning. | Bin Ren, Guofeng Mei, Danda Pani Paudel, Weijie Wang, Yawei Li, Mengyuan Liu, Rita Cucchiara, Luc Van Gool, Nicu Sebe |
| 2024 | Vision Language Models are blind 🕶. | Pooyan Rahmanzadehgervi, Logan Bolton, Mohammad Reza Taesiri, Anh Totti Nguyen |
| 2024 | IsoTGAN: Spatial and Geometrical Constraints at GAN and Transformer for 3D Contour Generation. | Thao Nguyen Phuong, Vinh Nguyen Duy, Hidetomo Sakaino |
| 2024 | Revealing Hidden Context in Camouflage Instance Segmentation. | Thanh Hai Phung, Hong-Han Shuai |
| 2024 | FG-CXR: A Radiologist-Aligned Gaze Dataset for Enhancing Interpretability in Chest X-Ray Report Generation. | Trong-Thang Pham, Ngoc-Vuong Ho, Nhat-Tan Bui, Thinh Phan, Patel Brijesh Patel, Donald A. Adjeroh, Gianfranco Doretto, Anh Nguyen, Carol C. Wu, Hien Nguyen, Ngan Le |
| 2024 | It's Just Another Day: Unique Video Captioning by Discriminitive Prompting. | Toby Perrett, Tengda Han, Dima Damen, Andrew Zisserman |
| 2024 | GraVITON: Graph Based Garment Warping with Attention Guided Inversion for Virtual-Tryon. | Sanhita Pathak, Vinay Kaushik, Brejesh Lall |
| 2024 | Generative Self-supervised Learning for Medical Image Classification. | Inhyuk Park, Sungeun Kim, Jongbin Ryu |
| 2024 | 4DPV: 4D Pet from Videos by Coarse-to-Fine Non-rigid Radiance Fields. | Sergio Montoya de Paco, Antonio Agudo |
| 2024 | SeSame: Simple, Easy 3D Object Detection with Point-Wise Semantics. | Hayeon O, Chanuk Yang, Kunsoo Huh |
| 2024 | BgSub: A Background Subtraction Model for Effective Moving Object Detection. | Islam I. Osman, Mohamed S. Shehata |
| 2024 | Parameter-Efficient Instance-Adaptive Neural Video Compression. | Seungjun Oh, Hyunmo Yang, Eunbyung Park |
| 2024 | Semantic Visual-Inertial SLAM for Automated Valet Parking. | Seungwon Oh, Junghoon Seo, Jungho Park, Viswanath Veera, Jersha Felix, Midhun Menon, Chinmay Shinde |
| 2024 | Neural Substitution for Branch-Level Network Re-parameterization. | Seungmin Oh, Jongbin Ryu |
| 2024 | KhmerST: A Low-Resource Khmer Scene Text Detection and Recognition Benchmark. | Vannkinh Nom, Souhail Bakkali, Muhammad Muzzamil Luqman, Mickal Coustaty, Jean-Marc Ogier |
| 2024 | Multiple Active Stereo Systems Calibration Method Based on Neural SDF Using DSSS for Wide Area 3D Reconstruction. | Kota Nishihara, Ryo Furukawa, Ryusuke Sagawa, Hiroshi Kawasaki |
| 2024 | Hierarchical Prompting for Diffusion Classifiers. | Wenxin Ning, Dongliang Chang, Yujun Tong, Zhongjiang He, Kongming Liang, Zhanyu Ma |
| 2024 | Multi-path Segmentation Network Based on CNN and Transformer for Skin Lesion Image. | Tianyu Nie, Yishi Zhao, Shihong Yao |
| 2024 | Polyp-SES: Automatic Polyp Segmentation with Self-enriched Semantic Model. | Quang Vinh Nguyen, Thanh Hoang Son Vo, Sae-Ryung Kang, Soo-Hyung Kim |
| 2024 | Smart Camera Parking System with Auto Parking Spot Detection. | Tuan T. Nguyen, Mina Sartipi |
| 2024 | CrossViT-ReID: Cross-Attention Vision Transformer for Occluded Cloth-Changing Person Re-Identification. | Vuong D. Nguyen, Pranav Mantini, Shishir K. Shah |
| 2024 | Cross-Modality Complementary Learning for Video-Based Cloth-Changing Person Re-identification. | Vuong D. Nguyen, Pranav Mantini, Shishir K. Shah |
| 2024 | Text Query to Web Image to Video: A Comprehensive Ad-Hoc Video Search. | Nhat-Minh Nguyen, Tien-Dung Mai, Duy-Dinh Le |