| 2023 | Learning Temporal Sentence Grounding From Narrated EgoVideos. | Kevin Flanagan, Dima Damen, Michael Wray |
| 2023 | SA2-Net: Scale-aware Attention Network for Microscopic Image Segmentation. | Mustansar Fiaz, Moein Heidari, Rao Muhammad Anwer, Hisham Cholakkal |
| 2023 | Lightweight Self-Supervised Depth Estimation with few-beams LiDAR Data. | Rizhao Fan, Fabio Tosi, Matteo Poggi, Stefano Mattoccia |
| 2023 | Open Set Synthetic Image Source Attribution. | Shengbang Fang, Tai D. Nguyen, Matthew C. Stamm |
| 2023 | VETIM: Expanding the Vocabulary of Text-to-Image Models only with Text. | Martin Nicolas Everaert, Marco Bocchio, Sami Arpa, Sabine Ssstrunk, Radhakrishna Achanta |
| 2023 | Generating Context-Aware Natural Answers for Questions in 3D Scenes. | Mohammed Munzer Dwedari, Matthias Niener, Dave Zhenyu Chen |
| 2023 | Learning Part Motion of Articulated Objects Using Spatially Continuous Neural Implicit Representations. | Yushi Du, Ruihai Wu, Yan Shen, Hao Dong |
| 2023 | X-PDNet: Accurate Joint Plane Instance Segmentation and Monocular Depth Estimation with Cross-Task Distillation and Boundary Correction. | Cao Dinh Duc, Jongwoo Lim |
| 2023 | 3D Structure-guided Network for Tooth Alignment in 2D Photograph. | Yulong Dou, Lanzhuju Mei, Dinggang Shen, Zhiming Cui |
| 2023 | BiUNet: Towards More Effective UNet with Bi-Level Routing Attention. | Kun Dong, Jian Xue, Xing Lan, Ke Lu |
| 2023 | Vision Transformers are Inherently Saliency Learners. | Yasser Abdelaziz Dahou Djilali, Kevin McGuinness, Noel E. O'Connor |
| 2023 | Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes. | Alexandros Delitzas, Maria Parelli, Nikolas Hars, Georgios Vlassis, Sotirios-Konstantinos Anagnostidis, Gregor Bachmann, Thomas Hofmann |
| 2023 | Optimal Camera Configuration for Large-Scale Motion Capture Systems. | Xiongming Dai, Gerald Baumgartner |
| 2023 | TD-GEM: Text-Driven Garment Editing Mapper. | Reza Dadfar, Sanaz Sabzevari, Mrten Bjrkman, Danica Kragic |
| 2023 | Teaching AI to Teach: Leveraging Limited Human Salience Data Into Unlimited Saliency-Based Training. | Colton R. Crum, Aidan Boyd, Kevin W. Bowyer, Adam Czajka |
| 2023 | Spherical Vision Transformer for 360° Video Saliency Prediction. | Mert Cokelek, Nevrez Imamoglu, Cagri Ozcinar, Erkut Erdem, Aykut Erdem |
| 2023 | PseudoCal: Towards Initialisation-Free Deep Learning-Based Camera-LiDAR Self-Calibration. | Mathieu Cocheteux, Julien Moreau, Franck Davoine |
| 2023 | Robust and Efficient Edge-guided Pose Estimation with Resolution-conditioned NeRF. | Liesbeth Claessens, Fabian Manhardt, Ricardo Martin-Brualla, Roland Siegwart, Cesar Dario Cadena Lerma, Federico Tombari |
| 2023 | Long Story Short: a Summarize-then-Search Method for Prompt-Based Long Video Question Answering. | Jiwan Chung, Youngjae Yu |
| 2023 | ADoPT: LiDAR Spoofing Attack Detection Based on Point-Level Temporal Consistency. | Minkyoung Cho, Yulong Cao, Zixiang Zhou, Zhuoqing Morley Mao |
| 2023 | EventFormer: AU Event Transformer for Facial Action Unit Event Detection. | Yingjie Chen, Jiarui Zhang, Tao Wang, Yun Liang |
| 2023 | Face Aging via Diffusion-based Editing. | Xiangyi Chen, Stphane Lathuilire |
| 2023 | Scale Adaptive Network for Partial Person Re-identification: Counteracting Scale Variance. | Hongyu Chen, Bingliang Jiao, Liying Gao, Peng Wang |
| 2023 | AMA: Adaptive Memory Augmentation for Enhancing Image Captioning. | Shuang Cheng, Jian Ye |
| 2023 | Score-PA: Score-based 3D Part Assembly. | Junfeng Cheng, Mingdong Wu, Ruiyuan Zhang, Guanqi Zhan, Chao Wu, Hao Dong |