| 2024 | DFGait: Decomposition Fusion Representation Learning for Multimodal Gait Recognition. | Jianbo Xiong, Shinan Zou, Jin Tang |
| 2024 | Multi-modal Video Topic Segmentation with Dual-Contrastive Domain Adaptation. | Linzi Xing, Quan Hung Tran, Fabian Caba, Franck Dernoncourt, Seunghyun Yoon, Zhaowen Wang, Trung Bui, Giuseppe Carenini |
| 2024 | MSMV-UNet: A 2.5D Stroke Lesion Segmentation Method Based on Multi-slice Feature Fusion. | Jingjing Xie, Jixuan Hong, Manjin Sheng, Chenhui Yang |
| 2024 | Removing Stray-Light for Wild-Field Fundus Image Fusion Based on Large Generative Models. | Jun Wu, Mingxin He, Yang Liu, Jingjie Lin, Zeyu Huang, Dayong Ding |
| 2024 | WikiMuTe: A Web-Sourced Dataset of Semantic Descriptions for Music Audio. | Benno Weck, Holger Kirchhoff, Peter Grosche, Xavier Serra |
| 2024 | A New Benchmark and OCR-Free Method for Document Image Topic Classification. | Zhen Wang, Peide Zhu, Fuyang Yu, Manabu Okumura |
| 2024 | Prototype-Enhanced Hypergraph Learning for Heterogeneous Information Networks. | Shuai Wang, Jiayi Shen, Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring |
| 2024 | Adapting Pretrained Large-Scale Vision Models for Face Forgery Detection. | Lantao Wang, Chao Ma |
| 2024 | Dynamic-Static Graph Convolutional Network for Video-Based Facial Expression Recognition. | Fahong Wang, Zhao Liu, Jie Lei, Zeyu Zou, Wentao Han, Juan Xu, Xuan Li, Zunlei Feng, Ronghua Liang |
| 2024 | Contextual Augmentation with Bias Adaptive for Few-Shot Video Object Segmentation. | Shuaiwei Wang, Zhao Liu, Jie Lei, Zunlei Feng, Juan Xu, Xuan Li, Ronghua Liang |
| 2024 | Adversarially Regularized Low-Light Image Enhancement. | William Y. Wang, Lisa Liu, Pingping Cai |
| 2024 | CT-MVSNet: Efficient Multi-view Stereo with Cross-Scale Transformer. | Sicheng Wang, Hao Jiang, Lei Xiang |
| 2024 | ACT: Action-assoCiated and Target-Related Representations for Object Navigation. | Youkai Wang, Yue Hu, Wansen Wu, Ting Liu, Yong Peng |
| 2024 | Mitigating Fine-Grained Hallucination by Fine-Tuning Large Vision-Language Models with Caption Rewrites. | Lei Wang, Jiabang He, Shenshen Li, Ning Liu, Ee-Peng Lim |
| 2024 | ViewsInsight: Enhancing Video Retrieval for VBS 2024 with a User-Friendly Interaction Mechanism. | Gia-Huy Vuong, Van-Son Ho, Tien-Thanh Nguyen-Dang, Xuan-Dang Thai, Tu-Khiem Le, Minh-Khoi Pham, Van-Tu Ninh, Cathal Gurrin, Minh-Triet Tran |
| 2024 | A Framework for 3D Modeling of Construction Sites Using Aerial Imagery and Semantic NeRFs. | Panagiotis Vrachnos, Marios Krestenitis, Ilias Koulalis, Konstantinos Ioannidis, Stefanos Vrochidis |
| 2024 | Exploring Artificial Intelligence for Advancing Performance Processes and Events in Io3MT. | Rmulo Vieira, Dbora C. Muchaluat-Saade, Pablo Csar |
| 2024 | RESET: Relational Similarity Extension for V3C1 Video Dataset. | Patrik Vesel, Ladislav Peska |
| 2024 | Exploring Multi-modal Fusion for Image Manipulation Detection and Localization. | Konstantinos Triaridis, Vasileios Mezaris |
| 2024 | Interactive Question Answering for Multimodal Lifelog Retrieval. | Ly-Duyen Tran, Liting Zhou, Binh T. Nguyen, Cathal Gurrin |
| 2024 | Audio-Visual Segmentation by Leveraging Multi-scaled Features Learning. | Sze An Peter Tan, Guangyu Gao, Jia Zhao |
| 2024 | LigCDnet:Remote Sensing Image Cloud Detection Based on Lightweight Framework. | Baotong Su, Wenguang Zheng |
| 2024 | Exploring Multimedia Vector Spaces with vitrivr-VR. | Florian Spiess, Luca Rossetto, Heiko Schuldt |
| 2024 | YOLOv5-SRR: Enhancing YOLOv5 for Effective Underwater Target Detection. | Jinyu Shi, Wenjie Wu |
| 2024 | PMGCN:Preserving Measuring Mapping Prototype Graph Calibration Network for Few-Shot Learning. | Zhengye Shen, Guangtong Lu, Qian Qiao, Fanzhang Li |