| 2026 | CCASNet: Criss-Cross Attention Enhanced Network with Dual-Channel Spatial Modeling for Medical Image Segmentation. | Cheng Fu, Junlong Wu, Xianhong Chen, Hujin Peng, Jing Xu, Junyuan Gong, Zeyun Liu, Wenzheng Liu, Tan Deng, Ming Yuan |
| 2026 | Ask VR: Vision Language Model Driven Scene Descriptor for Blind and Low Vision Users in VR Environment. | Jaime B. Fernandez, Syed Ayaz Ali Shah, Muhammad Intizar Ali |
| 2026 | HDBC: A Heterogeneous Dual-Branch Convolutional Network for Audio Splicing Detection. | Xiaojing Feng, Zhenhua Tan, Ziwei Cheng, Jiayuan Luo |
| 2026 | DS-HGCN: A Dual-Stream Hypergraph Convolutional Network for Predicting Student Engagement via Social Contagion. | Ziyang Fan, Li Tao, Yi Wang, Jingwei Qu, Ying Wang, Fei Jiang |
| 2026 | M3RAG: Orchestrating Multi-agent Reasoning for Multi-hop, Multi-modal Understanding. | Haizhou Du, Wenhao Li |
| 2026 | Graph Contrastive Learning with Popularity and Neighborhood Awareness for Long-Tail Item Recommendation. | Yuma Dose, Takahiro Hara |
| 2026 | Low-Dimension Representation Estimation in Principal Component Analysis Under Missing Data. | Thanh Tu Do, Van Hua, Uyen Dang, Thu Nguyen, Steven Hicks, Pl Halvorsen, Michael A. Riegler, Binh T. Nguyen |
| 2026 | Multi-granular Feature Selection Fusion Method for Multimodal Named Entity Recognition. | Guohui Ding, Tengyu Fan, Chufei Wang |
| 2026 | Noise Scale Controllable Anomaly Synthesis Strategy for Industrial Anomaly Detection and Localization. | Yuchen Deng, Hongyou Chen, Lingfeng Qu, Yong Jiang, Yong Fan |
| 2026 | Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion. | Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin |
| 2026 | V-HOI: Velocity-Aware Human-Object Interaction Generation. | Honghui Chen, Fan Zhou, Ruomei Wang, Baoquan Zhao |
| 2026 | Taming Image-Based Vision-Language Pre-training Model with Bootstrapped Auxiliary Tasks for Video Captioning. | Ziyu Chen, Hanli Wang |
| 2026 | Diffusion-Driven Deep Variational Image Clustering with Representation Decoupling. | Feiyu Chen, Zijian Li, Nanjun Yu, Tangjun Ruan, Teng Ma, Chao Zhang |
| 2026 | VIREO @ Video Browser Showdown 2026. | Yu-Tong Cheng, Phuong-Anh Nguyen, Kim-Thuy Kha, Chong-Wah Ngo |
| 2026 | DPNet: A Dual-Perception Fusion Network for Automated Coronary Artery Segmentation. | Zhiting Chen, Jieyun Bai, Shunning Li, Xiaoshen Zhang, Hua Lu |
| 2026 | RC-NeRF: Anti-aliasing with Artifact Suppression via Adaptive Hybrid Sampling in Explicit Voxel Grids. | Jiajun Cai, Jianmei Su |
| 2026 | XROI-GS: Real-Time XR Interactive Inspection of High-Quality Objects of Interest in a 3D Gaussian Splats Scene. | Quoc-Anh Bui, Serhane Lim, Tom Boudard, Gilles Rougeron, Simone Gasparini, Graldine Morin |
| 2026 | Dissecting Deepfake Artifacts via Multimodal Explanations. | Yannan Bai, Danding Wang, Sheng Tang, Juan Cao, Jintao Li |
| 2026 | ZhadigerAI: Software-as-a-Service AI Platform for Kazakh and English. | Aidana Baglanova, Nail Fakhrutdinov, Umit Azirakhmet, Ruslan Kalimzhanov, Zilola Babakhojayeva, Hakan Yekta Yatbaz, Adnan Yazici |
| 2026 | MediaMix: Multimedia Retrieval with Dual Backend Support and Result Exploration in MR. | Rahel Arnold, Anna Pietzak, Heiko Schuldt |
| 2026 | LGF-Net: Integrating Local and Global Features in a Dual-Branch Architecture for Tooth Segmentation in CBCT Images. | Yu Ao, Hongze Han, Yuqin Li, Yu Miao, Weili Shi |
| 2025 | MambaTalk: Speech-Driven 3D Facial Animation with Mamba. | Deli Zhu, Zhao Xu, Yunong Yang |
| 2025 | Enhancing Environmental Monitoring Through Multispectral Imaging: The WasteMS Dataset for Semantic Segmentation of Lakeside Waste. | Qinfeng Zhu, Ningxin Weng, Lei Fan, Yuanzhi Cai |
| 2025 | CLIP Multi-modal Hashing for Multimedia Retrieval. | Jian Zhu, Mingkai Sheng, Zhangmin Huang, Jingfei Chang, Jinling Jiang, Jian Long, Cheng Luo, Lei Liu |
| 2025 | Multi-modal Information Multi-angle Mining for Multimedia Recommendation. | Yijie Zhu, Mingyong Li |