| 2026 | Surface Defect Detection of Photovoltaic Panels Based on Deep Learning and Electroluminescent Images. | Xiaoqiang Wang, Liurui Zhao, Yanjie Wang |
| 2026 | Stereo3D-NeRF: Generating 3D Visualizations with Paired Stereoscopic Views. | Yongxiang Wang, Gang Zhou, Wei Liu, Yang Zhou |
| 2026 | R | Haoyang Wang, Liming Liu, Xinggong Zhang |
| 2026 | HCFFPN: Hierarchical Cross-Scale Feature Fusion Pyramid Network for Small Target Detection in Unmanned Aerial Vehicle Images. | Lin Wang, Tiansong Li, Guofen Wang, Shaoguo Cui, Hongkui Wang, Li Yu |
| 2026 | RIDA: Detection of Adversarial Examples Through Image Adaptive Local Reconstruction. | Xiaoyu Wang, Jing Liu |
| 2026 | MedFuse-GRM: Multi-scale Feature Extraction and Medically-Guided Graph Relation Modeling for Multimodal Skin Lesion Classification. | Zhangyi Wang, Zongze Li |
| 2026 | Enhancing Image Generation of Diffusion Models with Structural Image Guidance. | Wei Wang, JiaYi Hu |
| 2026 | VENUS: Visual Editing with Noise Inversion Using Scene Graphs. | Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran |
| 2026 | DPERC: Direct Parameter Estimation for Mixed Data with Random Missingness. | Tuan L. Vo, Uyen Dang, Thu Nguyen, Pl Halvorsen, Michael A. Riegler, Binh T. Nguyen |
| 2026 | STEP-MR: A Subjective Testing and Eye-Tracking Platform for Dynamic Point Clouds in Mixed Reality. | Shivi Vats, Christian Timmerer, Hermann Hellwagner |
| 2026 | U-Cker at VBS2026: A Web-Based Interactive Video Retrieval System with Multimodal Query Support. | Kazuya Ueki, Ryo Mutou, Takuya Wada, Ryota Akaba, Guannan Zhang |
| 2026 | Integrating Symbolic and Waveform Music Into Large Language Models. | Teng Tu, Xiaohao Liu, Yunshan Ma, Ji Qi, Tat-Seng Chua |
| 2026 | A Case Study of a Transparent and Controllable Music Recommender System with Multi-relational Layers. | Kosetsu Tsukuda, Keisuke Ishida, Takumi Takahashi, Masahiro Hamasaki, Masataka Goto |
| 2026 | PreBERT-Rec: Improving Topic Modeling in Recommendation Systems via Effective Data Preprocessing and BERT. | Dang Hoang Minh Triet, Tran Hoang Anh, Nguyen Hoang Hai, Tran Nguyen Minh Quang, Tran Cong Hieu, Thu Nguyen, Binh Thanh Nguyen |
| 2026 | On the Brittleness of CLIP Text Encoders. | Allie Tran, Luca Rossetto |
| 2026 | NII-UIT at VBS2026: Towards Effective Visual Question Answering for Interactive and Multimodal Video Retrieval. | Bao Tran, Tien Do, Thanh Duc Ngo, Duy-Dinh Le, Shin'ichi Satoh |
| 2026 | Small Object Detection via Frequency-Based Multi-modal Fusion. | Shangzhi Teng, Yekai Li, Xi Gong, Xueqiang Lv |
| 2026 | Multimodal Video Summarization with Mamba and Bayesian Approach. | Adane Nega Tarekegn, Fazle Rabbi, Andreas L. Opdahl, Bjrnar Tessem |
| 2026 | A Multimedia Pipeline for Interactive Game Archaeology on the Example of Wolfenstein 3D in Godot Engine. | Berenika Nawoja Kostka de Sztemberg, Patryk Zywica |
| 2026 | WildfireX-SLAM: A Large-Scale Low-Altitude RGB-D Dataset for Wildfire SLAM and Beyond. | Zhicong Sun, Jacqueline Ty Lo, Jinxing Hu |
| 2026 | Illumination-Prior Guided Hybrid Network for Low-Light Image Enhancement. | Ao Sun, Shijie Hao, Yanrong Guo |
| 2026 | Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning. | Mantek Singh, Jeshwanth Challagundla, Siddharth Raina, Jasmin Jarsania |
| 2026 | Splat-Portrait: Generalizing Talking Heads with Gaussian Splatting. | Tong Shi, Melonie de Almeida, Daniela Ivanova, Nicolas Pugeault, Paul Henderson |
| 2026 | PRSM: A Measure to Evaluate CLIP's Robustness Against Paraphrases. | Udo Schlegel, Franziska Weeber, Jian Lan, Thomas Seidl |
| 2026 | Applications of Multimodal Knowledge Graphs in Modeling Multimedia. | Florian Ruosch, Luca Rossetto |