| 2026 | SAP-DQR: Joining Spatial-Adaptive Pyramid and Adaptive Query Reorganization for Speed-Accuracy Instance Segmentation. | Jiahao Zou, Congxuan Zhang, Liyue Ge, Chao He, Jiawen Yang, Zhen Chen, Ke Lu |
| 2026 | MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding and Grounding. | Fengbin Zhu, Ziyang Liu, Xiang Yao Ng, Haohui Wu, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Tat-Seng Chua |
| 2026 | Enhancing Ensemble Adversarial Defense via Dataset Orthogonal Decomposition. | Jin Zhu, Jiayu Du, Fan Zhang, Xin Chen, Zhizhong Zhou |
| 2026 | DAGMP: A Multimodal Learning Approach Jointly Driven by Feature Fusion and Gradient Modulation. | Xinying Zhou, Leixiao Li, Hao Lin |
| 2026 | TTEdit: Cross-Modal Fusion with Diffusion Models for Detail-Aware Fashion Editing. | Feng Zhang, Junliang Tan, Zhenming Chen, Hao Feng, Biao Guo, Junyan Chen, Yao Lu, Ming Jiang |
| 2026 | PSR-Diff: Polarization-Guided Diffusion Model for Single Image Specular Highlight Removal. | Guobin Zhang, Li Li, Zhaojing Wang, Qihang Wang, Tao Peng, Xinrong Hu |
| 2026 | MRAFnd: Multimodal Retrieval-Augmented Framework for Zero-Shot Fake News Detection. | Lehan Zhang, Yinlei Cheng, Shiqi Hu, Yiheng Zhou, Shangxi Li, Naidong Zhao |
| 2026 | MP-CLIP: Unlocking Long-Text Understanding in CLIP via Multi-paragraph Encoding. | Zhaofu Zeng, Jian Xing |
| 2026 | MotionSlim: A Lightweight T2M Generation Framework Based on LLM. | Congrui Yu, Bo Fan, Na Lyu |
| 2026 | No-Reference Image Quality Assessment via Attention-Based Feature Enhancement and Feature Interaction. | Qiqun Yu, Yihua Chen, Jiliang Ma, Zhenjun Tang |
| 2026 | FGR: Frequency Aware and Geometric Structure-Guided Multi-modality Image Registration Framework. | Qihao Ye, Zhuowei Wang |
| 2026 | WavGateMamba: A Frequency-Enhanced and Gated Mamba Model for Multimodal Depression Detection. | Haiyang Ye, Dengshi Li, Wei Li, Yulin Wu, Yu Fang, YuXin Li |
| 2026 | SDB: Safety Constraint Mechanism for Dual-Branch End-to-End Autonomous Driving. | Hongzhi Yan, Jianmei Su |
| 2026 | Boosting the Transferability of Adversarial Examples via Frequency Domain Masking and Adaptive Step Size. | Jiale Yang, Kai Zhao, Linlin Zhang, Qingguan Li |
| 2026 | Video Hashing via a Mamba-Transformer Network for Retrieval. | Likai Yang, Nianqiao Li, Xiaoping Liang, Lv Chen, Zhenjun Tang |
| 2026 | Question-Aware Spatial-Temporal Reasoning in Patch for Audio-Visual Question Answering. | Feifei Xu, Wenjing Zhu, Dongyang Li, Puzhe Li |
| 2026 | MAGNet: Multi-level Attention For Guided Thermal Infrared Image Super-Resolution. | Zhoutong Xu, Zhangye Wang |
| 2026 | Hierarchical Cross-Modality Interaction for Unified Video-Text Retrieval Modeling. | Tianshi Xu, Zhengzheng Sun, Yizheng Hu, Junyuan Shang, Si Wu |
| 2026 | Towards Robust and Secure Cross-Domain Face Anti-Spoofing via Feature-Boundary Consistency. | Songlin Xue, Hong Zhang |
| 2026 | A Backdoor Attack via Fixed Patch Triggers in Frequency Domain. | Song Xue, Jiayu Du, Wei Huang, Qiulong Yang |
| 2026 | AdSum: Two-Stream Audio-Visual Summarization for Automated Video Advertisement Clipping. | Wen Xie, Yanjun Zhu, Gijs Overgoor, Yakov Bart, Agata Lapedriza Garcia, Sarah Ostadabbas |
| 2026 | DFRF-MIAD: Multimodal Industrial Anomaly Detection via Feature Reconstruction and Fusion. | Feng Wu, Zhaojing Wang, Li Li |
| 2026 | Token-Based Multi-condition Autoregressive Diffusion for Lung CT Image Generation. | Bo Wu |
| 2026 | CTDiff : A Lightweight Hybrid Diffusion Network for Low-Light Endoscopic Image Enhancement. | Guodong Wei, Jiayu Yu, Yu Ao, Yuqin Li, Guan Yuan Feng, Weili Shi, Yu Miao, Zhengang Jiang |
| 2026 | Benchmarking SmolVLM for Parking Occupancy Detection. | Jobin Idiculla Wattaseril, Willy Scheibel, Jrgen Dllner |