| 2026 | A Multi-View Photometric Stereo Pipeline for Specular 3D Fruit Reconstruction. | Ariel Zuniga-Santana, Gabriele Facciolo, Shohei Nobuhara, Rodrigo Verschae |
| 2026 | Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting. | Shu Zou, Xinyu Tian, Lukas Wesemann, Fabian Waschkowski, Zhaoyuan Yang, Jing Zhang |
| 2026 | Guided Model Merging for Hybrid Data Learning: Leveraging Centralized Data to Refine Decentralized Models. | Junyi Zhu, Ruicong Yao, Taha Ceritli, Savas zkan, Matthew B. Blaschko, Eunchung Noh, Jeongwon Min, Cho Jung Min, Mete Ozay |
| 2026 | StructFormer: Structure-Consistent Face De-Identification Under Strong Privacy Constraints. | Haini Zhu, Deepak Kumar Jain, Xudong Zhao, Muyu Li, Vitomir Struc, Sumarga Kumar Sah Tyagi |
| 2026 | What Matters in Reinforcement Learning Based Training for Medical Vision Language Model: an Empirical Study. | Wenhui Zhu, Xuanzhao Dong, Xin Li, Peijie Qiu, Xiwen Chen, Walker Northrup, Abolfazl Razi, Aris Sotiras, Yi Su, Zhipeng Wang, Shao Tang, Yalin Wang |
| 2026 | Line Art Colorization with Offset Prior-based Diffusion Model. | Xuan Zhu, Miao Cao, Fang-Lue Zhang, Yu-Kun Lai, Paul L. Rosin |
| 2026 | EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models. | Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Shao Tang, Sayan Ghosh, Xuanzhao Dong, Rajat Koner, Yalin Wang |
| 2026 | DF-Mamba: Deformable State Space Modeling for 3D Hand Pose Estimation in Interactions. | Yifan Zhou, Takehiko Ohkawa, Guwenxiao Zhou, Kanoko Goto, Takumi Hirose, Yusuke Sekikawa, Nakamasa Inoue |
| 2026 | Towards Photorealistic Style Transfer with Multimodal Guidance and Robustness to Content Images in Arbitrary Styles. | Ruikai Zhou, Yating Liu, Yi Xu |
| 2026 | 4D-Animal: Freely Reconstructing Animatable 3D Animals from Videos. | Shanshan Zhong, Jiawei Peng, Zehan Zheng, Zhongzhan Huang, Wufei Ma, Guofeng Zhang, Qihao Liu, Alan L. Yuille, Jieneng Chen |
| 2026 | Scalable Video Action Anticipation with Cross Linear Attentive Memory. | Zeyun Zhong, Manuel Martin, David Schneider, David J. Lerch, Chengzhi Wu, Frederik Diederichs, Juergen Gall, Jrgen Beyerer |
| 2026 | FlowMorph: Revealing an Optimizable Flow Latent Space for Controlled Image Morphing. | Yan Zheng, Yi Yang, Lanqing Guo, Zhangyang Wang |
| 2026 | Interleaved Vision-and-Language Generation via Generative Voken. | Kaizhi Zheng, Xuehai He, Xin Eric Wang |
| 2026 | DermEVAL: A Dermatologist-Reviewed Benchmark for Multimodal Large Language Models. | Hongjin Zhao, Weihao Li, Zhenyue Qin, Ge-Peng Ji, Yang Liu, Tom Gedeon, Nick Barnes |
| 2026 | False Alarm Rectification for Early Smoke Segmentation. | Hongjin Zhao, Weihao Li, Ge-Peng Ji, Nick Barnes |
| 2026 | UltraClean: A Simple Framework to Train Robust Neural Networks against Backdoor Attacks. | Bingyin Zhao, Yingjie Lao |
| 2026 | ART: Actor-Related Tubelet for Detecting Complex-shaped Action Tubes. | Jiaojiao Zhao |
| 2026 | Semi-supervised Domain Adaptation via Mutual Alignment through Joint Error. | Dexuan Zhang, Thomas Westfechtel, Tatsuya Harada |
| 2026 | Align Video Diffusion Model with Online Video-Centric Preference Optimization. | Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han |
| 2026 | FAST-EQA: Efficient Embodied Question Answering with Global and Local Region Relevancy. | Haochen Zhang, Nirav Savaliya, Faizan Siddiqui, Enna Sachdeva |
| 2026 | Conversational Image Generation: Towards Multi-Round Personalized Generation with Multi-Modal Language Models. | Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He |
| 2026 | Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction. | Ce Zhang, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur |
| 2026 | Perceptually Guided 3DGS Streaming and Rendering for Mixed Reality. | Yunxiang Zhang, Sai Harsha Mupparaju, Kenneth Chen, Jenna Kang, Xinyu Zhang, Maito Omori, Kazuyuki Arimatsu, Qi Sun |
| 2026 | Stroke Modeling Enables Vectorized Character Generation with Large Vectorized Glyph Model. | Xinyue Zhang, Haolong Li, Jiawei Ma, Chen Ye |
| 2026 | MoSCo: Real-time and Efficient Text-to-Motion Synthesis via Delta Training. | Zhiyuan Zhang, Lingqiao Liu |