| 2025 | DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation. | Yuejiang Dong, Wang Zhao, Jiale Xu, Ying Shan, Song-Hai Zhang |
| 2025 | Can We Achieve Efficient Diffusion without Self-Attention? Distilling Self-Attention Into Convolutions. | ZiYi Dong, Chengxing Zhou, Weijian Deng, Pengxu Wei, Xiangyang Ji, Liang Lin |
| 2025 | Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation. | Jiahua Dong, Hui Yin, Wenqi Liang, Hanbin Zhao, Henghui Ding, Nicu Sebe, Salman Khan, Fahad Shahbaz Khan |
| 2025 | Pose-Star: Anatomy-Aware Editing for Open-World Fashion Images. | Yuran Dong, Mang Ye |
| 2025 | NoiseController: Towards Consistent Multi-View Video Generation via Noise Decomposition and Collaboration. | Haotian Dong, Xin Wang, Di Lin, Yipeng Wu, Qin Chen, Ruonan Liu, Kairui Yang, Ping Li, Qing Guo |
| 2025 | Fairness without Labels: Pseudo-Balancing for Bias Mitigation in Face Gender Classification. | Haohua Dong, Ana Manzano Rodrguez, Camille Guinaudeau, Shin'ichi Satoh |
| 2025 | Confound from all Sides, Distill with Resilience: Multi-Objective Adversarial Paths to Zero-Shot Robustness. | Junhao Dong, Jiao Liu, Xinghua Qu, Yew-Soon Ong |
| 2025 | LLM-Assisted Entropy-Based Adaptive Distillation for Unsupervised Fine-Grained Visual Representation Learning. | Jianfeng Dong, Danfeng Luo, Daizong Liu, Jie Sun, Xiaoye Qu, Xun Yang, Dongsheng Liu, Xun Wang |
| 2025 | DAMap: Distance-Aware MapNet for High Quality HD Map Construction. | Jinpeng Dong, Chen Li, Yutong Lin, Jingwen Fu, Sanping Zhou, Nanning Zheng |
| 2025 | PS-Mamba: Spatial-Temporal Graph Mamba for Pose Sequence Refinement. | Haoye Dong, Gim Hee Lee |
| 2025 | Robustifying Zero-Shot Vision Language Models by Subspaces Alignment. | Junhao Dong, Piotr Koniusz, Liaoyuan Feng, Yifei Zhang, Hao Zhu, Weiming Liu, Xinghua Qu, Yew-Soon Ong |
| 2025 | Online Dense Point Tracking with Streaming Memory. | Qiaole Dong, Yanwei Fu |
| 2025 | Inter: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling. | Xin Dong, Shichao Dong, Jin Wang, Jing Huang, Li Zhou, Zenghui Sun, Lihua Jing, Jinsong Lan, Xiaoyong Zhu, Bo Zheng |
| 2025 | MoGA: 3D Generative Avatar Prior for Monocular Gaussian Avatar Reconstruction. | Zijian Dong, Longteng Duan, Jie Song, Michael J. Black, Andreas Geiger |
| 2025 | From One to More: Contextual Part Latents for 3D Generation. | Shaocong Dong, Lihe Ding, Xiao Chen, Yaokun Li, Yuxin Wang, Yucheng Wang, Qi Wang, Jaehyeok Kim, Chenjian Gao, Zhanpeng Huang, Zibin Wang, Tianfan Xue, Dan Xu |
| 2025 | Vpr-Cloak: a First Look at Privacy Cloak Against Visual Place Recognition. | Shuting Dong, Mingzhi Chen, Feng Lu, Hao Yu, Guanghao Li, Zhe Wu, Ming Tang, Chun Yuan |
| 2025 | Transformer-Based Tooth Alignment Prediction with Occlusion and Collision Constraints. | Zhenxing Dong, Jiazhou Chen |
| 2025 | PAN-Crafter: Learning Modality-Consistent Alignment for Pan-Sharpening. | Jeonghyeok Do, Sungpyo Kim, Geunhyuk Youk, Jaehyup Lee, Munchurl Kim |
| 2025 | Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-Shot Skeleton-Based Action Recognition. | Jeonghyeok Do, Munchurl Kim |
| 2025 | DynFaceRestore: Balancing Fidelity and Quality in Diffusion-Guided Blind Face Restoration with Dynamic Blur-Level Mapping and Guidance. | Huu-Phu Do, Yu-Wei Chen, Yi-Cheng Liao, Chi-Wei Hsiao, Han-Yang Wang, Wei-Chen Chiu, Ching-Chun Huang |
| 2025 | DiffTell: A High-Quality Dataset for Describing Image Manipulation Changes. | Zonglin Di, Jing Shi, Yifei Fan, Hao Tan, Alexander Black, John P. Collomosse, Yang Liu |
| 2025 | Kaleidoscopic Background Attack: Disrupting Pose Estimation With Multi-Fold Radial Symmetry Textures. | Xinlong Ding, Hongwei Yu, Jiawei Li, Feifan Li, Yu Shang, Bochao Zou, Huimin Ma, Jiansheng Chen |
| 2025 | MM-IFEngine: Towards Multimodal Instruction Following. | Shengyuan Ding, Shenxi Wu, Xiangyu Zhao, Yuhang Zang, Haodong Duan, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Dahua Lin, Jiaqi Wang |
| 2025 | StreamMind: Unlocking Full Frame Rate Streaming Video Dialogue through Event-Gated Cognition. | Xin Ding, Hao Wu, Yifan Yang, Shiqi Jiang, Qianxi Zhang, Donglin Bai, Zhibo Chen, Ting Cao |
| 2025 | SAM2LONG: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree. | Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, Jiaqi Wang |