| 2025 | Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation. | Yiping Wang, Xuehai He, Kuan Wang, Luyao Ma, Jianwei Yang, Shuohang Wang, Simon Shaolei Du, Yelong Shen |
| 2025 | Layered Image Vectorization via Semantic Simplification. | Zhenyu Wang, Jianxi Huang, Zhida Sun, Yuanhao Gong, Daniel Cohen-Or, Min Lu |
| 2025 | Action Detail Matters: Refining Video Recognition with Local Action Queries. | Mengmeng Wang, Zeyi Huang, Xiangjie Kong, Guojiang Shen, Guang Dai, Jingdong Wang, Yong Liu |
| 2025 | OpenSDI: Spotting Diffusion-Generated Images in the Open World. | Yabin Wang, Zhiwu Huang, Xiaopeng Hong |
| 2025 | SleeperMark: Towards Robust Watermark against Fine-Tuning Text-to-image Diffusion Models. | Zilan Wang, Junfeng Guo, Jiacheng Zhu, Yiming Li, Heng Huang, Muhao Chen, Zhengzhong Tu |
| 2025 | VidTwin: Video VAE with Decoupled Structure and Dynamics. | Yuchi Wang, Junliang Guo, Xinyi Xie, Tianyu He, Xu Sun, Jiang Bian |
| 2025 | A3: Few-shot Prompt Learning of Unlearnable Examples with Cross-Modal Adversarial Feature Alignment. | Xuan Wang, Xitong Gao, Dongping Liao, Tianrui Qin, Yu-liang Lu, Cheng-Zhong Xu |
| 2025 | Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models? | Yanbo Wang, Jiyang Guan, Jian Liang, Ran He |
| 2025 | A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation. | Andrew Z. Wang, Songwei Ge, Tero Karras, Ming-Yu Liu, Yogesh Balaji |
| 2025 | Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding. | Zining Wang, Tongkun Guan, Pei Fu, Chen Duan, Qianyi Jiang, Zhentao Guo, Shan Guo, Junfeng Luo, Wei Shen, Xiaokang Yang |
| 2025 | MetricGrids: Arbitrary Nonlinear Approximation with Elementary Metric Grids based Implicit Neural Representation. | Shu Wang, Yanbo Gao, Shuai Li, Chong Lv, Xun Cai, Chuankun Li, Hui Yuan, Jinglin Zhang |
| 2025 | TAMT: Temporal-Aware Model Tuning for Cross-Domain Few-Shot Action Recognition. | Yilong Wang, Zilin Gao, Qilong Wang, Zhaofeng Chen, Peihua Li, Qinghua Hu |
| 2025 | GoLF-NRT: Integrating Global Context and Local Geometry for Few-Shot View Synthesis. | You Wang, Li Fang, Hao Zhu, Fei Hu, Long Ye, Zhan Ma |
| 2025 | Adapting Text-to-Image Generation with Feature Difference Instruction for Generic Image Restoration. | Chao Wang, Hehe Fan, Huichen Yang, Sarvnaz Karimi, Lina Yao, Yi Yang |
| 2025 | AdaptCMVC: Robust Adaption to Incremental Views in Continual Multi-view Clustering. | Jing Wang, Songhe Feng, Kristoffer Knutsen Wickstrm, Michael C. Kampffmeyer |
| 2025 | Diffusion-based Realistic Listening Head Generation via Hybrid Motion Modeling. | Yinuo Wang, Yanbo Fan, Xuan Wang, Yu Guo, Fei Wang |
| 2025 | Dist-Tracker: A Small Object-aware Detector and Tracker for UAV Tracking. | Wenzhen Wang, Jing Fu, Jiayi Song, Kaiyu Li, Hui Qiao, Jiang Liu, Hao Sun, Xiangyong Cao |
| 2025 | Dual Semantic Guidance for Open Vocabulary Semantic Segmentation. | Zhengyang Wang, Tingliang Feng, Fan Lyu, Fanhua Shang, Wei Feng, Liang Wan |
| 2025 | Efficient Test-time Adaptive Object Detection via Sensitivity-Guided Pruning. | Kunyu Wang, Xueyang Fu, Xin Lu, Chengjie Ge, Chengzhi Cao, Wei Zhai, Zheng-Jun Zha |
| 2025 | VidSeg: Training-free Video Semantic Segmentation based on Diffusion Models. | Qian Wang, Abdelrahman Eldesokey, Mohit Mendiratta, Fangneng Zhan, Adam Kortylewski, Christian Theobalt, Peter Wonka |
| 2025 | POT: Prototypical Optimal Transport for Weakly Supervised Semantic Segmentation. | Jian Wang, Tianhong Dai, Bingfeng Zhang, Siyue Yu, Eng Gee Lim, Jimin Xiao |
| 2025 | AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM. | Jiarui Wang, Huiyu Duan, Guangtao Zhai, Juntong Wang, Xiongkuo Min |
| 2025 | Generalizable Object Keypoint Localization from Generative Priors. | Dongkai Wang, Jiang Duan, Liangjian Wen, Shiyu Xuan, Hao Chen, Shiliang Zhang |
| 2025 | Embodied Scene Understanding for Vision Language Models via MetaVQA. | Weizhen Wang, Chenda Duan, Zhenghao Peng, Yuxin Liu, Bolei Zhou |
| 2025 | Near-incident detection in railroad environments: lateral distance estimation from train-mounted monocular camera. | Yilei Wang, Giacomo D'Amicantonio, Egor Bondarev |