| 2025 | EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-Based Online Scene Understanding. | Yuqi Wu, Wenzhao Zheng, Sicheng Zuo, Yuanhui Huang, Jie Zhou, Jiwen Lu |
| 2025 | Harmonizing Visual Representations for Unified Multimodal Understanding and Generation. | Size Wu, Wenwei Zhang, Lumin Xu, Sheng Jin, Zhonghua Wu, Qingyi Tao, Wentao Liu, Wei Li, Chen Change Loy |
| 2025 | Visual Textualization for Image Prompted Object Detection. | Yongjian Wu, Yang Zhou, Jiya Saiyin, Bingzheng Wei, Yan Xu |
| 2025 | VSP: Diagnosing the Dual Challenges of Perception and Reasoning in Spatial Planning Tasks for MLLMS. | Qiucheng Wu, Handong Zhao, Michael Saxon, Trung Bui, William Yang Wang, Yang Zhang, Shiyu Chang |
| 2025 | IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation. | Yinwei Wu, Xianpan Zhou, Bing Ma, Xuefeng Su, Kai Ma, Xinchao Wang |
| 2025 | Learning Yourself: Class-Incremental Semantic Segmentation with Language-Inspired Bootstrapped Disentanglement. | Ruitao Wu, Yifan Zhao, Jia Li |
| 2025 | Towards Reporting Bias in Visual-Language Datasets: Bi-Modal Data Augmentation by Decoupling Object-Attribute Association. | Qiyu Wu, Mengjie Zhao, Yutong He, Lang Huang, Junya Ono, Hiromi Wakaki, Yuki Mitsufuji |
| 2025 | Amodal3R: Amodal 3D Reconstruction from Occluded 2D Images. | Tianhao Wu, Chuanxia Zheng, Frank Guan, Andrea Vedaldi, Tat-Jen Cham |
| 2025 | AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation. | Zijie Wu, Chaohui Yu, Fan Wang, Xiang Bai |
| 2025 | Temporal Unlearnable Examples: Preventing Personal Video Data from Unauthorized Exploitation by Object Tracking. | Qiangqiang Wu, Yi Yu, Chenqi Kong, Ziquan Liu, Jia Wan, Haoliang Li, Alex C. Kot, Antoni B. Chan |
| 2025 | TrafficInternVL: Understanding Traffic Scenarios with Vision-Language Models. | Hsiu-Fu Wu, Ya-Ting Yang, Yung-Ter Chen, I-Fan Chou |
| 2025 | DALIP: Distribution Alignment-Based Language-Image Pre-Training for Domain-Specific Data. | Junjie Wu, Jiangtao Xie, Zhaolin Zhang, Qilong Wang, Qinghua Hu, Peihua Li, Sen Xu |
| 2025 | Importance-Based Token Merging for Efficient Image and Video Generation. | Haoyu Wu, Jingyi Xu, Hieu Le, Dimitris Samaras |
| 2025 | FineMotion: A Dataset and Benchmark with Both Spatial and Temporal Annotation for Fine-Grained Motion Generation and Editing. | Bizhu Wu, Jinheng Xie, Meidan Ding, Zhe Kong, Jianfeng Ren, Ruibin Bai, Rong Qu, Linlin Shen |
| 2025 | Measuring the Impact of Rotation Equivariance on Aerial Object Detection. | Xiuyu Wu, Xinhao Wang, Xiubin Zhu, Lan Yang, Jiyuan Liu, Xingchen Hu |
| 2025 | CMT: A Cascade MAR with Topology Predictor for Multimodal Conditional CAD Generation. | Jianyu Wu, Yizhou Wang, Xiangyu Yue, Xinzhu Ma, Jinyang Guo, Dongzhan Zhou, Wanli Ouyang, Shixiang Tang |
| 2025 | CATP-LLM: Empowering Large Language Models for Cost-Aware Tool Planning. | Duo Wu, Jinghe Wang, Yuan Meng, Yanning Zhang, Le Sun, Zhi Wang |
| 2025 | On-Device Diffusion Transformer Policy for Efficient Robot Manipulation. | Yiming Wu, Huan Wang, Zhenghao Chen, Jianxin Pang, Dong Xu |
| 2025 | Toward Scalable Video Narration: A Training-Free Approach Using Multimodal Large Language Models. | Tz-Ying Wu, Tahani Trigui, Sharath Nittur Sridhar, Anand V. Bodas, Subarna Tripathi |
| 2025 | Boosting Generative Adversarial Transferability with Self-Supervised Vision Transformer Features. | Shangbo Wu, Yu-an Tan, Ruinan Ma, Wencong Ma, Dehua Zhu, Yuanzhang Li |
| 2025 | Mixture-of-Scores: Robust Image-Text Data Valuation via Three Lines of Code. | Sitong Wu, Haoru Tan, Yukang Chen, Shaofeng Zhang, Jingyao Li, Bei Yu, Xiaojuan Qi, Jiaya Jia |
| 2025 | Drawing Developmental Trajectory From Cortical Surface Reconstruction. | Wenxuan Wu, Ruowen Qu, Zhongliang Liu, Zhuoyan Dai, Dongzi Shi, Sijin Yu, Tong Xiong, Shiping Liu, Xiangmin Xu, Xiaofen Xing, Xin Zhang |
| 2025 | Federated Domain Generalization with Domain-Specific Soft Prompts Generation. | Jianhan Wu, Xiaoyang Qu, Zhangcheng Huang, Jianzong Wang |
| 2025 | LocalDyGS: Multi-view Global Dynamic Scene Modeling via Adaptive Local Implicit Feature Decoupling. | Jiahao Wu, Rui Peng, Jianbo Jiao, Jiayu Yang, Luyang Tang, Kaiqiang Xiong, Jie Liang, Jinbo Yan, Runling Liu, Ronggang Wang |
| 2025 | Ensemble Foreground Management for Unsupervised Object Discovery. | Ziling Wu, Armaghan Moemeni, Praminda Caleb-Solly |