| 2025 | Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction. | Rui Qian, Shuangrui Ding, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang |
| 2025 | Document Image Rectification using Stable Diffusion Transformer. | Pooja Kumari, Sukhendu Das |
| 2025 | Dual Consolidation for Pre-Trained Model-Based Domain-Incremental Learning. | Da-Wei Zhou, Zi-Wen Cai, Han-Jia Ye, Lijun Zhang, De-Chuan Zhan |
| 2025 | Patient-Level Anatomy Meets Scanning-Level Physics: Personalized Federated Low-Dose CT Denoising Empowered by Large Language Model. | Ziyuan Yang, Yingyu Chen, Zhiwen Wang, Hongming Shan, Yang Chen, Yi Zhang |
| 2025 | CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model. | Ziyu Yao, Xuxin Cheng, Zhiqi Huang, Lei Li |
| 2025 | Spotting the Unexpected (STU): A 3D LiDAR Dataset for Anomaly Segmentation in Autonomous Driving. | Alexey Nekrasov, Malcolm Burdorf, Stewart Worrall, Bastian Leibe, Julie Stephany Berrio Perez |
| 2025 | Boosting Point-Supervised Temporal Action Localization through Integrating Query Reformation and Optimal Transport. | Mengnan Liu, Le Wang, Sanping Zhou, Kun Xia, Xiaolong Sun, Gang Hua |
| 2025 | OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection. | Shuming Liu, Chen Zhao, Fatimah Zohra, Mattia Soldan, Alejandro Pardo, Mengmeng Xu, Lama Alssum, Merey Ramazanova, Juan Len Alczar, Anthony Cioppa, Silvio Giancola, Carlos Hinojosa, Bernard Ghanem |
| 2025 | Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves. | Shihan Wu, Ji Zhang, Pengpeng Zeng, Lianli Gao, Jingkuan Song, Heng Tao Shen |
| 2025 | Efficient Image Generation with Variadic Attention Heads. | Steven Walton, Ali Hassani, Xingqian Xu, Zhangyang Wang, Humphrey Shi |
| 2025 | MMVU: Measuring Expert-Level Multi-Discipline Video Understanding. | Yilun Zhao, Haowei Zhang, Lujing Xie, Tongyan Hu, Guo Gan, Yitao Long, Zhiyuan Hu, Weiyuan Chen, Chuhan Li, Zhijian Xu, Chengye Wang, Ziyao Shangguan, Zhenwen Liang, Yixin Liu, Chen Zhao, Arman Cohan |
| 2025 | BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding. | Shuming Liu, Chen Zhao, Tianqi Xu, Bernard Ghanem |
| 2025 | Remote Photoplethysmography in Real-World and Extreme Lighting Scenarios. | Hang Shao, Lei Luo, Jianjun Qian, Mengkai Yan, Shuo Chen, Jian Yang |
| 2025 | PERSE: Personalized 3D Generative Avatars from A Single Portrait. | Hyunsoo Cha, Inhee Lee, Hanbyul Joo |
| 2025 | Decoder Gradient Shield: Provable and High-Fidelity Prevention of Gradient-Based Box-Free Watermark Removal. | Haonan An, Guang Hua, Zhengru Fang, Guowen Xu, Susanto Rahardja, Yuguang Fang |
| 2025 | ReDiffDet: Rotation-equivariant Diffusion Model for Oriented Object Detection. | Jiaqi Zhao, Zeyu Ding, Yong Zhou, Hancheng Zhu, Wen-Liang Du, Rui Yao |
| 2025 | ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models. | Junzhe Chen, Tianshu Zhang, Shiyu Huang, Yuwei Niu, Linfeng Zhang, Lijie Wen, Xuming Hu |
| 2025 | Self-Expansion of Pre-trained Models with Mixture of Adapters for Continual Learning. | Huiyi Wang, Haodong Lu, Lina Yao, Dong Gong |
| 2024 | CroSpace6D: Leveraging Geometric and Motion Cues for High-Precision Cross-Domain 6DoF Pose Estimation for Non-Cooperative Spacecrafts. | Jianhong Zuo, Shengyang Zhang, Qianyu Zhang, Yutao Zhao, Baichuan Liu, Aodi Wu, Xue Wan, Leizheng Shu, Guohua Kang |
| 2024 | UFineBench: Towards Text-based Person Retrieval with Ultra-fine Granularity. | Jialong Zuo, Hanyu Zhou, Ying Nie, Feng Zhang, Tianyu Guo, Nong Sang, Yunhe Wang, Changxin Gao |
| 2024 | Loose Inertial Poser: Motion Capture with IMU-attached Loose-Wear Jacket. | Chengxu Zuo, Yiming Wang, Lishuang Zhan, Shihui Guo, Xinyu Yi, Feng Xu, Yipeng Qin |
| 2024 | Robust and Explainable Fine-Grained Visual Classification with Transfer Learning: A Dual-Carriageway Framework. | Zheming Zuo, Joseph Smith, Jonathan Stonehouse, Boguslaw Obara |
| 2024 | VAREN: Very Accurate and Realistic Equine Network. | Silvia Zuffi, Ylva Mellbin, Ci Li, Markus Hschle, Hedvig Kjellstrm, Senya Polikovsky, Elin Hernlund, Michael J. Black |
| 2024 | State Space Models for Event Cameras. | Nikola Zubic, Mathias Gehrig, Davide Scaramuzza |
| 2024 | Multi-angle Consistent Generative NeRF with Additive Angular Margin Momentum Contrastive Learning. | Hang Zou, Hui Zhang, Yuan Zhang, Hui Ma, Dexin Zhao, Qi Zhang, Qi Li |