| 2025 | Joint Diffusion Models in Continual Learning. | Pawel Skiers, Kamil Deja |
| 2025 | Generalized Tensor-Based Parameter-Efficient Fine-Tuning via Lie Group Transformations. | Chongjie Si, Zhiyi Shi, Xuehui Wang, Yichen Xiao, Xiaokang Yang, Wei Shen |
| 2025 | DIP: Unsupervised Dense In-Context Post-Training of Visual Representations. | Sophia Sirko-Galouchenko, Spyros Gidaris, Antonn Vobeck, Andrei Bursuc, Nicolas Thome |
| 2025 | Ditailistener: Controllable High Fidelity Listener Video Generation with Diffusion. | Maksim Siniukov, Di Chang, Minh Tran, Hongkun Gong, Ashutosh Chaubey, Mohammad Soleymani |
| 2025 | FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models. | Mainak Singha, Subhankar Roy, Sarthak Mehrotra, Ankit Jha, Moloud Abdar, Biplab Banerjee, Elisa Ricci |
| 2025 | Adapting Curricula by Tracking the Gap between Validation and Training Loss. | Raghavendra Singh |
| 2025 | UIP2P: Unsupervised Instruction-Based Image Editing via Edit Reversibility Constraint. | Enis Simsar, Alessio Tonioni, Yongqin Xian, Thomas Hofmann, Federico Tombari |
| 2025 | TITAN-Guide: Taming Inference-Time Alignment for Guided Text-to-Video Diffusion Models. | Christian Simon, Masato Ishii, Akio Hayakawa, Zhi Zhong, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji |
| 2025 | Towards Proactive Social Robots: Distilling Visual Knowledge from Large Vision-Language Models. | Giuseppe De Simone, Loris Roveda, Alessia Saggese, Mario Vento |
| 2025 | Easy3D: A Simple Yet Effective Method for 3D Interactive Segmentation. | Andrea Simonelli, Norman Mller, Peter Kontschieder |
| 2025 | PERSONA: Personalized Whole-Body 3D Avatar with Pose-Driven Deformations from a Single Image. | Geonhee Sim, Gyeongsik Moon |
| 2025 | Iterative Binary Training. | Vitor da Silva, Rosana Toms, Fernando Cores, Francesc Gin |
| 2025 | You Share Beliefs, I Adapt: Progressive Heterogeneous Collaborative Perception. | Hao Si, Ehsan Javanmardi, Manabu Tsukada |
| 2025 | Recovering Parametric Scenes from Very Few Time-of-Flight Pixels. | Carter Sifferman, Yiquan Li, Yiming Li, Fangzhou Mu, Michael Gleicher, Mohit Gupta, Yin Li |
| 2025 | CutS3D: Cutting Semantics in 3D for 2D Unsupervised Instance Segmentation. | Leon Sick, Dominik Engel, Sebastian Hartwig, Pedro Hermosilla, Timo Ropinski |
| 2025 | Scaling Open-Vocabulary Action Detection. | Zhen Hao Sia, Yogesh Singh Rawat |
| 2025 | Audio-Visual LLM for Video Understanding. | Fangxun Shu, Lei Zhang, Hao Jiang, Cihang Xie |
| 2025 | Scaling Laws for Native Multimodal Models. | Mustafa Shukor, Enrico Fini, Victor Guilherme Turrisi da Costa, Matthieu Cord, Joshua M. Susskind, Alaaeldin El-Nouby |
| 2025 | Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation. | Xincheng Shuai, Henghui Ding, Zhenyuan Qin, Hao Luo, Xingjun Ma, Dacheng Tao |
| 2025 | Unsupervised Rgb-D Point Cloud Registration for Scenes With Low Overlap and Photometric Inconsistency. | Yejun Shou, Haocheng Wang, Lingfeng Shen, Qian Zheng, Gang Pan, Yanlong Cao |
| 2025 | Graph Domain Adaptation With Dual-Branch Encoder and Two-Level Alignment for Whole Slide Image-Based Survival Prediction. | Yuntao Shou, Xiangyong Cao, Peiqiang Yan, Qiaohui, Qian Zhao, Deyu Meng |
| 2025 | Lark: Low-Rank Updates After Knowledge Localization for Few-Shot Class-Incremental Learning. | Jinxin Shi, Jiabao Zhao, Yifan Yang, Xingjiao Wu, Jiawen Li, Liang He |
| 2025 | PVChat: Personalized Video Chat with One-Shot Learning. | Yufei Shi, Weilong Yan, Gang Xu, Yumeng Li, Yucheng Chen, Zhenxi Li, Fei Yu, Ming Li, Si Yong Yeo |
| 2025 | Multi-Schema Proximity Network for Composed Image Retrieval. | Jiangming Shi, Xiangbo Yin, Yeyun Chen, Yachao Zhang, Zhizhong Zhang, Yuan Xie, Yanyun Qu |
| 2025 | Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer. | Qingyu Shi, Jianzong Wu, Jinbin Bai, Jiangning Zhang, Lu Qi, Yunhai Tong, Xiangtai Li |