| 2024 | FedTSA: A Cluster-Based Two-Stage Aggregation Method for Model-Heterogeneous Federated Learning. | Boyu Fan, Chenrui Wu, Xiang Su, Pan Hui |
| 2024 | Text-Guided Video Masked Autoencoder. | David Fan, Jue Wang, Shuai Liao, Zhikang Zhang, Vimal Bhat, Xinyu Li |
| 2024 | FreeMotion: A Unified Framework for Number-Free Text-to-Motion Synthesis. | Ke Fan, Junshu Tang, Weijian Cao, Ran Yi, Moran Li, Jingyu Gong, Jiangning Zhang, Yabiao Wang, Chengjie Wang, Lizhuang Ma |
| 2024 | Enhancing Plausibility Evaluation for Generated Designs with Denoising Autoencoder. | Jiajie Fan, Amal Trigui, Thomas Bck, Hao Wang |
| 2024 | Benchmarks and Challenges in Pose Estimation for Egocentric Hand Interactions with Objects. | Zicong Fan, Takehiko Ohkawa, Linlin Yang, Nie Lin, Zhishan Zhou, Shihao Zhou, Jiajun Liang, Zhong Gao, Xuanyang Zhang, Xue Zhang, Fei Li, Zheng Liu, Feng Lu, Karim Abou Zeid, Bastian Leibe, Jeongwan On, Seungryul Baek, Aditya Prakash, Saurabh Gupta, Kun He, Yoichi Sato, Otmar Hilliges, Hyung Jin Chang, Angela Yao |
| 2024 | 🤖 VideoAgent: A Memory-Augmented Multimodal Agent for Video Understanding. | Yue Fan, Xiaojian Ma, Rujie Wu, Yuntao Du, Jiaqi Li, Zhi Gao, Qing Li |
| 2024 | AdaDiffSR: Adaptive Region-Aware Dynamic Acceleration Diffusion Model for Real-World Image Super-Resolution. | Yuanting Fan, Chengxu Liu, Nengzhong Yin, Changlong Gao, Xueming Qian |
| 2024 | Navigation Instruction Generation with BEV Perception and Large Language Models. | Sheng Fan, Rui Liu, Wenguan Wang, Yi Yang |
| 2024 | Risk-Aware Self-consistent Imitation Learning for Trajectory Planning in Autonomous Driving. | Yixuan Fan, Yali Li, Shengjin Wang |
| 2024 | UniTalker: Scaling up Audio-Driven 3D Facial Animation Through A Unified Model. | Xiangyu Fan, Jiaqi Li, Zhiqian Lin, Weiye Xiao, Lei Yang |
| 2024 | Revisiting Adaptive Cellular Recognition Under Domain Shifts: A Contextual Correspondence View. | Jianan Fan, Dongnan Liu, Canran Li, Hang Chang, Heng Huang, Filip Braet, Mei Chen, Tom Weidong Cai |
| 2024 | Challenging Forgets: Unveiling the Worst-Case Forget Sets in Machine Unlearning. | Chongyu Fan, Jiancheng Liu, Alfred Olivier Hero, Sijia Liu |
| 2024 | Beyond Viewpoint: Robust 3D Object Recognition Under Arbitrary Views Through Joint Multi-part Representation. | Linlong Fan, Ye Huang, Yanqi Ge, Wen Li, Lixin Duan |
| 2024 | OAT: Object-Level Attention Transformer for Gaze Scanpath Prediction. | Yini Fang, Jingling Yu, Haozheng Zhang, Ralf van der Lans, Bertram E. Shi |
| 2024 | HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-Fine Pose-Reversible Guidance. | Guian Fang, Wenbiao Yan, Yuanfan Guo, Jianhua Han, Zutao Jiang, Hang Xu, Shengcai Liao, Xiaodan Liang |
| 2024 | Rethinking Weakly-Supervised Video Temporal Grounding From a Game Perspective. | Xiang Fang, Zeyu Xiong, Wanlong Fang, Xiaoye Qu, Chen Chen, Jianfeng Dong, Keke Tang, Pan Zhou, Yu Cheng, Daizong Liu |
| 2024 | Spiking Wavelet Transformer. | Yuetong Fang, Ziqing Wang, Lingfeng Zhang, Jiahang Cao, Honglei Chen, Renjing Xu |
| 2024 | Dropout Mixture Low-Rank Adaptation for Visual Parameters-Efficient Fine-Tuning. | Zhengyi Fang, Yue Wang, Ran Yi, Lizhuang Ma |
| 2024 | Chat-Edit-3D: Interactive 3D Scene Editing via Text Prompts. | Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Yi Yang, Wenrui Ding, Shuchang Zhou, Ming-Hsuan Yang |
| 2024 | Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation. | Hao Fang, Peng Wu, Yawei Li, Xinxin Zhang, Xiankai Lu |
| 2024 | Mini-Splatting: Representing Scenes with a Constrained Number of Gaussians. | Guangchi Fang, Bing Wang |
| 2024 | Isomorphic Pruning for Vision Models. | Gongfan Fang, Xinyin Ma, Michael Bi Mi, Xinchao Wang |
| 2024 | VP-SAM: Taming Segment Anything Model for Video Polyp Segmentation via Disentanglement and Spatio-Temporal Side Network. | Zhixue Fang, Yuzhi Liu, Huisi Wu, Jing Qin |
| 2024 | CLIP-Guided Generative Networks for Transferable Targeted Adversarial Attacks. | Hao Fang, Jiawei Kong, Bin Chen, Tao Dai, Hao Wu, Shu-Tao Xia |
| 2024 | VIDEOSHOP: Localized Semantic Video Editing with Noise-Extrapolated Diffusion Inversion. | Xiang Fan, Anand Bhattad, Ranjay Krishna |