| 2026 | AAAI | DLVINet: Advancing Dual-Lens Video Inpainting Beyond Parallax Constraints. | Zhiliang Wu, Kun Li, Yunqiu Xu, Hehe Fan, Yi Yang |
| 2026 | ACL | One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement. | Yixiao Zhou, Dongzhou Cheng, Zhiliang Wu, Yi Yang, Yu Cheng, Hehe Fan |
| 2026 | WWW | GraphTARIF: Linear Graph Transformer with Augmented Rank and Improved Focus. | Zhaolin Hu, Kun Li, Hehe Fan, Yi Yang |
| 2026 | SIGIR | RegionSLM: Region-aware Question Answering on Document Screenshots. | Chao Wang, Hehe Fan, Huichen Yang, Sarvnaz Karimi, Lina Yao, Yi Yang |
| 2025 | AAAI | ZeroMamba: Exploring Visual State Space Model for Zero-Shot Learning. | Wenjin Hou, Dingjie Fu, Kun Li, Shiming Chen, Hehe Fan, Yi Yang |
| 2025 | AAAI | Prototypical Calibrating Ambiguous Samples for Micro-Action Recognition. | Kun Li, Dan Guo, Guoliang Chen, Chunxiao Fan, Jingyuan Xu, Zhiliang Wu, Hehe Fan, Meng Wang |
| 2025 | CVPR | Adapting Text-to-Image Generation with Feature Difference Instruction for Generic Image Restoration. | Chao Wang, Hehe Fan, Huichen Yang, Sarvnaz Karimi, Lina Yao, Yi Yang |
| 2025 | CVPR | EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space. | Jianrong Zhang, Hehe Fan, Yi Yang |
| 2025 | CVPR | Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion. | Zhenglin Zhou, Fan Ma, Hehe Fan, Tat-Seng Chua |
| 2025 | EMNLP | Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs. | Yixiao Zhou, Ziyu Zhao, Dongzhou Cheng, Zhiliang Wu, Jie Gui, Yi Yang, Fei Wu, Yu Cheng, Hehe Fan |
| 2025 | ICCV | MMAD: Multi-Label Micro-Action Detection in Videos. | Kun Li, Pengyu Liu, Dan Guo, Fei Wang, Zhiliang Wu, Hehe Fan, Meng Wang |
| 2025 | ICCV | BVINet: Unlocking Blind Video Inpainting With Zero Annotations. | Zhiliang Wu, Kerui Chen, Kun Li, Hehe Fan, Yi Yang |
| 2025 | ICCV | InfiniDreamer: Arbitrarily Long Human Motion Generation Via Segment Score Distillation. | Wenjie Zhuo, Fan Ma, Hehe Fan |
| 2025 | ICLR | OSDA Agent: Leveraging Large Language Models for De Novo Design of Organic Structure Directing Agents. | Zhaolin Hu, Yixiao Zhou, Zhongan Wang, Xin Li, Weimin Yang, Hehe Fan, Yi Yang |
| 2025 | ICLR | VideoGrain: Modulating Space-Time Attention for Multi-Grained Video Editing. | Xiangpeng Yang, Linchao Zhu, Hehe Fan, Yi Yang |
| 2025 | ICML | Reaction Graph: Towards Reaction-Level Modeling for Chemical Reactions with 3D Structures. | Yingzhao Jian, Yue Zhang, Ying Wei, Hehe Fan, Yi Yang |
| 2025 | ICML | DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization. | Zhenglin Zhou, Xiaobo Xia, Fan Ma, Hehe Fan, Yi Yang, Tat-Seng Chua |
| 2025 | IJCAI | Prompt-Aware Controllable Shadow Removal. | Kerui Chen, Zhiliang Wu, Wenjin Hou, Kun Li, Hehe Fan, Yi Yang |
| 2025 | IJCAI | Drafting and Revision: Advancing High-Fidelity Video Inpainting. | Zhiliang Wu, Kun Li, Hehe Fan, Yi Yang |
| 2025 | SIGIR | ProtChatGPT: Towards Understanding Proteins with Hybrid Representation and Large Language Models. | Chao Wang, Hehe Fan, Ruijie Quan, Lina Yao, Yi Yang |
| 2024 | AAAI | DocMSU: A Comprehensive Benchmark for Document-Level Multimodal Sarcasm Understanding. | Hang Du, Guoshun Nan, Sicheng Zhang, Binzhu Xie, Junrui Xu, Hehe Fan, Qimei Cui, Xiaofeng Tao, Xudong Jiang |
| 2024 | AAAI | Hand-Centric Motion Refinement for 3D Hand-Object Interaction via Hierarchical Spatial-Temporal Modeling. | Yuze Hao, Jianrong Zhang, Tao Zhuo, Fuan Wen, Hehe Fan |
| 2024 | CVPR | Uncovering what, why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly. | Hang Du, Sicheng Zhang, Binzhu Xie, Guoshun Nan, Jiayang Zhang, Junrui Xu, Hangyu Liu, Sicong Leng, Jiangming Liu, Hehe Fan, Dajiu Huang, Jing Feng, Linli Chen, Can Zhang, Xuhuan Li, Hao Zhang, Jianhang Chen, Qimei Cui, Xiaofeng Tao |
| 2024 | CVPR | Clustering for Protein Representation Learning. | Ruijie Quan, Wenguan Wang, Fan Ma, Hehe Fan, Yi Yang |
| 2024 | ECCV | HeadStudio: Text to Animatable Head Avatars with 3D Gaussian Splatting. | Zhenglin Zhou, Fan Ma, Hehe Fan, Zongxin Yang, Yi Yang |
| 2024 | ECCV | VividDreamer: Invariant Score Distillation for Hyper-Realistic Text-to-3D Generation. | Wenjie Zhuo, Fan Ma, Hehe Fan, Yi Yang |
| 2024 | ICML | Improving Context Understanding in Multimodal Large Language Models via Multimodal Composition Learning. | Wei Li, Hehe Fan, Yongkang Wong, Yi Yang, Mohan S. Kankanhalli |
| 2023 | AAAI | SEFormer: Structure Embedding Transformer for 3D Object Detection. | Xiaoyu Feng, Heming Du, Hehe Fan, Yueqi Duan, Yongpan Liu |
| 2023 | AAAI | Text to Point Cloud Localization with Relation-Enhanced Transformer. | Guangzhi Wang, Hehe Fan, Mohan S. Kankanhalli |
| 2023 | CVPR | PointListNet: Deep Learning on 3D Point Lists. | Hehe Fan, Linchao Zhu, Yi Yang, Mohan S. Kankanhalli |
| 2023 | ICCV | STPrivacy: Spatio-Temporal Privacy-Preserving Action Recognition. | Ming Li, Xiangyu Xu, Hehe Fan, Pan Zhou, Jun Liu, Jia-Wei Liu, Jiahe Li, Jussi Keppo, Mike Zheng Shou, Shuicheng Yan |
| 2023 | ICCV | Point Contrastive Prediction with Semantic Clustering for Self-Supervised Learning on Point Cloud Videos. | Xiaoxiao Sheng, Zhiqiang Shen, Gang Xiao, Longguang Wang, Yulan Guo, Hehe Fan |
| 2023 | ICCV | Masked Spatio-Temporal Structure Prediction for Self-supervised Learning on Point Cloud Videos. | Zhiqiang Shen, Xiaoxiao Sheng, Hehe Fan, Longguang Wang, Yulan Guo, Qiong Liu, Hao Wen, Xi Zhou |
| 2023 | ICLR | Continuous-Discrete Convolution for Geometry-Sequence Modeling in Proteins. | Hehe Fan, Zhangyang Wang, Yi Yang, Mohan S. Kankanhalli |
| 2022 | CVPR | Self-Supervised Global-Local Structure Modeling for Point Cloud Domain Adaptation with Reliable Voted Pseudo Labels. | Hehe Fan, Xiaojun Chang, Wanyue Zhang, Yi Cheng, Ying Sun, Mohan S. Kankanhalli |
| 2022 | ECCV | Point Cloud Domain Adaptation via Masked Local 3D Structure Prediction. | Hanxue Liang, Hehe Fan, Zhiwen Fan, Yi Wang, Tianlong Chen, Yu Cheng, Zhangyang Wang |
| 2021 | CVPR | Point 4D Transformer Networks for Spatio-Temporal Modeling in Point Cloud Videos. | Hehe Fan, Yi Yang, Mohan S. Kankanhalli |
| 2021 | ICLR | PSTNet: Point Spatio-Temporal Convolution on Point Cloud Sequences. | Hehe Fan, Xin Yu, Yuhang Ding, Yi Yang, Mohan S. Kankanhalli |
| 2020 | AAAI | Person Tube Retrieval via Language Description. | Hehe Fan, Yi Yang |
| 2019 | AAAI | Cubic LSTMs for Video Prediction. | Hehe Fan, Linchao Zhu, Yi Yang |
| 2019 | ICCV | Attract or Distract: Exploit the Margin of Open Set. | Qianyu Feng, Guoliang Kang, Hehe Fan, Yi Yang |
| 2018 | IJCAI | Watching a Small Portion could be as Good as Watching All: Towards Efficient Video Classification. | Hehe Fan, Zhongwen Xu, Linchao Zhu, Chenggang Yan, Jianjun Ge, Yi Yang |
| 2017 | ICCV | Complex Event Detection by Identifying Reliable Shots from Untrimmed Videos. | Hehe Fan, Xiaojun Chang, De Cheng, Yi Yang, Dong Xu, Alexander G. Hauptmann |