| 2025 | CVPR | Contextual AD Narration with Interleaved Multimodal Sequence. | Hanlin Wang, Zhan Tong, Kecheng Zheng, Yujun Shen, Limin Wang |
| 2024 | CVPR | Bootstrapping SparseFormers from Vision Foundation Models. | Ziteng Gao, Zhan Tong, Kevin Qinghong Lin, Joya Chen, Mike Zheng Shou |
| 2024 | ICLR | SparseFormer: Sparse Visual Recognition via Limited Latent Tokens. | Ziteng Gao, Zhan Tong, Limin Wang, Mike Zheng Shou |
| 2023 | CVPR | VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking. | Limin Wang, Bingkun Huang, Zhiyu Zhao, Zhan Tong, Yinan He, Yi Wang, Yali Wang, Yu Qiao |
| 2023 | ICCV | Efficient Video Action Detection with Token Dropout and Context Refinement. | Lei Chen, Zhan Tong, Yibing Song, Gangshan Wu, Limin Wang |
| 2023 | ICLR | Soft Neighbors are Positive Supporters in Contrastive Visual Representation Learning. | Chongjian Ge, Jiangliu Wang, Zhan Tong, Shoufa Chen, Yibing Song, Ping Luo |
| 2022 | ICLR | EViT: Expediting Vision Transformers via Token Reorganizations. | Youwei Liang, Chongjian Ge, Zhan Tong, Yibing Song, Jue Wang, Pengtao Xie |
| 2021 | CVPR | TDN: Temporal Difference Networks for Efficient Action Recognition. | Limin Wang, Zhan Tong, Bin Ji, Gangshan Wu |
| 2021 | ICCV | MGSampler: An Explainable Sampling Strategy for Video Action Recognition. | Yuan Zhi, Zhan Tong, Limin Wang, Gangshan Wu |