| 2025 | ICCV | Vid-Group: Temporal Video Grounding Pretraining from Unlabeled Videos in the Wild. | Peijun Bao, Chenqi Kong, Siyuan Yang, Zihao Shao, Xinghao Jiang, Boon Poh Ng, Meng Hwa Er, Alex Chichung Kot |
| 2024 | AAAI | Omnipotent Distillation with LLMs for Weakly-Supervised Natural Language Video Localization: When Divergence Meets Consistency. | Peijun Bao, Zihao Shao, Wenhan Yang, Boon Poh Ng, Meng Hwa Er, Alex C. Kot |
| 2024 | AAAI | Local-Global Multi-Modal Distillation for Weakly-Supervised Temporal Video Grounding. | Peijun Bao, Yong Xia, Wenhan Yang, Boon Poh Ng, Meng Hwa Er, Alex C. Kot |
| 2024 | ECCV | E3M: Zero-Shot Spatio-Temporal Video Grounding with Expectation-Maximization Multimodal Modulation. | Peijun Bao, Zihao Shao, Wenhan Yang, Boon Poh Ng, Alex C. Kot |
| 2023 | AAAI | Cross-Modal Label Contrastive Learning for Unsupervised Audio-Visual Event Localization. | Peijun Bao, Wenhan Yang, Boon Poh Ng, Meng Hwa Er, Alex C. Kot |
| 2021 | AAAI | Dense Events Grounding in Video. | Peijun Bao, Qian Zheng, Yadong Mu |
| 2021 | IJCAI | Learning 3-D Human Pose Estimation from Catadioptric Videos. | Chenchen Liu, Yongzhi Li, Kangqi Ma, Duo Zhang, Peijun Bao, Yadong Mu |