| 2026 | WACV | Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising. | Yan-Bo Lin, Kevin Lin, Zhengyuan Yang, Linjie Li, Jianfeng Wang, Chung-Ching Lin, Xiaofei Wang, Gedas Bertasius, Lijuan Wang |
| 2025 | WACV | Dam: Dynamic Adapter Merging for Continual Video QA Learning. | Feng Cheng, Ziyang Wang, Yi-Lin Sung, Yan-Bo Lin, Mohit Bansal, Gedas Bertasius |
| 2025 | WACV | VMAs: Video-to-Music Generation via Semantic Alignment in Web Music Videos. | Yan-Bo Lin, Yu Tian, Linjie Yang, Gedas Bertasius, Heng Wang |
| 2024 | ECCV | Siamese Vision Transformers are Scalable Audio-Visual Learners. | Yan-Bo Lin, Gedas Bertasius |
| 2023 | CVPR | Vision Transformers are Parameter-Efficient Audio-Visual Learners. | Yan-Bo Lin, Yi-Lin Sung, Jie Lei, Mohit Bansal, Gedas Bertasius |
| 2022 | ECCV | EclipSE: Efficient Long-Range Video Retrieval Using Sight and Sound. | Yan-Bo Lin, Jie Lei, Mohit Bansal, Gedas Bertasius |
| 2021 | AAAI | Exploiting Audio-Visual Consistency with Partial Supervision for Spatial Audio Generation. | Yan-Bo Lin, Yu-Chiang Frank Wang |
| 2020 | ACCV | Audiovisual Transformer with Instance Attention for Audio-Visual Event Localization. | Yan-Bo Lin, Yu-Chiang Frank Wang |
| 2019 | ICASSP | Dual-modality Seq2Seq Network for Audio-visual Event Localization. | Yan-Bo Lin, Yu-Jhe Li, Yu-Chiang Frank Wang |
| 2019 | ICCV | Cross-Dataset Person Re-Identification via Unsupervised Pose Disentanglement and Adaptation. | Yu-Jhe Li, Ci-Siang Lin, Yan-Bo Lin, Yu-Chiang Frank Wang |