| 2025 | CVPR | Understanding Multi-Task Activities from Single-Task Videos. | Yuhan Shen, Ehsan Elhamifar |
| 2025 | ICCV | MOSCATO: Predicting Multiple Object State Change through Actions. | Parnian Zameni, Yuhan Shen, Ehsan Elhamifar |
| 2024 | CVPR | Progress-Aware Online Action Segmentation for Egocentric Procedural Task Videos. | Yuhan Shen, Ehsan Elhamifar |
| 2024 | CVPR | Learning to Segment Referred Objects from Narrated Egocentric Videos. | Yuhan Shen, Huiyu Wang, Xitong Yang, Matt Feiszli, Ehsan Elhamifar, Lorenzo Torresani, Effrosyni Mavroudi |
| 2024 | CVPR | Exploring the Role of Audio in Video Captioning. | Yuhan Shen, Linjie Yang, Longyin Wen, Haichao Yu, Ehsan Elhamifar, Heng Wang |
| 2022 | CVPR | Semi-Weakly-Supervised Learning of Complex Actions from Instructional Task Videos. | Yuhan Shen, Ehsan Elhamifar |
| 2021 | CVPR | Learning To Segment Actions From Visual and Language Instructions via Differentiable Weak Sequence Alignment. | Yuhan Shen, Lu Wang, Ehsan Elhamifar |
| 2020 | ICASSP | Staged Training Strategy and Multi-Activation for Audio Tagging with Noisy and Sparse Multi-Label Data. | Kexin He, Yuhan Shen, Wei-Qiang Zhang, Jia Liu |