Skip to content

Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models.

Chen Wang, Fei Xia, Wenhao Yu, Tingnan Zhang, Ruohan Zhang, C. Karen Liu, Li Fei-Fei, Jie Tan, Jacky Liang

VenueA*ICRA
Year2025
ProceedingsICRA

Browse the full ICRA paper archive.