Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models.
Chen Wang, Fei Xia, Wenhao Yu, Tingnan Zhang, Ruohan Zhang, C. Karen Liu, Li Fei-Fei, Jie Tan, Jacky Liang
Browse the full ICRA paper archive.