VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model.
Beichen Wang, Juexiao Zhang, Shuwen Dong, Irving Fang, Chen Feng
Browse the full IROS paper archive.
Beichen Wang, Juexiao Zhang, Shuwen Dong, Irving Fang, Chen Feng
Browse the full IROS paper archive.