VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation.
Wei Zhao, Pengxiang Ding, Min Zhang, Zhefei Gong, Shuanghao Bai, Han Zhao, Donglin Wang
Browse the full ICLR paper archive.
Wei Zhao, Pengxiang Ding, Min Zhang, Zhefei Gong, Shuanghao Bai, Han Zhao, Donglin Wang
Browse the full ICLR paper archive.