Skip to content

VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation.

Wei Zhao, Pengxiang Ding, Min Zhang, Zhefei Gong, Shuanghao Bai, Han Zhao, Donglin Wang

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.