NaVLA$^2$: A Vision-Language-Audio-Action Model for Multimodal Instruction Navigation.
Jugang Fan, Peihao Chen, Changhao Li, Qing Du, Jian Chen, Mingkui Tan
Browse the full AAAI paper archive.
Jugang Fan, Peihao Chen, Changhao Li, Qing Du, Jian Chen, Mingkui Tan
Browse the full AAAI paper archive.