Skip to content

NaVLA$^2$: A Vision-Language-Audio-Action Model for Multimodal Instruction Navigation.

Jugang Fan, Peihao Chen, Changhao Li, Qing Du, Jian Chen, Mingkui Tan

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.