UNeMo: Collaborative Visual-Language Reasoning and Navigation via a Multimodal World Model.
Changxin Huang, Lv Tang, Zhaohuan Zhan, Lisha Yu, Runhao Zeng, Zun Liu, Zhengjie Wang, Jianqiang Li
Browse the full AAAI paper archive.
Changxin Huang, Lv Tang, Zhaohuan Zhan, Lisha Yu, Runhao Zeng, Zun Liu, Zhengjie Wang, Jianqiang Li
Browse the full AAAI paper archive.