CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance.
Jinming Li, Yichen Zhu, Zhibin Tang, Junjie Wen, Minjie Zhu, Xiaoyu Liu, Chengmeng Li, Ran Cheng, Yaxin Peng, Yan Peng, Feifei Feng
Browse the full ICCV paper archive.