SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes.
Chuhan Wang, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian J. McAuley, Jingbo Shang
Browse the full ACL paper archive.
Chuhan Wang, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian J. McAuley, Jingbo Shang
Browse the full ACL paper archive.