Skip to content

Unveiling Inherent Visual Grounding in Multimodal LLMs for Text-Rich Images.

Shijie Zhou, Jihyung Kil, Ming Li, Jiuxiang Gu, Curtis Wigington, Rajiv Jain, Changyou Chen, Ruiyi Zhang

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.