LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs.
Haoran Lou, Chunxiao Fan, Ziyan Liu, Yuexin Wu, Xinliang Wang
Browse the full ICCV paper archive.
Haoran Lou, Chunxiao Fan, Ziyan Liu, Yuexin Wu, Xinliang Wang
Browse the full ICCV paper archive.