Token-Efficient VLM: High-Resolution Image Understanding Via Dynamic Region Proposal.
Yitong Jiang, Jinwei Gu, Tianfan Xue, Ka Chun Cheung, Pavlo Molchanov, Hongxu Yin, Sifei Liu
Browse the full ICCV paper archive.
Yitong Jiang, Jinwei Gu, Tianfan Xue, Ka Chun Cheung, Pavlo Molchanov, Hongxu Yin, Sifei Liu
Browse the full ICCV paper archive.