Skip to content

V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding.

Junqi Ge, Ziyi Chen, Jintao Lin, Jinguo Zhu, Xihui Liu, Jifeng Dai, Xizhou Zhu

VenueA*ICCV
Year2025
ProceedingsICCV

Browse the full ICCV paper archive.