Enhancing Visual Understanding in Multimodal Large Language Models with Efficient Feature Alignment and State Space Models.
Wenjun Huang, Jiakai Pan, Jiahao Tang, Yifei Xing, Yuhe Wang, Zhengzhuo Wang, Shengzhi Shen, Jianguo Hu
Browse the full ECAI paper archive.