MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention Across Vision-Language Models.
Xiaoran Fan, Zhichao Sun, Tao Ji, Lixing Shen, Tao Gui
Browse the full AAAI paper archive.
Xiaoran Fan, Zhichao Sun, Tao Ji, Lixing Shen, Tao Gui
Browse the full AAAI paper archive.