Lil: Less is Less When Applying Post-Training Sparse-Attention Algorithms in Long-Decode Stage.
Junhao Hu, Fangze Li, Mingtao Xu, Feifan Meng, Shiju Zhao, Tiancheng Hu, Ting Peng, Anmin Liu, Wenrui Huang, Chenxu Liu, Ziyue Hua, Tao Xie
Browse the full ACL paper archive.