PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference.
Krishna Teja Chitty-Venkata, Jie Ye, Siddhisanket Raskar, Anthony Kougkas, Xian-He Sun, Murali Emani, Venkatram Vishwanath, Bogdan Nicolae
Browse the full EACL paper archive.