Skip to content

RazorAttention: Efficient KV Cache Compression Through Retrieval Heads.

Hanlin Tang, Yang Lin, Jing Lin, Qingsen Han, Danning Ke, Shikuan Hong, Yiwu Yao, Gongyi Wang

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.