Skip to content

Constraint-aware and Ranking-distilled Token Pruning for Efficient Transformer Inference.

Junyan Li, Li Lyna Zhang, Jiahang Xu, Yujing Wang, Shaoguang Yan, Yunqing Xia, Yuqing Yang, Ting Cao, Hao Sun, Weiwei Deng, Qi Zhang, Mao Yang

VenueA*KDD
Year2023
ProceedingsKDD

Browse the full KDD paper archive.