Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling.
Xianzhen Luo, Yixuan Wang, Qingfu Zhu, Zhiming Zhang, Xuanyu Zhang, Qing Yang, Dongliang Xu
Browse the full ACL paper archive.
Xianzhen Luo, Yixuan Wang, Qingfu Zhu, Zhiming Zhang, Xuanyu Zhang, Qing Yang, Dongliang Xu
Browse the full ACL paper archive.