Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding.
Yunjia Xi, Hangyu Wang, Bo Chen, Jianghao Lin, Menghui Zhu, Weiwen Liu, Ruiming Tang, Zhewei Wei, Weinan Zhang, Yong Yu
Browse the full SIGIR paper archive.