It Takes Two: Embracing Sparsity and Speculative Decoding for Efficient LLM Inference.
Haolin Chu, Changyu Chen, Wei Liu, Jian Luan, Jiabin Deng, Liang Liu, Huadong Ma, Xiaolong Zheng
Browse the full IWQoS paper archive.
Haolin Chu, Changyu Chen, Wei Liu, Jian Luan, Jiabin Deng, Liang Liu, Huadong Ma, Xiaolong Zheng
Browse the full IWQoS paper archive.