FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU.
Ying Sheng, Lianmin Zheng, Binhang Yuan, Zhuohan Li, Max Ryabinin, Beidi Chen, Percy Liang, Christopher R, Ion Stoica, Ce Zhang
Browse the full ICML paper archive.