Skip to content

FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU.

Ying Sheng, Lianmin Zheng, Binhang Yuan, Zhuohan Li, Max Ryabinin, Beidi Chen, Percy Liang, Christopher R, Ion Stoica, Ce Zhang

VenueA*ICML
Year2023
ProceedingsICML

Browse the full ICML paper archive.