Skip to content

InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management.

Wonbeom Lee, Jungi Lee, Junghwan Seo, Jaewoong Sim

VenueA*OSDI
Year2024
ProceedingsOSDI

Browse the full OSDI paper archive.