Skip to content

LLM in a flash: Efficient Large Language Model Inference with Limited Memory.

Keivan Alizadeh, Iman Mirzadeh, Dmitry Belenko, S. Khatamifard, Minsik Cho, Carlo C. del Mundo, Mohammad Rastegari, Mehrdad Farajtabar

VenueA*ACL
Year2024
ProceedingsACL (1)

Browse the full ACL paper archive.