Memory-Efficient KV Cache Optimization for Large Language Model Inference at the Edge.
Chi Zhang, Haisheng Tan, Haotian Pan, Yang Xu, Haohua Du, Li Zhang, Xiaoming Fu
Browse the full INFOCOM paper archive.
Chi Zhang, Haisheng Tan, Haotian Pan, Yang Xu, Haohua Du, Li Zhang, Xiaoming Fu
Browse the full INFOCOM paper archive.