PAPI: Exploiting Dynamic Parallelism in Large Language Model Decoding with a Processing-In-Memory-Enabled Computing System.
Yintao He, Haiyu Mao, Christina Giannoula, Mohammad Sadrosadati, Juan Gmez-Luna, Huawei Li, Xiaowei Li, Ying Wang, Onur Mutlu
Browse the full ASPLOS paper archive.