Skip to content

TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill & Decode Inference.

Xiaojuan Tang, Fanxu Meng, Pingzhi Tang, Yuxuan Wang, Di Yin, Xing Sun, Muhan Zhang

Year2026
ProceedingsASPLOS (2)

Browse the full ASPLOS paper archive.