Turbo: Efficiently Serving Long-Context Large Language Models with In-Network Aggregation.
Ying Wan, Yuchen Xu, Chuwen Zhang, Yingsheng Huang, Yong Feng, Wenquan Xu, Jialin Li, Mingwei Xu, Wenfei Wu, Congcong Miao
Browse the full SIGCOMM paper archive.