Optimizing GPU Multiplexing for Efficient and Cost-Effective Access to Diverse Large Language Models in GPU Clusters.
Yue Zhu, Chen Wang, Max Calman, Rina Nakazawa, Eun Kyung Lee
Browse the full MASCOTS paper archive.
Yue Zhu, Chen Wang, Max Calman, Rina Nakazawa, Eun Kyung Lee
Browse the full MASCOTS paper archive.