CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge.
Chunlin Tian, Xinpeng Qin, Kahou Tam, Li Li, Zijian Wang, Yuanzhe Zhao, Minglei Zhang, Chengzhong Xu
Browse the full USENIX paper archive.
Chunlin Tian, Xinpeng Qin, Kahou Tam, Li Li, Zijian Wang, Yuanzhe Zhao, Minglei Zhang, Chengzhong Xu
Browse the full USENIX paper archive.