Scaling LLM Inference Efficiently with Optimized Sample Compute Allocation.
Kexun Zhang, Shang Zhou, Danqing Wang, William Yang Wang, Lei Li
Browse the full NAACL paper archive.
Kexun Zhang, Shang Zhou, Danqing Wang, William Yang Wang, Lei Li
Browse the full NAACL paper archive.