Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models.
Yinlam Chow, Guy Tennenholtz, Izzeddin Gur, Vincent Zhuang, Bo Dai, Aviral Kumar, Rishabh Agarwal, Sridhar Thiagarajan, Craig Boutilier, Aleksandra Faust
Browse the full ICLR paper archive.