Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling.
Hritik Bansal, Arian Hosseini, Rishabh Agarwal, Vinh Q. Tran, Mehran Kazemi
Browse the full ICLR paper archive.
Hritik Bansal, Arian Hosseini, Rishabh Agarwal, Vinh Q. Tran, Mehran Kazemi
Browse the full ICLR paper archive.