Skip to content

Generative Verifiers: Reward Modeling as Next-Token Prediction.

Lunjun Zhang, Arian Hosseini, Hritik Bansal, Mehran Kazemi, Aviral Kumar, Rishabh Agarwal

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.