Skip to content

GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-Time Alignment.

Yuancheng Xu, Udari Madhushani Sehwag, Alec Koppel, Sicheng Zhu, Bang An, Furong Huang, Sumitra Ganesh

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.