Skip to content

PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback.

Souradip Chakraborty, Amrit Singh Bedi, Alec Koppel, Huazheng Wang, Dinesh Manocha, Mengdi Wang, Furong Huang

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.