PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback.
Souradip Chakraborty, Amrit Singh Bedi, Alec Koppel, Huazheng Wang, Dinesh Manocha, Mengdi Wang, Furong Huang
Browse the full ICLR paper archive.
Souradip Chakraborty, Amrit Singh Bedi, Alec Koppel, Huazheng Wang, Dinesh Manocha, Mengdi Wang, Furong Huang
Browse the full ICLR paper archive.