Joint Reward and Policy Learning with Demonstrations and Human Feedback Improves Alignment.
Chenliang Li, Siliang Zeng, Zeyi Liao, Jiaxiang Li, Dongyeop Kang, Alfredo Garca, Mingyi Hong
Browse the full ICLR paper archive.
Chenliang Li, Siliang Zeng, Zeyi Liao, Jiaxiang Li, Dongyeop Kang, Alfredo Garca, Mingyi Hong
Browse the full ICLR paper archive.