Skip to content

Safe RLHF: Safe Reinforcement Learning from Human Feedback.

Josef Dai, Xuehai Pan, Ruiyang Sun, Jiaming Ji, Xinbo Xu, Mickel Liu, Yizhou Wang, Yaodong Yang

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.