Skip to content

CPPO: Continual Learning for Reinforcement Learning with Human Feedback.

Han Zhang, Yu Lei, Lin Gui, Min Yang, Yulan He, Hui Wang, Ruifeng Xu

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.