CPPO: Continual Learning for Reinforcement Learning with Human Feedback.
Han Zhang, Yu Lei, Lin Gui, Min Yang, Yulan He, Hui Wang, Ruifeng Xu
Browse the full ICLR paper archive.
Han Zhang, Yu Lei, Lin Gui, Min Yang, Yulan He, Hui Wang, Ruifeng Xu
Browse the full ICLR paper archive.