Skip to content

COPR: Continual Human Preference Learning via Optimal Policy Regularization.

Han Zhang, Lin Gui, Yu Lei, Yuanzhao Zhai, Yehong Zhang, Zhuo Zhang, Yulan He, Hui Wang, Yue Yu, Kam-Fai Wong, Bin Liang, Ruifeng Xu

VenueA*ACL
Year2025
ProceedingsACL (Findings)

Browse the full ACL paper archive.