Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization.
Juntao Dai, Taiye Chen, Yaodong Yang, Qian Zheng, Gang Pan
Browse the full ICLR paper archive.
Juntao Dai, Taiye Chen, Yaodong Yang, Qian Zheng, Gang Pan
Browse the full ICLR paper archive.