Improving Reward Model Generalization from Adversarial Process Enhanced Preferences.
Zhilong Zhang, Tian Xu, Xinghao Du, Xingchen Cao, Yihao Sun, Yang Yu
Browse the full ICML paper archive.
Zhilong Zhang, Tian Xu, Xinghao Du, Xingchen Cao, Yihao Sun, Yang Yu
Browse the full ICML paper archive.