Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization.
Junkang Wu, Yuexiang Xie, Zhengyi Yang, Jiancan Wu, Jiawei Chen, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He
Browse the full ICLR paper archive.