Skip to content

Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization.

Junkang Wu, Yuexiang Xie, Zhengyi Yang, Jiancan Wu, Jiawei Chen, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.