Skip to content

AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization.

Junkang Wu, Xue Wang, Zhengyi Yang, Jiancan Wu, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.