AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models.
Qi Liu, Jingqing Ruan, Hao Li, Haodong Zhao, Desheng Wang, Jiansong Chen, Guanglu Wan, Xunliang Cai, Zhi Zheng, Tong Xu
Browse the full ACL paper archive.