Weighted-Reward Preference Optimization for Implicit Model Fusion.
Ziyi Yang, Fanqi Wan, Longguang Zhong, Tianyuan Shi, Xiaojun Quan
Browse the full ICLR paper archive.
Ziyi Yang, Fanqi Wan, Longguang Zhong, Tianyuan Shi, Xiaojun Quan
Browse the full ICLR paper archive.