Skip to content

Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model.

Wenhong Zhu, Zhiwei He, Xiaofeng Wang, Pengfei Liu, Rui Wang

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.