SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models.
Jun Rao, Yunjie Liao, Xuebo Liu, Zepeng Lin, Lian Lian, Dong Jin, Shengjun Cheng, Jun Yu, Min Zhang
Browse the full EMNLP paper archive.
Jun Rao, Yunjie Liao, Xuebo Liu, Zepeng Lin, Lian Lian, Dong Jin, Shengjun Cheng, Jun Yu, Min Zhang
Browse the full EMNLP paper archive.