Selective Preference Optimization via Token-Level Reward Function Estimation.
Kailai Yang, Zhiwei Liu, Qianqian Xie, Jimin Huang, Erxue Min, Sophia Ananiadou
Browse the full EMNLP paper archive.
Kailai Yang, Zhiwei Liu, Qianqian Xie, Jimin Huang, Erxue Min, Sophia Ananiadou
Browse the full EMNLP paper archive.