Skip to content

Selective Preference Optimization via Token-Level Reward Function Estimation.

Kailai Yang, Zhiwei Liu, Qianqian Xie, Jimin Huang, Erxue Min, Sophia Ananiadou

VenueA*EMNLP
Year2025
ProceedingsEMNLP

Browse the full EMNLP paper archive.