Skip to content

APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport.

Zhuo Li, Yuege Feng, Dandan Guo, Jinpeng Hu, Anningzhe Gao, Xiang Wan

VenueA*EMNLP
Year2025
ProceedingsEMNLP

Browse the full EMNLP paper archive.