APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport.
Zhuo Li, Yuege Feng, Dandan Guo, Jinpeng Hu, Anningzhe Gao, Xiang Wan
Browse the full EMNLP paper archive.
Zhuo Li, Yuege Feng, Dandan Guo, Jinpeng Hu, Anningzhe Gao, Xiang Wan
Browse the full EMNLP paper archive.