Reward Difference Optimization For Sample Reweighting In Offline RLHF.
Shiqi Wang, Zhengze Zhang, Rui Zhao, Fei Tan, Cam-Tu Nguyen
Browse the full EMNLP paper archive.
Shiqi Wang, Zhengze Zhang, Rui Zhao, Fei Tan, Cam-Tu Nguyen
Browse the full EMNLP paper archive.