DORM: Preference Data Weights Optimization for Reward Modeling in LLM Alignment.
Rongzhi Zhang, Chenwei Zhang, Xinyang Zhang, Liang Qiu, Haoming Jiang, Yuchen Zhuang, Qingru Zhang, Hyokun Yun, Xian Li, Bing Yin, Tuo Zhao, Chao Zhang
Browse the full EMNLP paper archive.