ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework.
Kai Qin, Liangxin Liu, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Houde Liu, Daiting Shi
Browse the full ACL paper archive.