ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training.
Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi
Browse the full ACL paper archive.
Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi
Browse the full ACL paper archive.