GRAM-R²: Self-Training Generative Foundation Reward Models for Reward Reasoning.
Chenglong Wang, Yongyu Mu, Hang Zhou, Yifu Huo, Ziming Zhu, Jiali Zeng, Murun Yang, Bei Li, Xiaoyang Hao, Chunliang Zhang, Fandong Meng, Jingbo Zhu, Tong Xiao
Browse the full AAAI paper archive.