Skip to content

GRAM-R²: Self-Training Generative Foundation Reward Models for Reward Reasoning.

Chenglong Wang, Yongyu Mu, Hang Zhou, Yifu Huo, Ziming Zhu, Jiali Zeng, Murun Yang, Bei Li, Xiaoyang Hao, Chunliang Zhang, Fandong Meng, Jingbo Zhu, Tong Xiao

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.