Step-GRPO: Enhancing Reasoning Quality and Efficiency via Structured PRM-Based Reinforcement Learning.
Weijie Li, Jin Wang, Liang-Chih Yu, Xuejie Zhang
Browse the full AAAI paper archive.
Weijie Li, Jin Wang, Liang-Chih Yu, Xuejie Zhang
Browse the full AAAI paper archive.