Skip to content

Step-GRPO: Enhancing Reasoning Quality and Efficiency via Structured PRM-Based Reinforcement Learning.

Weijie Li, Jin Wang, Liang-Chih Yu, Xuejie Zhang

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.