Skip to content

Offline Reinforcement Learning for LLM Multi-step Reasoning.

Huaijie Wang, Shibo Hao, Hanze Dong, Shenao Zhang, Yilin Bao, Ziran Yang, Yi Wu

VenueA*ACL
Year2025
ProceedingsACL (Findings)

Browse the full ACL paper archive.