Skip to content

Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning.

Huimin Xu, Xin Mao, Feng-Lin Li, Xiaobao Wu, Wang Chen, Wei Zhang, Anh Tuan Luu

VenueA*ACL
Year2025
ProceedingsACL (Findings)

Browse the full ACL paper archive.