Skip to content

URPO: A Unified Reward & Policy Optimization Framework for Large Language Models.

Songshuo Lu, Hua Wang, Zhi Chen, Yaohua Tang

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.