Skip to content

EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning.

Xiaoqian Liu, Ke Wang, Yongbin Li, Yuchuan Wu, Wentao Ma, Aobo Kong, Fei Huang, Jianbin Jiao, Junge Zhang

VenueA*ACL
Year2025
ProceedingsACL (1)

Browse the full ACL paper archive.