Skip to content

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via sequence-level likelihood.

Xingyu Lin, Yilin Wen, Du Su, En Wang, Wenbin Liu, Zhonghou Lv, Jinchang Hou, Chenfu Bao

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.