Skip to content

Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards.

Xia Zeng, Yihan Chen, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

VenueA*ACL
Year2026
ProceedingsACL (6)

Browse the full ACL paper archive.