Skip to content

Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning.

Yuheng Zhang, Dian Yu, Baolin Peng, Linfeng Song, Ye Tian, Mingyue Huo, Nan Jiang, Haitao Mi, Dong Yu

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.