Skip to content

DPO Meets PPO: Reinforced Token Optimization for RLHF.

Han Zhong, Zikang Shan, Guhao Feng, Wei Xiong, Xinle Cheng, Li Zhao, Di He, Jiang Bian, Liwei Wang

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.