Skip to content

TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization.

Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.