TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization.
Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia
Browse the full ICML paper archive.
Mingkang Zhu, Xi Chen, Zhongdao Wang, Bei Yu, Hengshuang Zhao, Jiaya Jia
Browse the full ICML paper archive.