DiffPO: Diffusion-styled Preference Optimization for Inference Time Alignment of Large Language Models.
Ruizhe Chen, Wenhao Chai, Zhifei Yang, Xiaotian Zhang, Ziyang Wang, Tony Q. S. Quek, Joey Tianyi Zhou, Soujanya Poria, Zuozhu Liu
Browse the full ACL paper archive.