RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models.
Saeed Khaki, JinJin Li, Lan Ma, Liu Yang, Prathap Ramachandra
Browse the full NAACL paper archive.
Saeed Khaki, JinJin Li, Lan Ma, Liu Yang, Prathap Ramachandra
Browse the full NAACL paper archive.