Skip to content

RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models.

Saeed Khaki, JinJin Li, Lan Ma, Liu Yang, Prathap Ramachandra

VenueANAACL
Year2024
ProceedingsNAACL-HLT (Findings)

Browse the full NAACL paper archive.