RLCD: Reinforcement Learning from Contrastive Distillation for LM Alignment.
Kevin Yang, Dan Klein, Asli Celikyilmaz, Nanyun Peng, Yuandong Tian
Browse the full ICLR paper archive.
Kevin Yang, Dan Klein, Asli Celikyilmaz, Nanyun Peng, Yuandong Tian
Browse the full ICLR paper archive.