Skip to content

Aligning as Debiasing: Causality-Aware Alignment via Reinforcement Learning with Interventional Feedback.

Yu Xia, Tong Yu, Zhankui He, Handong Zhao, Julian J. McAuley, Shuai Li

VenueANAACL
Year2024
ProceedingsNAACL-HLT

Browse the full NAACL paper archive.