Aligning as Debiasing: Causality-Aware Alignment via Reinforcement Learning with Interventional Feedback.
Yu Xia, Tong Yu, Zhankui He, Handong Zhao, Julian J. McAuley, Shuai Li
Browse the full NAACL paper archive.
Yu Xia, Tong Yu, Zhankui He, Handong Zhao, Julian J. McAuley, Shuai Li
Browse the full NAACL paper archive.