Skip to content

Learning Optimal Advantage from Preferences and Mistaking It for Reward.

W. Bradley Knox, Stephane Hatgis-Kessell, Sigurdur O. Adalgeirsson, Serena Booth, Anca D. Dragan, Peter Stone, Scott Niekum

VenueA*AAAI
Year2024
ProceedingsAAAI

Browse the full AAAI paper archive.