Skip to content

Learning from an Exploring Demonstrator: Optimal Reward Estimation for Bandits.

Wenshuo Guo, Kumar Krishna Agrawal, Aditya Grover, Vidya K. Muthukumar, Ashwin Pananjady

Year2022
ProceedingsAISTATS

Browse the full AISTATS paper archive.