Skip to content

Off-Policy Evaluation and Learning from Logged Bandit Feedback: Error Reduction via Surrogate Policy.

Yuan Xie, Boyi Liu, Qiang Liu, Zhaoran Wang, Yuan Zhou, Jian Peng

VenueA*ICLR
Year2019
ProceedingsICLR (Poster)

Browse the full ICLR paper archive.