Skip to content

Exploration Through Reward Biasing: Reward-Biased Maximum Likelihood Estimation for Stochastic Multi-Armed Bandits.

Xi Liu, Ping-Chun Hsieh, Yu-Heng Hung, Anirban Bhattacharya, P. R. Kumar

VenueA*ICML
Year2020
ProceedingsICML

Browse the full ICML paper archive.