Skip to content

Multi-Task Off-Policy Learning from Bandit Feedback.

Joey Hong, Branislav Kveton, Manzil Zaheer, Sumeet Katariya, Mohammad Ghavamzadeh

VenueA*ICML
Year2023
ProceedingsICML

Browse the full ICML paper archive.