Skip to content

Off-policy learning based on weighted importance sampling with linear computational complexity.

Ashique Rupam Mahmood, Richard S. Sutton

VenueAUAI
Year2015
ProceedingsUAI

Browse the full UAI paper archive.