Skip to content

Variance-Aware Regret Bounds for Undiscounted Reinforcement Learning in MDPs.

Mohammad Sadegh Talebi, Odalric-Ambrym Maillard

VenueBALT
Year2018
ProceedingsALT

Browse the full ALT paper archive.