Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models.
Alessio Russo, Alberto Maria Metelli, Marcello Restelli
Browse the full AISTATS paper archive.
Alessio Russo, Alberto Maria Metelli, Marcello Restelli
Browse the full AISTATS paper archive.