Finite-Sample Regret Bound for Distributionally Robust Offline Tabular Reinforcement Learning.
Zhengqing Zhou, Qinxun Bai, Zhengyuan Zhou, Linhai Qiu, Jose H. Blanchet, Peter W. Glynn
Browse the full AISTATS paper archive.
Zhengqing Zhou, Qinxun Bai, Zhengyuan Zhou, Linhai Qiu, Jose H. Blanchet, Peter W. Glynn
Browse the full AISTATS paper archive.