Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes.
Washim Uddin Mondal, Vaneet Aggarwal
Browse the full AISTATS paper archive.
Washim Uddin Mondal, Vaneet Aggarwal
Browse the full AISTATS paper archive.