Policy Gradient with Tree Search (PGTS) in Reinforcement Learning Evades Local Maxima.
Navdeep Kumar, Priyank Agrawal, Kfir Yehuda Levy, Shie Mannor
Browse the full ICLR paper archive.
Navdeep Kumar, Priyank Agrawal, Kfir Yehuda Levy, Shie Mannor
Browse the full ICLR paper archive.