Reward-Free RL is No Harder Than Reward-Aware RL in Linear Markov Decision Processes.
Andrew J. Wagenmaker, Yifang Chen, Max Simchowitz, Simon S. Du, Kevin Jamieson
Browse the full ICML paper archive.
Andrew J. Wagenmaker, Yifang Chen, Max Simchowitz, Simon S. Du, Kevin Jamieson
Browse the full ICML paper archive.