Learning Adversarial Markov Decision Processes with Bandit Feedback and Unknown Transition.
Chi Jin, Tiancheng Jin, Haipeng Luo, Suvrit Sra, Tiancheng Yu
Browse the full ICML paper archive.
Chi Jin, Tiancheng Jin, Haipeng Luo, Suvrit Sra, Tiancheng Yu
Browse the full ICML paper archive.