Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback.
Shinji Ito, Haipeng Luo, Taira Tsuchiya, Yue Wu
Browse the full COLT paper archive.
Shinji Ito, Haipeng Luo, Taira Tsuchiya, Yue Wu
Browse the full COLT paper archive.