Skip to content

Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback.

Shinji Ito, Haipeng Luo, Taira Tsuchiya, Yue Wu

VenueA*COLT
Year2025
ProceedingsCOLT

Browse the full COLT paper archive.