| 2026 | COLT | Swap Regret Minimization Through Response-Based Approachability. | Ioannis Anagnostides, Gabriele Farina, Maxwell Fishelson, Haipeng Luo, Jon Schneider |
| 2026 | COLT | Calibeating Made Simple. | Yurong Chen, Zhiyi Huang, Michael I. Jordan, Haipeng Luo |
| 2026 | COLT | Toward Simultaneously Optimal Regret in U-Calibration. | Rafael M. Frongillo, Haipeng Luo, Nishant A. Mehta, Jon Schneider |
| 2026 | COLT | Efficient Swap Multicalibration of Elicitable Properties. | Lunjia Hu, Haipeng Luo, Spandan Senapati, Vatsal Sharan |
| 2026 | COLT | Adversarial Learning in Games with Bandit Feedback: Logarithmic Pure-Strategy Maximin Regret. | Shinji Ito, Haipeng Luo, Arnab Maiti, Taira Tsuchiya, Yue Wu |
| 2026 | COLT | Online Learning for Uninformed Markov Games: Empirical Nash-Value Regret and Non-Stationarity Adaptation. | Junyan Liu, Haipeng Luo, Zihan Zhang, Lillian J. Ratliff |
| 2026 | STOC | Proximal Regret and Proximal Correlated Equilibria: A New Tractable Solution Concept for Online Learning and Games. | Yang Cai, Constantinos Daskalakis, Haipeng Luo, Chen-Yu Wei, Weiqiang Zheng |
| 2025 | COLT | Alternating Regret for Online Convex Optimization. | Soumita Hait, Ping Li, Haipeng Luo, Mengxiao Zhang |
| 2025 | COLT | Instance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback. | Shinji Ito, Haipeng Luo, Taira Tsuchiya, Yue Wu |
| 2025 | COLT | Corrupted Learning Dynamics in Games. | Taira Tsuchiya, Shinji Ito, Haipeng Luo |
| 2025 | ICLR | Last-Iterate Convergence Properties of Regret-Matching Algorithms in Games. | Yang Cai, Gabriele Farina, Julien Grand-Clment, Christian Kroer, Chung-Wei Lee, Haipeng Luo, Weiqiang Zheng |
| 2025 | ICLR | WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct. | Haipeng Luo, Qingfeng Sun, Can Xu, Pu Zhao, Jian-Guang Lou, Chongyang Tao, Xiubo Geng, Qingwei Lin, Shifeng Chen, Yansong Tang, Dongmei Zhang |
| 2025 | ICML | Contextual Linear Bandits with Delay as Payoff. | Mengxiao Zhang, Yingfei Wang, Haipeng Luo |
| 2024 | AISTATS | Near-Optimal Policy Optimization for Correlated Equilibrium in General-Sum Markov Games. | Yang Cai, Haipeng Luo, Chen-Yu Wei, Weiqiang Zheng |
| 2024 | AISTATS | Online Learning in Contextual Second-Price Pay-Per-Click Auctions. | Mengxiao Zhang, Haipeng Luo |
| 2024 | ICML | ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints. | Akhil Agnihotri, Rahul Jain, Haipeng Luo |
| 2024 | ICML | Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback. | Asaf Cassel, Haipeng Luo, Aviv Rosenberg, Dmitry Sotnikov |
| 2024 | ICML | Efficient Contextual Bandits with Uninformed Feedback Graphs. | Mengxiao Zhang, Yuheng Zhang, Haipeng Luo, Paul Mineiro |
| 2023 | AISTATS | No-Regret Learning in Two-Echelon Supply Chain with Unknown Demand Distribution. | Mengxiao Zhang, Shi Chen, Haipeng Luo, Yingfei Wang |
| 2023 | ALT | Improved High-Probability Regret for Adversarial Bandits with Time-Varying Feedback Graphs. | Haipeng Luo, Hanghang Tong, Mengxiao Zhang, Yuheng Zhang |
| 2023 | CVPR | Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval? | Wenhao Wu, Haipeng Luo, Bo Fang, Jingdong Wang, Wanli Ouyang |
| 2023 | CVPR | Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models. | Wenhao Wu, Xiaohan Wang, Haipeng Luo, Jingdong Wang, Yi Yang, Wanli Ouyang |
| 2023 | ICML | Refined Regret for Adversarial MDPs with Linear Function Approximation. | Yan Dai, Haipeng Luo, Chen-Yu Wei, Julian Zimmert |
| 2023 | KDD | 2nd Workshop on Multi-Armed Bandits and Reinforcement Learning: Advancing Decision Making in E-Commerce and Beyond. | Chu Wang, Yingfei Wang, Haipeng Luo, Daniel R. Jiang, Jinghai He, Zeyu Zheng |
| 2023 | UAI | Posterior sampling-based online learning for the stochastic shortest path model. | Mehdi Jafarnia-Jahromi, Liyu Chen, Rahul Jain, Haipeng Luo |
| 2022 | COLT | Policy Optimization for Stochastic Shortest Path. | Liyu Chen, Haipeng Luo, Aviv Rosenberg |
| 2022 | COLT | Adaptive Bandit Convex Optimization with Heterogeneous Curvature. | Haipeng Luo, Mengxiao Zhang, Peng Zhao |
| 2022 | COLT | Corralling a Larger Band of Bandits: A Case Study on Switching Regret for Linear Bandits. | Haipeng Luo, Mengxiao Zhang, Peng Zhao, Zhi-Hua Zhou |
| 2022 | ICML | Improved No-Regret Algorithms for Stochastic Shortest Path with Linear MDP. | Liyu Chen, Rahul Jain, Haipeng Luo |
| 2022 | ICML | Learning Infinite-horizon Average-reward Markov Decision Process with Constraints. | Liyu Chen, Rahul Jain, Haipeng Luo |
| 2022 | ICML | Kernelized Multiplicative Weights for 0/1-Polyhedral Games: Bridging the Gap Between Learning in Extensive-Form and Normal-Form Games. | Gabriele Farina, Chung-Wei Lee, Haipeng Luo, Christian Kroer |
| 2022 | ICML | No-Regret Learning in Time-Varying Zero-Sum Games. | Mengxiao Zhang, Peng Zhao, Haipeng Luo, Zhi-Hua Zhou |
| 2021 | AISTATS | Active Online Learning with Hidden Shifting Domains. | Yining Chen, Haipeng Luo, Tengyu Ma, Chicheng Zhang |
| 2021 | AISTATS | Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation. | Chen-Yu Wei, Mehdi Jafarnia-Jahromi, Haipeng Luo, Rahul Jain |
| 2021 | ALT | Adversarial Online Learning with Changing Action Sets: Efficient Algorithms with Approximate Regret Bounds. | Ehsan Emamjomeh-Zadeh, Chen-Yu Wei, Haipeng Luo, David Kempe |
| 2021 | COLT | Minimax Regret for Stochastic Shortest Path with Adversarial Costs and Known Transition. | Liyu Chen, Haipeng Luo, Chen-Yu Wei |
| 2021 | COLT | Impossible Tuning Made Possible: A New Expert Algorithm and Its Applications. | Liyu Chen, Haipeng Luo, Chen-Yu Wei |
| 2021 | COLT | Non-stationary Reinforcement Learning without Prior Knowledge: an Optimal Black-box Approach. | Chen-Yu Wei, Haipeng Luo |
| 2021 | COLT | Last-iterate Convergence of Decentralized Optimistic Gradient Descent/Ascent in Infinite-horizon Competitive Markov Games. | Chen-Yu Wei, Chung-Wei Lee, Mengxiao Zhang, Haipeng Luo |
| 2021 | ICLR | Linear Last-iterate Convergence in Constrained Saddle-point Optimization. | Chen-Yu Wei, Chung-Wei Lee, Mengxiao Zhang, Haipeng Luo |
| 2021 | ICML | Finding the Stochastic Shortest Path with Low Regret: the Adversarial Cost and Unknown Transition Case. | Liyu Chen, Haipeng Luo |
| 2021 | ICML | Achieving Near Instance-Optimality and Minimax-Optimality in Stochastic and Adversarial Linear Bandits Simultaneously. | Chung-Wei Lee, Haipeng Luo, Chen-Yu Wei, Mengxiao Zhang, Xiaojin Zhang |
| 2021 | KDD | Multi-Armed Bandits and Reinforcement Learning: Advancing Decision Making in E-Commerce and Beyond. | Daniel R. Jiang, Haipeng Luo, Chu Wang, Yingfei Wang |
| 2020 | COLT | Open Problem: Model Selection for Contextual Bandits. | Dylan J. Foster, Akshay Krishnamurthy, Haipeng Luo |
| 2020 | COLT | A Closer Look at Small-loss Bounds for Bandits with Graph Feedback. | Chung-Wei Lee, Haipeng Luo, Mengxiao Zhang |
| 2020 | COLT | Taking a hint: How to leverage loss predictors in contextual bandits? | Chen-Yu Wei, Haipeng Luo, Alekh Agarwal |
| 2020 | ICML | Learning Adversarial Markov Decision Processes with Bandit Feedback and Unknown Transition. | Chi Jin, Tiancheng Jin, Haipeng Luo, Suvrit Sra, Tiancheng Yu |
| 2020 | ICML | Model-free Reinforcement Learning in Infinite-horizon Average-reward Markov Decision Processes. | Chen-Yu Wei, Mehdi Jafarnia-Jahromi, Haipeng Luo, Hiteshi Sharma, Rahul Jain |
| 2020 | UAI | Fair Contextual Multi-Armed Bandits: Theory and Experiments. | Yifang Chen, Alex Cuellar, Haipeng Luo, Jignesh Modi, Heramb Nemlekar, Stefanos Nikolaidis |
| 2019 | COLT | Achieving Optimal Dynamic Regret for Non-stationary Bandits without Prior Information. | Peter Auer, Yifang Chen, Pratik Gajane, Chung-Wei Lee, Haipeng Luo, Ronald Ortner, Chen-Yu Wei |
| 2019 | COLT | Improved Path-length Regret Bounds for Bandits. | Sbastien Bubeck, Yuanzhi Li, Haipeng Luo, Chen-Yu Wei |
| 2019 | COLT | A New Algorithm for Non-stationary Contextual Bandits: Efficient, Optimal and Parameter-free. | Yifang Chen, Chung-Wei Lee, Haipeng Luo, Chen-Yu Wei |
| 2019 | ICML | Beating Stochastic and Adversarial Semi-bandits Optimally and Simultaneously. | Julian Zimmert, Haipeng Luo, Chen-Yu Wei |
| 2018 | COLT | Logistic Regression: The Importance of Being Improper. | Dylan J. Foster, Satyen Kale, Haipeng Luo, Mehryar Mohri, Karthik Sridharan |
| 2018 | COLT | Efficient Contextual Bandits in Non-stationary Worlds. | Haipeng Luo, Chen-Yu Wei, Alekh Agarwal, John Langford |
| 2018 | COLT | More Adaptive Algorithms for Adversarial Bandits. | Chen-Yu Wei, Haipeng Luo |
| 2018 | ICML | Practical Contextual Bandits with Regression Oracles. | Dylan J. Foster, Alekh Agarwal, Miroslav Dudk, Haipeng Luo, Robert E. Schapire |
| 2017 | COLT | Open Problem: First-Order Regret Bounds for Contextual Bandits. | Alekh Agarwal, Akshay Krishnamurthy, John Langford, Haipeng Luo, Robert E. Schapire |
| 2017 | COLT | Corralling a Band of Bandit Algorithms. | Alekh Agarwal, Haipeng Luo, Behnam Neyshabur, Robert E. Schapire |
| 2017 | FOCS | Oracle-Efficient Online Learning and Auction Design. | Miroslav Dudk, Nika Haghtalab, Haipeng Luo, Robert E. Schapire, Vasilis Syrgkanis, Jennifer Wortman Vaughan |
| 2016 | ICML | Variance-Reduced and Projection-Free Stochastic Optimization. | Elad Hazan, Haipeng Luo |
| 2016 | IJCAI | Optimal and Adaptive Algorithms for Online Boosting. | Alina Beygelzimer, Satyen Kale, Haipeng Luo |
| 2015 | COLT | Achieving All with No Parameters: AdaNormalHedge. | Haipeng Luo, Robert E. Schapire |
| 2015 | ICML | Optimal and Adaptive Algorithms for Online Boosting. | Alina Beygelzimer, Satyen Kale, Haipeng Luo |
| 2014 | ICML | Towards Minimax Online Learning with Unknown Time Horizon. | Haipeng Luo, Robert E. Schapire |