Skip to content

Haipeng Luo

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

65

Venues

11

Active years

2014–2026

Best venue rank

A*

Where they publish

Papers

65 indexed papers, newest first.

YearVenueTitleAuthors
2026COLTSwap Regret Minimization Through Response-Based Approachability.Ioannis Anagnostides, Gabriele Farina, Maxwell Fishelson, Haipeng Luo, Jon Schneider
2026COLTCalibeating Made Simple.Yurong Chen, Zhiyi Huang, Michael I. Jordan, Haipeng Luo
2026COLTToward Simultaneously Optimal Regret in U-Calibration.Rafael M. Frongillo, Haipeng Luo, Nishant A. Mehta, Jon Schneider
2026COLTEfficient Swap Multicalibration of Elicitable Properties.Lunjia Hu, Haipeng Luo, Spandan Senapati, Vatsal Sharan
2026COLTAdversarial Learning in Games with Bandit Feedback: Logarithmic Pure-Strategy Maximin Regret.Shinji Ito, Haipeng Luo, Arnab Maiti, Taira Tsuchiya, Yue Wu
2026COLTOnline Learning for Uninformed Markov Games: Empirical Nash-Value Regret and Non-Stationarity Adaptation.Junyan Liu, Haipeng Luo, Zihan Zhang, Lillian J. Ratliff
2026STOCProximal Regret and Proximal Correlated Equilibria: A New Tractable Solution Concept for Online Learning and Games.Yang Cai, Constantinos Daskalakis, Haipeng Luo, Chen-Yu Wei, Weiqiang Zheng
2025COLTAlternating Regret for Online Convex Optimization.Soumita Hait, Ping Li, Haipeng Luo, Mengxiao Zhang
2025COLTInstance-Dependent Regret Bounds for Learning Two-Player Zero-Sum Games with Bandit Feedback.Shinji Ito, Haipeng Luo, Taira Tsuchiya, Yue Wu
2025COLTCorrupted Learning Dynamics in Games.Taira Tsuchiya, Shinji Ito, Haipeng Luo
2025ICLRLast-Iterate Convergence Properties of Regret-Matching Algorithms in Games.Yang Cai, Gabriele Farina, Julien Grand-Clment, Christian Kroer, Chung-Wei Lee, Haipeng Luo, Weiqiang Zheng
2025ICLRWizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct.Haipeng Luo, Qingfeng Sun, Can Xu, Pu Zhao, Jian-Guang Lou, Chongyang Tao, Xiubo Geng, Qingwei Lin, Shifeng Chen, Yansong Tang, Dongmei Zhang
2025ICMLContextual Linear Bandits with Delay as Payoff.Mengxiao Zhang, Yingfei Wang, Haipeng Luo
2024AISTATSNear-Optimal Policy Optimization for Correlated Equilibrium in General-Sum Markov Games.Yang Cai, Haipeng Luo, Chen-Yu Wei, Weiqiang Zheng
2024AISTATSOnline Learning in Contextual Second-Price Pay-Per-Click Auctions.Mengxiao Zhang, Haipeng Luo
2024ICMLACPO: A Policy Optimization Algorithm for Average MDPs with Constraints.Akhil Agnihotri, Rahul Jain, Haipeng Luo
2024ICMLNear-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback.Asaf Cassel, Haipeng Luo, Aviv Rosenberg, Dmitry Sotnikov
2024ICMLEfficient Contextual Bandits with Uninformed Feedback Graphs.Mengxiao Zhang, Yuheng Zhang, Haipeng Luo, Paul Mineiro
2023AISTATSNo-Regret Learning in Two-Echelon Supply Chain with Unknown Demand Distribution.Mengxiao Zhang, Shi Chen, Haipeng Luo, Yingfei Wang
2023ALTImproved High-Probability Regret for Adversarial Bandits with Time-Varying Feedback Graphs.Haipeng Luo, Hanghang Tong, Mengxiao Zhang, Yuheng Zhang
2023CVPRCap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?Wenhao Wu, Haipeng Luo, Bo Fang, Jingdong Wang, Wanli Ouyang
2023CVPRBidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models.Wenhao Wu, Xiaohan Wang, Haipeng Luo, Jingdong Wang, Yi Yang, Wanli Ouyang
2023ICMLRefined Regret for Adversarial MDPs with Linear Function Approximation.Yan Dai, Haipeng Luo, Chen-Yu Wei, Julian Zimmert
2023KDD2nd Workshop on Multi-Armed Bandits and Reinforcement Learning: Advancing Decision Making in E-Commerce and Beyond.Chu Wang, Yingfei Wang, Haipeng Luo, Daniel R. Jiang, Jinghai He, Zeyu Zheng
2023UAIPosterior sampling-based online learning for the stochastic shortest path model.Mehdi Jafarnia-Jahromi, Liyu Chen, Rahul Jain, Haipeng Luo
2022COLTPolicy Optimization for Stochastic Shortest Path.Liyu Chen, Haipeng Luo, Aviv Rosenberg
2022COLTAdaptive Bandit Convex Optimization with Heterogeneous Curvature.Haipeng Luo, Mengxiao Zhang, Peng Zhao
2022COLTCorralling a Larger Band of Bandits: A Case Study on Switching Regret for Linear Bandits.Haipeng Luo, Mengxiao Zhang, Peng Zhao, Zhi-Hua Zhou
2022ICMLImproved No-Regret Algorithms for Stochastic Shortest Path with Linear MDP.Liyu Chen, Rahul Jain, Haipeng Luo
2022ICMLLearning Infinite-horizon Average-reward Markov Decision Process with Constraints.Liyu Chen, Rahul Jain, Haipeng Luo
2022ICMLKernelized Multiplicative Weights for 0/1-Polyhedral Games: Bridging the Gap Between Learning in Extensive-Form and Normal-Form Games.Gabriele Farina, Chung-Wei Lee, Haipeng Luo, Christian Kroer
2022ICMLNo-Regret Learning in Time-Varying Zero-Sum Games.Mengxiao Zhang, Peng Zhao, Haipeng Luo, Zhi-Hua Zhou
2021AISTATSActive Online Learning with Hidden Shifting Domains.Yining Chen, Haipeng Luo, Tengyu Ma, Chicheng Zhang
2021AISTATSLearning Infinite-horizon Average-reward MDPs with Linear Function Approximation.Chen-Yu Wei, Mehdi Jafarnia-Jahromi, Haipeng Luo, Rahul Jain
2021ALTAdversarial Online Learning with Changing Action Sets: Efficient Algorithms with Approximate Regret Bounds.Ehsan Emamjomeh-Zadeh, Chen-Yu Wei, Haipeng Luo, David Kempe
2021COLTMinimax Regret for Stochastic Shortest Path with Adversarial Costs and Known Transition.Liyu Chen, Haipeng Luo, Chen-Yu Wei
2021COLTImpossible Tuning Made Possible: A New Expert Algorithm and Its Applications.Liyu Chen, Haipeng Luo, Chen-Yu Wei
2021COLTNon-stationary Reinforcement Learning without Prior Knowledge: an Optimal Black-box Approach.Chen-Yu Wei, Haipeng Luo
2021COLTLast-iterate Convergence of Decentralized Optimistic Gradient Descent/Ascent in Infinite-horizon Competitive Markov Games.Chen-Yu Wei, Chung-Wei Lee, Mengxiao Zhang, Haipeng Luo
2021ICLRLinear Last-iterate Convergence in Constrained Saddle-point Optimization.Chen-Yu Wei, Chung-Wei Lee, Mengxiao Zhang, Haipeng Luo
2021ICMLFinding the Stochastic Shortest Path with Low Regret: the Adversarial Cost and Unknown Transition Case.Liyu Chen, Haipeng Luo
2021ICMLAchieving Near Instance-Optimality and Minimax-Optimality in Stochastic and Adversarial Linear Bandits Simultaneously.Chung-Wei Lee, Haipeng Luo, Chen-Yu Wei, Mengxiao Zhang, Xiaojin Zhang
2021KDDMulti-Armed Bandits and Reinforcement Learning: Advancing Decision Making in E-Commerce and Beyond.Daniel R. Jiang, Haipeng Luo, Chu Wang, Yingfei Wang
2020COLTOpen Problem: Model Selection for Contextual Bandits.Dylan J. Foster, Akshay Krishnamurthy, Haipeng Luo
2020COLTA Closer Look at Small-loss Bounds for Bandits with Graph Feedback.Chung-Wei Lee, Haipeng Luo, Mengxiao Zhang
2020COLTTaking a hint: How to leverage loss predictors in contextual bandits?Chen-Yu Wei, Haipeng Luo, Alekh Agarwal
2020ICMLLearning Adversarial Markov Decision Processes with Bandit Feedback and Unknown Transition.Chi Jin, Tiancheng Jin, Haipeng Luo, Suvrit Sra, Tiancheng Yu
2020ICMLModel-free Reinforcement Learning in Infinite-horizon Average-reward Markov Decision Processes.Chen-Yu Wei, Mehdi Jafarnia-Jahromi, Haipeng Luo, Hiteshi Sharma, Rahul Jain
2020UAIFair Contextual Multi-Armed Bandits: Theory and Experiments.Yifang Chen, Alex Cuellar, Haipeng Luo, Jignesh Modi, Heramb Nemlekar, Stefanos Nikolaidis
2019COLTAchieving Optimal Dynamic Regret for Non-stationary Bandits without Prior Information.Peter Auer, Yifang Chen, Pratik Gajane, Chung-Wei Lee, Haipeng Luo, Ronald Ortner, Chen-Yu Wei
2019COLTImproved Path-length Regret Bounds for Bandits.Sbastien Bubeck, Yuanzhi Li, Haipeng Luo, Chen-Yu Wei
2019COLTA New Algorithm for Non-stationary Contextual Bandits: Efficient, Optimal and Parameter-free.Yifang Chen, Chung-Wei Lee, Haipeng Luo, Chen-Yu Wei
2019ICMLBeating Stochastic and Adversarial Semi-bandits Optimally and Simultaneously.Julian Zimmert, Haipeng Luo, Chen-Yu Wei
2018COLTLogistic Regression: The Importance of Being Improper.Dylan J. Foster, Satyen Kale, Haipeng Luo, Mehryar Mohri, Karthik Sridharan
2018COLTEfficient Contextual Bandits in Non-stationary Worlds.Haipeng Luo, Chen-Yu Wei, Alekh Agarwal, John Langford
2018COLTMore Adaptive Algorithms for Adversarial Bandits.Chen-Yu Wei, Haipeng Luo
2018ICMLPractical Contextual Bandits with Regression Oracles.Dylan J. Foster, Alekh Agarwal, Miroslav Dudk, Haipeng Luo, Robert E. Schapire
2017COLTOpen Problem: First-Order Regret Bounds for Contextual Bandits.Alekh Agarwal, Akshay Krishnamurthy, John Langford, Haipeng Luo, Robert E. Schapire
2017COLTCorralling a Band of Bandit Algorithms.Alekh Agarwal, Haipeng Luo, Behnam Neyshabur, Robert E. Schapire
2017FOCSOracle-Efficient Online Learning and Auction Design.Miroslav Dudk, Nika Haghtalab, Haipeng Luo, Robert E. Schapire, Vasilis Syrgkanis, Jennifer Wortman Vaughan
2016ICMLVariance-Reduced and Projection-Free Stochastic Optimization.Elad Hazan, Haipeng Luo
2016IJCAIOptimal and Adaptive Algorithms for Online Boosting.Alina Beygelzimer, Satyen Kale, Haipeng Luo
2015COLTAchieving All with No Parameters: AdaNormalHedge.Haipeng Luo, Robert E. Schapire
2015ICMLOptimal and Adaptive Algorithms for Online Boosting.Alina Beygelzimer, Satyen Kale, Haipeng Luo
2014ICMLTowards Minimax Online Learning with Unknown Time Horizon.Haipeng Luo, Robert E. Schapire