| 2026 | ACL | Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning. | Haolin Liu, Dian Yu, Sidi Lu, Yujun Zhou, Rui Liu, Zhenwen Liang, Haitao Mi, Chen-Yu Wei, Dong Yu |
| 2026 | STOC | Proximal Regret and Proximal Correlated Equilibria: A New Tractable Solution Concept for Online Learning and Games. | Yang Cai, Constantinos Daskalakis, Haipeng Luo, Chen-Yu Wei, Weiqiang Zheng |
| 2025 | COLT | Decision Making in Hybrid Environments: A Model Aggregation Approach. | Haolin Liu, Chen-Yu Wei, Julian Zimmert |
| 2024 | AISTATS | Near-Optimal Policy Optimization for Correlated Equilibrium in General-Sum Markov Games. | Yang Cai, Haipeng Luo, Chen-Yu Wei, Weiqiang Zheng |
| 2024 | COLT | Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data. | Zeyu Jia, Alexander Rakhlin, Ayush Sekhari, Chen-Yu Wei |
| 2024 | ICLR | Towards Optimal Regret in Adversarial Linear MDPs with Bandit Feedback. | Haolin Liu, Chen-Yu Wei, Julian Zimmert |
| 2023 | ALT | A Unified Algorithm for Stochastic Path Problems. | Christoph Dann, Chen-Yu Wei, Julian Zimmert |
| 2023 | COLT | A Blackbox Approach to Best of Both Worlds in Bandits and Beyond. | Christoph Dann, Chen-Yu Wei, Julian Zimmert |
| 2023 | ICML | Refined Regret for Adversarial MDPs with Linear Function Approximation. | Yan Dai, Haipeng Luo, Chen-Yu Wei, Julian Zimmert |
| 2023 | ICML | Best of Both Worlds Policy Optimization. | Christoph Dann, Chen-Yu Wei, Julian Zimmert |
| 2022 | ALT | Decentralized Cooperative Reinforcement Learning with Hierarchical Information Structure. | Hsu Kao, Chen-Yu Wei, Vijay G. Subramanian |
| 2022 | ALT | A Model Selection Approach for Corruption Robust Reinforcement Learning. | Chen-Yu Wei, Christoph Dann, Julian Zimmert |
| 2022 | ICML | Personalization Improves Privacy-Accuracy Tradeoffs in Federated Learning. | Alberto Bietti, Chen-Yu Wei, Miroslav Dudk, John Langford, Zhiwei Steven Wu |
| 2022 | ICML | Independent Policy Gradient for Large-Scale Markov Potential Games: Sharper Rates, Function Approximation, and Game-Agnostic Convergence. | Dongsheng Ding, Chen-Yu Wei, Kaiqing Zhang, Mihailo R. Jovanovic |
| 2021 | AISTATS | Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation. | Chen-Yu Wei, Mehdi Jafarnia-Jahromi, Haipeng Luo, Rahul Jain |
| 2021 | ALT | Adversarial Online Learning with Changing Action Sets: Efficient Algorithms with Approximate Regret Bounds. | Ehsan Emamjomeh-Zadeh, Chen-Yu Wei, Haipeng Luo, David Kempe |
| 2021 | COLT | Minimax Regret for Stochastic Shortest Path with Adversarial Costs and Known Transition. | Liyu Chen, Haipeng Luo, Chen-Yu Wei |
| 2021 | COLT | Impossible Tuning Made Possible: A New Expert Algorithm and Its Applications. | Liyu Chen, Haipeng Luo, Chen-Yu Wei |
| 2021 | COLT | Non-stationary Reinforcement Learning without Prior Knowledge: an Optimal Black-box Approach. | Chen-Yu Wei, Haipeng Luo |
| 2021 | COLT | Last-iterate Convergence of Decentralized Optimistic Gradient Descent/Ascent in Infinite-horizon Competitive Markov Games. | Chen-Yu Wei, Chung-Wei Lee, Mengxiao Zhang, Haipeng Luo |
| 2021 | ICLR | Linear Last-iterate Convergence in Constrained Saddle-point Optimization. | Chen-Yu Wei, Chung-Wei Lee, Mengxiao Zhang, Haipeng Luo |
| 2021 | ICML | Achieving Near Instance-Optimality and Minimax-Optimality in Stochastic and Adversarial Linear Bandits Simultaneously. | Chung-Wei Lee, Haipeng Luo, Chen-Yu Wei, Mengxiao Zhang, Xiaojin Zhang |
| 2020 | COLT | Taking a hint: How to leverage loss predictors in contextual bandits? | Chen-Yu Wei, Haipeng Luo, Alekh Agarwal |
| 2020 | ICML | Model-free Reinforcement Learning in Infinite-horizon Average-reward Markov Decision Processes. | Chen-Yu Wei, Mehdi Jafarnia-Jahromi, Haipeng Luo, Hiteshi Sharma, Rahul Jain |
| 2019 | COLT | Achieving Optimal Dynamic Regret for Non-stationary Bandits without Prior Information. | Peter Auer, Yifang Chen, Pratik Gajane, Chung-Wei Lee, Haipeng Luo, Ronald Ortner, Chen-Yu Wei |
| 2019 | COLT | Improved Path-length Regret Bounds for Bandits. | Sbastien Bubeck, Yuanzhi Li, Haipeng Luo, Chen-Yu Wei |
| 2019 | COLT | A New Algorithm for Non-stationary Contextual Bandits: Efficient, Optimal and Parameter-free. | Yifang Chen, Chung-Wei Lee, Haipeng Luo, Chen-Yu Wei |
| 2019 | ICML | Bandit Multiclass Linear Classification: Efficient Algorithms for the Separable Case. | Alina Beygelzimer, Dvid Pl, Balzs Szrnyi, Devanathan Thiruvenkatachari, Chen-Yu Wei, Chicheng Zhang |
| 2019 | ICML | Beating Stochastic and Adversarial Semi-bandits Optimally and Simultaneously. | Julian Zimmert, Haipeng Luo, Chen-Yu Wei |
| 2018 | COLT | Efficient Contextual Bandits in Non-stationary Worlds. | Haipeng Luo, Chen-Yu Wei, Alekh Agarwal, John Langford |
| 2018 | COLT | More Adaptive Algorithms for Adversarial Bandits. | Chen-Yu Wei, Haipeng Luo |