| 2025 | ICML | Monte-Carlo Tree Search with Uncertainty Propagation via Optimal Transport. | Tuan Dam, Pascal Stenger, Lukas Schneider, Joni Pajarinen, Carlo D'Eramo, Odalric-Ambrym Maillard |
| 2024 | ALT | CRIMED: Lower and Upper Bounds on Regret for Bandits with Unbounded Stochastic Corruption. | Shubhada Agrawal, Timothe Mathieu, Debabrota Basu, Odalric-Ambrym Maillard |
| 2024 | UAI | Power Mean Estimation in Stochastic Monte-Carlo Tree Search. | Tuan Dam, Odalric-Ambrym Maillard, Emilie Kaufmann |
| 2023 | ACML | Logarithmic regret in communicating MDPs: Leveraging known dynamics with bandits. | Hassan Saber, Fabien Pesquerel, Odalric-Ambrym Maillard, Mohammad Sadegh Talebi |
| 2023 | AISTATS | Exploration in Reward Machines with Low Regret. | Hippolyte Bourel, Anders Jonsson, Odalric-Ambrym Maillard, Mohammad Sadegh Talebi |
| 2021 | AISTATS | Reinforcement Learning in Parametric MDPs with Exponential Families. | Sayak Ray Chowdhury, Aditya Gopalan, Odalric-Ambrym Maillard |
| 2021 | ICLR | Learning Value Functions in Deep Policy Gradients using Residual Variance. | Yannis Flet-Berliac, Reda Ouhamma, Odalric-Ambrym Maillard, Philippe Preux |
| 2020 | ACML | Monte-Carlo Graph Search: the Value of Merging Similar States. | Edouard Leurent, Odalric-Ambrym Maillard |
| 2019 | ACML | Model-Based Reinforcement Learning Exploiting State-Action Equivalence. | Mahsa Asadi, Mohammad Sadegh Talebi, Hippolyte Bourel, Odalric-Ambrym Maillard |
| 2019 | ALT | Sequential change-point detection: Laplace concentration of scan statistics and non-asymptotic delay bounds. | Odalric-Ambrym Maillard |
| 2018 | ALT | Variance-Aware Regret Bounds for Undiscounted Reinforcement Learning in MDPs. | Mohammad Sadegh Talebi, Odalric-Ambrym Maillard |
| 2017 | ALT | Boundary Crossing for General Exponential Families. | Odalric-Ambrym Maillard |
| 2017 | ALT | Efficient tracking of a growing number of experts. | Jaouad Mourtada, Odalric-Ambrym Maillard |
| 2017 | ICML | Spectral Learning from a Single Trajectory under Finite-State Policies. | Borja Balle, Odalric-Ambrym Maillard |
| 2016 | ICML | Pliable Rejection Sampling. | Akram Erraqabi, Michal Valko, Alexandra Carpentier, Odalric-Ambrym Maillard |
| 2014 | ALT | Selecting Near-Optimal Approximate State Representations in Reinforcement Learning. | Ronald Ortner, Odalric-Ambrym Maillard, Daniil Ryabko |
| 2014 | ICML | Latent Bandits. | Odalric-Ambrym Maillard, Shie Mannor |
| 2013 | AISTATS | Competing with an Infinite Set of Models in Reinforcement Learning. | Phuong Nguyen, Odalric-Ambrym Maillard, Daniil Ryabko, Ronald Ortner |
| 2013 | ALT | Robust Risk-Averse Stochastic Multi-armed Bandits. | Odalric-Ambrym Maillard |
| 2013 | ICML | Optimal Regret Bounds for Selecting the State Representation in Reinforcement Learning. | Odalric-Ambrym Maillard, Phuong Nguyen, Ronald Ortner, Daniil Ryabko |
| 2009 | ALT | Complexity versus Agreement for Many Views. | Odalric-Ambrym Maillard, Nicolas Vayatis |