Skip to content

Csaba Szepesvri

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

140

Venues

17

Active years

1996–2026

Best venue rank

A*

Where they publish

Papers

140 indexed papers, newest first.

YearVenueTitleAuthors
2026COLTSharp analysis of linear ensemble sampling.David Janz, Arya Akhavan, Csaba Szepesvri
2026COLTContinuous time policy evaluation is easier with noisy dynamics.Samuel Robertson, Thomas Newton, Csaba Szepesvri
2026COLTTrajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear qVolodymyr Tkachuk, Csaba Szepesvri, Xiaoqi Tan
2025COLTThompson Sampling for Bandit Convex Optimisation.Alireza Bakhtiari, Tor Lattimore, Csaba Szepesvri
2024AISTATSExploration via linearly perturbed loss minimisation.David Janz, Shuai Liu, Alex Ayoub, Csaba Szepesvri
2024ICLRStochastic Gradient Descent for Gaussian Processes Done Right.Jihao Andreas Lin, Shreyas Padhy, Javier Antorn, Austin Tripp, Alexander Terenin, Csaba Szepesvri, Jos Miguel Hernndez-Lobato, David Janz
2024ICMLSwitching the Loss Reduces the Cost in Batch Reinforcement Learning.Alex Ayoub, Kaiwen Wang, Vincent Liu, Samuel Robertson, James McInerney, Dawen Liang, Nathan Kallus, Csaba Szepesvri
2023AISTATSEfficient Planning in Combinatorial Action Spaces with Applications to Cooperative Multi-Agent Reinforcement Learning.Volodymyr Tkachuk, Seyed Alireza Bakhtiari, Johannes Kirschner, Matej Jusup, Ilija Bogunovic, Csaba Szepesvri
2023COLTExponential Hardness of Reinforcement Learning with Linear Function Approximation.Sihan Liu, Gaurav Mahajan, Daniel Kane, Shachar Lovett, Gellrt Weisz, Csaba Szepesvri
2023ICLROptimistic Exploration with Learned Features Provably Solves Markov Decision Processes with Neural Dynamics.Sirui Zheng, Lingxiao Wang, Shuang Qiu, Zuyue Fu, Zhuoran Yang, Csaba Szepesvri, Zhaoran Wang
2023ICMLThe Optimal Approximation Factors in Misspecified Off-Policy Value Function Estimation.Philip Amortila, Nan Jiang, Csaba Szepesvri
2023ICMLRegularization and Variance-Weighted Regression Achieves Minimax Optimality in Linear MDPs: Theory and Practice.Toshinori Kitamura, Tadashi Kozuno, Yunhao Tang, Nino Vieillard, Michal Valko, Wenhao Yang, Jincheng Mei, Pierre Mnard, Mohammad Gheshlaghi Azar, Rmi Munos, Olivier Pietquin, Matthieu Geist, Csaba Szepesvri, Wataru Kumagai, Yutaka Matsuo
2023ICMLStochastic Gradient Succeeds for Bandits.Jincheng Mei, Zixin Zhong, Bo Dai, Alekh Agarwal, Csaba Szepesvri, Dale Schuurmans
2023ICMLRevisiting Simple Regret: Fast Rates for Returning a Good Arm.Yao Zhao, Connor Stephens, Csaba Szepesvri, Kwang-Sung Jun
2023STOCOptimistic MLE: A Generic Model-Based Algorithm for Partially Observable Sequential Decision Making.Qinghua Liu, Praneeth Netrapalli, Csaba Szepesvri, Chi Jin
2022AISTATSConfident Least Square Value Iteration with Local Access to a Simulator.Botao Hao, Nevena Lazic, Dong Yin, Yasin Abbasi-Yadkori, Csaba Szepesvri
2022AISTATSFaster Rates, Adaptive Algorithms, and Finite-Time Bounds for Linear Composition Optimization and Gradient TD Learning.Anant Raj, Pooria Joulani, Andrs Gyrgy, Csaba Szepesvri
2022AISTATSThe Curse of Passive Data Collection in Batch Reinforcement Learning.Chenjun Xiao, Ilbin Lee, Bo Dai, Dale Schuurmans, Csaba Szepesvri
2022ALTTensorPlan and the Few Actions Lower Bound for Planning in MDPs under Linear Realizability of Optimal Value Functions.Gellrt Weisz, Csaba Szepesvri, Andrs Gyrgy
2022ALTEfficient local planning with linear function approximation.Dong Yin, Botao Hao, Yasin Abbasi-Yadkori, Nevena Lazic, Csaba Szepesvri
2022COLTWhen Is Partially Observable Reinforcement Learning Not Scary?Qinghua Liu, Alan Chung, Csaba Szepesvri, Chi Jin
2022UAIA free lunch from the noise: Provable and practical exploration for representation learning.Tongzheng Ren, Tianjun Zhang, Csaba Szepesvri, Bo Dai
2021AISTATSAdaptive Approximate Policy Iteration.Botao Hao, Nevena Lazic, Yasin Abbasi-Yadkori, Pooria Joulani, Csaba Szepesvri
2021AISTATSOnline Sparse Reinforcement Learning.Botao Hao, Tor Lattimore, Csaba Szepesvri, Mengdi Wang
2021AISTATSConfident Off-Policy Evaluation and Selection through Self-Normalized Importance Weighting.Ilja Kuzborskij, Claire Vernade, Andrs Gyrgy, Csaba Szepesvri
2021ALTExponential Lower Bounds for Planning in MDPs With Linearly-Realizable Optimal Action-Value Functions.Gellrt Weisz, Philip Amortila, Csaba Szepesvri
2021COLTAsymptotically Optimal Information-Directed Sampling.Johannes Kirschner, Tor Lattimore, Claire Vernade, Csaba Szepesvri
2021COLTNonparametric Regression with Shallow Overparameterized Neural Networks Trained by GD with Early Stopping.Ilja Kuzborskij, Csaba Szepesvri
2021COLTOn Query-efficient Planning in MDPs under Linear Realizability of the Optimal State-value Function.Gellrt Weisz, Philip Amortila, Barnabs Janzer, Yasin Abbasi-Yadkori, Nan Jiang, Csaba Szepesvri
2021COLTNearly Minimax Optimal Reinforcement Learning for Linear Mixture Markov Decision Processes.Dongruo Zhou, Quanquan Gu, Csaba Szepesvri
2021ICMLSparse Feature Selection Makes Batch Reinforcement Learning More Sample Efficient.Botao Hao, Yaqi Duan, Tor Lattimore, Csaba Szepesvri, Mengdi Wang
2021ICMLBootstrapping Fitted Q-Evaluation for Off-Policy Inference.Botao Hao, Xiang Ji, Yaqi Duan, Hao Lu, Csaba Szepesvri, Mengdi Wang
2021ICMLA Distribution-dependent Analysis of Meta Learning.Mikhail Konobeev, Ilja Kuzborskij, Csaba Szepesvri
2021ICMLMeta-Thompson Sampling.Branislav Kveton, Mikhail Konobeev, Manzil Zaheer, Chih-Wei Hsu, Martin Mladenov, Craig Boutilier, Csaba Szepesvri
2021ICMLImproved Regret Bound and Experience Replay in Regularized Policy Iteration.Nevena Lazic, Dong Yin, Yasin Abbasi-Yadkori, Csaba Szepesvri
2021ICMLLeveraging Non-uniformity in First-order Non-convex Optimization.Jincheng Mei, Yue Gao, Bo Dai, Csaba Szepesvri, Dale Schuurmans
2021ICMLOn the Optimality of Batch Policy Optimization Algorithms.Chenjun Xiao, Yifan Wu, Jincheng Mei, Bo Dai, Tor Lattimore, Lihong Li, Csaba Szepesvri, Dale Schuurmans
2020AISTATSAdaptive Exploration in Linear Contextual Bandit.Botao Hao, Tor Lattimore, Csaba Szepesvri
2020AISTATSRandomized Exploration in Generalized Linear Bandits.Branislav Kveton, Manzil Zaheer, Csaba Szepesvri, Lihong Li, Mohammad Ghavamzadeh, Craig Boutilier
2020COLTExploration by Optimisation in Partial Monitoring.Tor Lattimore, Csaba Szepesvri
2020ICLRBehaviour Suite for Reinforcement Learning.Ian Osband, Yotam Doron, Matteo Hessel, John Aslanides, Eren Sezener, Andre Saraiva, Katrina McKinney, Tor Lattimore, Csaba Szepesvri, Satinder Singh, Benjamin Van Roy, Richard S. Sutton, David Silver, Hado van Hasselt
2020ICMLModel-Based Reinforcement Learning with Value-Targeted Regression.Alex Ayoub, Zeyu Jia, Csaba Szepesvri, Mengdi Wang, Lin Yang
2020ICMLA simpler approach to accelerated optimization: iterative averaging meets optimism.Pooria Joulani, Anant Raj, Andrs Gyrgy, Csaba Szepesvri
2020ICMLLearning with Good Feature Representations in Bandits and in RL with a Generative Model.Tor Lattimore, Csaba Szepesvri, Gellrt Weisz
2020ICMLOn the Global Convergence Rates of Softmax Policy Gradient Methods.Jincheng Mei, Chenjun Xiao, Csaba Szepesvri, Dale Schuurmans
2019AAAIAn Exponential Tail Bound for the Deleted Estimate.Karim T. Abou-Moustafa, Csaba Szepesvri
2019AISTATSModel-Free Linear Quadratic Control via Reduction to Expert Prediction.Yasin Abbasi-Yadkori, Nevena Lazic, Csaba Szepesvri
2019AISTATSOnline Algorithm for Unsupervised Sensor Selection.Arun Verma, Manjesh Kumar Hanawal, Csaba Szepesvri, Venkatesh Saligrama
2019ALTAn Exponential Efron-Stein Inequality forKarim T. Abou-Moustafa, Csaba Szepesvri
2019ALTCleaning up the neighborhood: A full classification for adversarial partial monitoring.Tor Lattimore, Csaba Szepesvri
2019COLTDistribution-Dependent Analysis of Gibbs-ERM Principle.Ilja Kuzborskij, Nicol Cesa-Bianchi, Csaba Szepesvri
2019COLTAn Information-Theoretic Approach to Minimax Regret in Partial Monitoring.Tor Lattimore, Csaba Szepesvri
2019ICLRRigorous Agent Evaluation: An Adversarial Approach to Uncover Catastrophic Failures.Jonathan Uesato, Ananya Kumar, Csaba Szepesvri, Tom Erez, Avraham Ruderman, Keith Anderson, Krishnamurthy (Dj) Dvijotham, Nicolas Heess, Pushmeet Kohli
2019ICMLGarbage In, Reward Out: Bootstrapping Exploration in Multi-Armed Bandits.Branislav Kveton, Csaba Szepesvri, Sharan Vaswani, Zheng Wen, Tor Lattimore, Mohammad Ghavamzadeh
2019ICMLOnline Learning to Rank with Features.Shuai Li, Tor Lattimore, Csaba Szepesvri
2019ICMLCapsAndRuns: An Improved Method for Approximately Optimal Algorithm Configuration.Gellrt Weisz, Andrs Gyrgy, Csaba Szepesvri
2019IJCAIPerturbed-History Exploration in Stochastic Multi-Armed Bandits.Branislav Kveton, Csaba Szepesvri, Mohammad Ghavamzadeh, Craig Boutilier
2019UAIBubbleRank: Safe Online Learning to Re-Rank via Implicit Click Feedback.Chang Li, Branislav Kveton, Tor Lattimore, Ilya Markov, Maarten de Rijke, Csaba Szepesvri, Masrour Zoghi
2019UAIPerturbed-History Exploration in Stochastic Linear Bandits.Branislav Kveton, Csaba Szepesvri, Mohammad Ghavamzadeh, Craig Boutilier
2018AISTATSLinear Stochastic Approximation: How Far Does Constant Step-Size and Iterate Averaging Go?Chandrashekar Lakshminarayanan, Csaba Szepesvri
2018ICMLGradient Descent for Sparse Rank-One Matrix Completion for Crowd-Sourced Aggregation of Sparsely Interacting Workers.Yao Ma, Alexander Olshevsky, Csaba Szepesvri, Venkatesh Saligrama
2018ICMLBandits with Delayed, Aggregated Anonymous Feedback.Ciara Pike-Burke, Shipra Agrawal, Csaba Szepesvri, Steffen Grnewlder
2018ICMLLEAPSANDBOUNDS: A Method for Approximately Optimal Algorithm Configuration.Gellrt Weisz, Andrs Gyrgy, Csaba Szepesvri
2018ISAIMAn Exponential Tail Bound for Lq Stable Learning Rules. Application to k-Folds Cross-Validation.Karim T. Abou-Moustafa, Csaba Szepesvri
2017AISTATSUnsupervised Sequential Sensor Acquisition.Manjesh Kumar Hanawal, Csaba Szepesvri, Venkatesh Saligrama
2017AISTATSStochastic Rank-1 Bandits.Sumeet Katariya, Branislav Kveton, Csaba Szepesvri, Claire Vernade, Zheng Wen
2017AISTATSThe End of Optimism? An Asymptotic Analysis of Finite-Armed Linear Bandits.Tor Lattimore, Csaba Szepesvri
2017ALTStructured Best Arm Identification with Fixed Confidence.Ruitong Huang, Mohammad M. Ajallooeian, Csaba Szepesvri, Martin Mller
2017ALTA Modular Analysis of Adaptive (Non-)Convex Optimization: Optimism, Composite Objectives, and Variational Bounds.Pooria Joulani, Andrs Gyrgy, Csaba Szepesvri
2017ICMLOnline Learning to Rank in Stochastic Click Models.Masrour Zoghi, Toms Tunys, Mohammad Ghavamzadeh, Branislav Kveton, Csaba Szepesvri, Zheng Wen
2017IJCAIBernoulli Rank-1 Bandits for Click Feedback.Sumeet Katariya, Branislav Kveton, Csaba Szepesvri, Claire Vernade, Zheng Wen
2016AAAIDelay-Tolerant Online Convex Optimization: Unified Analysis and Adaptive-Gradient Algorithms.Pooria Joulani, Andrs Gyrgy, Csaba Szepesvri
2016AAAICompressed Conditional Mean Embeddings for Model-Based Reinforcement Learning.Guy Lever, John Shawe-Taylor, Ronnie Stafford, Csaba Szepesvri
2016AISTATS(Bandit) Convex Optimization with Biased Noisy Gradient Oracles.Xiaowei Hu, Prashanth L. A., Andrs Gyrgy, Csaba Szepesvri
2016ICMLCumulative Prospect Theory Meets Reinforcement Learning: Prediction and Control.Prashanth L. A., Cheng Jie, Michael C. Fu, Steven I. Marcus, Csaba Szepesvri
2016ICMLShifting Regret, Mirror Descent, and Matrices.Andrs Gyrgy, Csaba Szepesvri
2016ICMLDCM Bandits: Learning to Rank with Multiple Clicks.Sumeet Katariya, Branislav Kveton, Csaba Szepesvri, Zheng Wen
2016ICMLConservative Bandits.Yifan Wu, Roshan Shariff, Tor Lattimore, Csaba Szepesvri
2015AAAIDecision-Theoretic Clustering of Strategies.Nolan Bard, Deon Nicholas, Csaba Szepesvri, Michael Bowling
2015AAAIPathological Effects of Variance on Classification-Based Policy Iteration.Bernardo vila Pires, Csaba Szepesvri
2015AISTATSNear-optimal max-affine estimators for convex regression.Gbor Balzs, Andrs Gyrgy, Csaba Szepesvri
2015AISTATSTight Regret Bounds for Stochastic Combinatorial Semi-Bandits.Branislav Kveton, Zheng Wen, Azin Ashkan, Csaba Szepesvri
2015AISTATSToward Minimax Off-policy Value Estimation.Lihong Li, Rmi Munos, Csaba Szepesvri
2015AISTATSExploiting Symmetries to Construct Efficient MCMC Algorithms With an Application to SLAM.Roshan Shariff, Andrs Gyrgy, Csaba Szepesvri
2015ICMLDeterministic Independent Component Analysis.Ruitong Huang, Andrs Gyrgy, Csaba Szepesvri
2015ICMLCascading Bandits: Learning to Rank in the Cascade Model.Branislav Kveton, Csaba Szepesvri, Zheng Wen, Azin Ashkan
2015ICMLOn Identifying Good Options under Combinatorially Structured Feedback in Finite Noisy Environments.Yifan Wu, Andrs Gyrgy, Csaba Szepesvri
2015IJCAIFast Cross-Validation for Incremental Learning.Pooria Joulani, Andrs Gyrgy, Csaba Szepesvri
2015UAIBayesian Optimal Control of Smoothly Parameterized Systems.Yasin Abbasi-Yadkori, Csaba Szepesvri
2014AISTATSA Finite-Sample Generalization Bound for Semiparametric Regression: Partially Linear Models.Ruitong Huang, Csaba Szepesvri
2014ALTOn Learning the Optimal Waiting Time.Tor Lattimore, Andrs Gyrgy, Csaba Szepesvri
2014ICMLOnline Learning in Markov Decision Processes with Changing Cost Sequences.Travis Dick, Andrs Gyrgy, Csaba Szepesvri
2014ICMLAdaptive Monte Carlo via Bandit Allocation.James Neufeld, Andrs Gyrgy, Csaba Szepesvri, Dale Schuurmans
2014ISAIMGeneralization Bounds for Partially Linear Models.Ruitong Huang, Csaba Szepesvri
2014UAIOptimal Resource Allocation with Semi-Bandit Feedback.Tor Lattimore, Koby Crammer, Csaba Szepesvri
2013ICMLA Randomized Mirror Descent Algorithm for Large Scale Multiple Kernel Learning.Arash Afkanpour, Andrs Gyrgy, Csaba Szepesvri, Michael Bowling
2013ICMLOnline Learning under Delayed Feedback.Pooria Joulani, Andrs Gyrgy, Csaba Szepesvri
2013ICMLCost-sensitive Multiclass Classification Risk Bounds.Bernardo vila Pires, Csaba Szepesvri, Mohammad Ghavamzadeh
2013ICMLCharacterizing the Representer Theorem.Yaoliang Yu, Hao Cheng, Dale Schuurmans, Csaba Szepesvri
2012AAAIApproximate Policy Iteration with Linear Action Models.Hengshuai Yao, Csaba Szepesvri
2012ALTPartial Monitoring with Side Information.Gbor Bartk, Csaba Szepesvri
2012ICMLAn adaptive algorithm for finite stochastic partial monitoring.Gbor Bartk, Navid Zolghadr, Csaba Szepesvri
2012ICMLStatistical linear estimation with penalized estimators: an application to reinforcement learning.Bernardo vila Pires, Csaba Szepesvri
2012ICMLAnalysis of Kernel Mean Matching under Covariate Shift.Yaoliang Yu, Csaba Szepesvri
2011ALTEditors' Introduction.Jyrki Kivinen, Csaba Szepesvri, Esko Ukkonen, Thomas Zeugmann
2011INFOCOMSequential learning for optimal monitoring of multi-channel wireless networks.Pallavi Arora, Csaba Szepesvri, Rong Zheng
2011UAIPAC-Bayesian Policy Evaluation for Reinforcement Learning.Mahdi Milani Fard, Joelle Pineau, Csaba Szepesvri
2010ALTToward a Classification of Finite Partial-Monitoring Games.Gbor Bartk, Dvid Pl, Csaba Szepesvri
2010COLTThe Online Loop-free Stochastic Shortest-Path Problem.Gergely Neu, Andrs Gyrgy, Csaba Szepesvri
2010ICMLBudgeted Distribution Learning of Belief Net Parameters.Liuyang Li, Barnabs Pczos, Csaba Szepesvri, Russell Greiner
2010ICMLToward Off-Policy Learning Control with Function Approximation.Hamid Reza Maei, Csaba Szepesvri, Shalabh Bhatnagar, Richard S. Sutton
2010ICMLModel-based reinforcement learning with nearly tight exploration complexity bounds.Istvan Szita, Csaba Szepesvri
2010IROSExtending rapidly-exploring random trees for asymptotically optimal anytime motion planning.Yasin Abbasi-Yadkori, Joseph Modayil, Csaba Szepesvri
2009ICMLWorkshop summary: On-line learning with limited feedback.Jean-Yves Audibert, Peter Auer, Alessandro Lazaric, Rmi Munos, Daniil Ryabko, Csaba Szepesvri
2009ICMLLearning to segment from a few well-selected training images.Alireza Farhangfar, Russell Greiner, Csaba Szepesvri
2009ICMLLearning when to stop thinking and do something!Barnabs Pczos, Yasin Abbasi-Yadkori, Csaba Szepesvri, Russell Greiner, Nathan R. Sturtevant
2009ICMLFast gradient-descent methods for temporal-difference learning with linear function approximation.Richard S. Sutton, Hamid Reza Maei, Doina Precup, Shalabh Bhatnagar, David Silver, Csaba Szepesvri, Eric Wiewiora
2009ICRAModel-based and model-free reinforcement learning for visual servoing.Amir Massoud Farahmand, Azad Shademan, Martin Jgersand, Csaba Szepesvri
2008ALTActive Learning in Multi-armed Bandits.Andrs Antos, Varun Grover, Csaba Szepesvri
2008ALTActive Learning of Group-Structured Environments.Gbor Bartk, Csaba Szepesvri, Sandra Zilles
2008ICMLEmpirical Bernstein stopping.Volodymyr Mnih, Csaba Szepesvri, Jean-Yves Audibert
2008UAISpeeding Up Planning in Markov Decision Processes via Automatically Constructed Abstraction.Alejandro Isaza, Csaba Szepesvri, Vadim Bulitko, Russell Greiner
2008UAIDyna-Style Planning with Linear Function Approximation and Prioritized Sweeping.Richard S. Sutton, Csaba Szepesvri, Alborz Geramifard, Michael H. Bowling
2007ALTTuning Bandit Algorithms in Stochastic Environments.Jean-Yves Audibert, Rmi Munos, Csaba Szepesvri
2007COLTImproved Rates for the Stochastic Continuum-Armed Bandit Problem.Peter Auer, Ronald Ortner, Csaba Szepesvri
2007ICMLManifold-adaptive dimension estimation.Amir Massoud Farahmand, Csaba Szepesvri, Jean-Yves Audibert
2007IJCAISequence Prediction Exploiting Similary Information.Istvn Br, Zoltn Szamonek, Csaba Szepesvri
2007IJCAIContinuous Time Associative Bandit Problems.Andrs Gyrgy, Levente Kocsis, Ivett Szab, Csaba Szepesvri
2007UAIApprenticeship Learning using Inverse Reinforcement Learning and Gradient Methods.Gergely Neu, Csaba Szepesvri
2006COLTLearning Near-Optimal Policies with Bellman-Residual Minimization Based Fitted Policy Iteration and a Single Sample Path.Andrs Antos, Csaba Szepesvri, Rmi Munos
2005ICDMX-mHMM: An Efficient Algorithm for Training Mixtures of HMMs When the Number of Mixtures Is Unknown.Zoltn Szamonek, Csaba Szepesvri
2005ICMLFinite time bounds for sampling based fitted value iteration.Csaba Szepesvri, Rmi Munos
2004AAAIShortest Path Discovery Problems: A Framework, Algorithms and Experimental Results.Csaba Szepesvri
2004ECAIKernel Machine Based Feature Extraction Algorithms for Regression Problems.Csaba Szepesvri, Andrs Kocsor, Kornl Kovcs
2004ECCVEnhancing Particle Filters Using Local Likelihood Sampling.Pter Torma, Csaba Szepesvri
2004ICMLInterpolation-based Q-learning.Csaba Szepesvri, William D. Smart
2003AISTATSSequential Importance Sampling for Visual Tracking Reconsidered.Pter Torma, Csaba Szepesvri
1998ICMLMulti-criteria Reinforcement Learning.Zoltn Gbor, Zsolt Kalmr, Csaba Szepesvri
1996ICANNInverse Dynamics Controllers for Robust Control: Consequences for Neurocontrollers.Csaba Szepesvri, Andrs Lrincz
1996ICMLA Generalized Reinforcement-Learning Model: Convergence and Applications.Michael L. Littman, Csaba Szepesvri