Skip to content

Richard S. Sutton

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

49

Venues

11

Active years

1985–2025

Best venue rank

A*

Where they publish

Papers

49 indexed papers, newest first.

YearVenueTitleAuthors
2025ICMLMetaOptimize: A Framework for Optimizing Step Sizes and Other Meta-parameters.Arsalan Sharifnassab, Saber Salehkaleybar, Richard S. Sutton
2024AAAIReward-Respecting Subtasks for Model-Based Reinforcement Learning (Abstract Reprint).Richard S. Sutton, Marlos C. Machado, G. Zacharias Holland, David Szepesvari, Finbarr Timbers, Brian Tanner, Adam White
2023ICMLToward Efficient Gradient-Based Value Estimation.Arsalan Sharifnassab, Richard S. Sutton
2021ICMLLearning and Planning in Average-Reward Markov Decision Processes.Yi Wan, Abhishek Naik, Richard S. Sutton
2021ICMLAverage-Reward Off-Policy Policy Evaluation with Function Approximation.Shangtong Zhang, Yi Wan, Richard S. Sutton, Shimon Whiteson
2020AAAIFixed-Horizon Temporal Difference Methods for Stable Reinforcement Learning.Kristopher De Asis, Alan Chan, Silviu Pitis, Richard S. Sutton, Daniel Graves
2020ICLRBehaviour Suite for Reinforcement Learning.Ian Osband, Yotam Doron, Matteo Hessel, John Aslanides, Eren Sezener, Andre Saraiva, Katrina McKinney, Tor Lattimore, Csaba Szepesvri, Satinder Singh, Benjamin Van Roy, Richard S. Sutton, David Silver, Hado van Hasselt
2019IJCAIExtending Sliding-Step Importance Weighting from Supervised Learning to Reinforcement Learning.Tian Tian, Richard S. Sutton
2019IJCAIPlanning with Expectation Models.Yi Wan, Muhammad Zaheer, Adam White, Martha White, Richard S. Sutton
2018AAAIMulti-Step Reinforcement Learning: A Unifying Algorithm.Kristopher De Asis, J. Fernando Hernandez-Garcia, G. Zacharias Holland, Richard S. Sutton
2018UAIPer-decision Multi-step Temporal Difference Learning with Control Variates.Kristopher De Asis, Richard S. Sutton
2018UAIComparing Direct and Indirect Temporal-Difference Methods for Estimating the Variance of the Return.Craig Sherstan, Dylan R. Ashley, Brendan Bennett, Kenny Young, Adam White, Martha White, Richard S. Sutton
2017AIOn Generalized Bellman Equations and Temporal-Difference Learning.Huizhen Yu, Ashique Rupam Mahmood, Richard S. Sutton
2015ICMLA Deeper Look at Planning as Learning from Replay.Harm Vanseijen, Richard S. Sutton
2015UAIOff-policy learning based on weighted importance sampling with linear computational complexity.Ashique Rupam Mahmood, Richard S. Sutton
2014ICMLTrue Online TD(lambda).Harm van Seijen, Richard S. Sutton
2014ICMLA new Q(lambda) with interim forward view and Monte Carlo equivalence.Richard S. Sutton, Ashique Rupam Mahmood, Doina Precup, Hado van Hasselt
2014UAIOff-policy TD( l) with a true online equivalence.Hado van Hasselt, Ashique Rupam Mahmood, Richard S. Sutton
2013AAAIRepresentation Search through Generate and Test.Ashique Rupam Mahmood, Richard S. Sutton
2013ICMLPlanning by Prioritized Sweeping with Small Backups.Harm van Seijen, Richard S. Sutton
2012ICASSPTuning-free step-size adaptation.Ashique Rupam Mahmood, Richard S. Sutton, Thomas Degris, Patrick M. Pilarski
2012ICMLLinear Off-Policy Actor-Critic.Thomas Degris, Martha White, Richard S. Sutton
2012SMCAcquiring a broad range of empirical knowledge in real time by temporal-difference learning.Joseph Modayil, Adam White, Patrick M. Pilarski, Richard S. Sutton
2011ILPBeyond Reward: The Problem of Knowledge and Data.Richard S. Sutton
2010ICMLToward Off-Policy Learning Control with Function Approximation.Hamid Reza Maei, Csaba Szepesvri, Shalabh Bhatnagar, Richard S. Sutton
2009ICMLFast gradient-descent methods for temporal-difference learning with linear function approximation.Richard S. Sutton, Hamid Reza Maei, Doina Precup, Shalabh Bhatnagar, David Silver, Csaba Szepesvri, Eric Wiewiora
2008ICMLSample-based learning and search with permanent and transient memories.David Silver, Richard S. Sutton, Martin Mller
2008UAIDyna-Style Planning with Linear Function Approximation and Prioritized Sweeping.Richard S. Sutton, Csaba Szepesvri, Alborz Geramifard, Michael H. Bowling
2007ICMLOn the role of tracking in stationary environments.Richard S. Sutton, Anna Koop, David Silver
2007IJCAIReinforcement Learning of Local Shape in the Game of Go.David Silver, Richard S. Sutton, Martin Mller
2006AAAIIncremental Least-Squares Temporal Difference Learning.Alborz Geramifard, Michael H. Bowling, Richard S. Sutton
2005ICMLTD(lambda) networks: temporal-difference networks with eligibility traces.Brian Tanner, Richard S. Sutton
2005IJCAIUsing Predictive Representations to Improve Generalization in Reinforcement Learning.Eddie J. Rafols, Mark B. Ring, Richard S. Sutton, Brian Tanner
2005IJCAITemporal-Difference Networks with History.Brian Tanner, Richard S. Sutton
2001ICMLOff-Policy Temporal Difference Learning with Function Approximation.Doina Precup, Richard S. Sutton, Sanjoy Dasgupta
2001ICMLScaling Reinforcement Learning toward RoboCup Soccer.Peter Stone, Richard S. Sutton
2001RoboCupKeepaway Soccer: A Machine Learning Testbed.Peter Stone, Richard S. Sutton
2000ICMLEligibility Traces for Off-Policy Policy Evaluation.Doina Precup, Richard S. Sutton, Satinder Singh
2000RoboCupReinforcement Learning for 3 vs. 2 KeepawayPeter Stone, Richard S. Sutton, Satinder Singh
1998ICMLIntra-Option Learning about Temporally Abstract Actions.Richard S. Sutton, Doina Precup, Satinder Singh
1997ICANNOn the Significance of Markov Decision Processes.Richard S. Sutton
1997ICMLExponentiated Gradient Methods for Reinforcement Learning.Doina Precup, Richard S. Sutton
1995ICMLTD Models: Modeling the World at a Mixture of Time Scales.Richard S. Sutton
1993ICMLOnline Learning with Random Representations.Richard S. Sutton, Steven D. Whitehead
1992AAAIAdapting Bias by Gradient Descent: An Incremental Version of Delta-Bar-Delta.Richard S. Sutton
1991ICMLPlanning by Incremental Dynamic Programming.Richard S. Sutton
1991ICMLLearning Polynomial Functions by Feature Construction.Richard S. Sutton, Christopher J. Matheus
1990ICMLIntegrated Architectures for Learning, Planning, and Reacting Based on Approximating Dynamic Programming.Richard S. Sutton
1985IJCAITraining and Tracking in Robotics.Oliver G. Selfridge, Richard S. Sutton, Andrew G. Barto