| 2026 | AAAI | Asymptotic and Finite Sample Analysis of Nonexpansive Stochastic Approximations with Markovian Noise. | Ethan Blaser, Shangtong Zhang |
| 2026 | DATE | PRISM: A Locality-Aware Near-Memory Processing Framework for Scalable Triangle Counting. | Shangtong Zhang, Xueyan Wang, Yier Jin |
| 2025 | AAAI | Efficient Multi-Policy Evaluation for Reinforcement Learning. | Shuze Daniel Liu, Claire Chen, Shangtong Zhang |
| 2025 | ICLR | Efficient Policy Evaluation with Safety Constraint for Reinforcement Learning. | Claire Chen, Shuze Daniel Liu, Shangtong Zhang |
| 2025 | ICLR | Doubly Optimal Policy Evaluation for Reinforcement Learning. | Shuze Daniel Liu, Claire Chen, Shangtong Zhang |
| 2025 | ICLR | Revisiting a Design Choice in Gradient Temporal Difference Learning. | Xiaochi Qian, Shangtong Zhang |
| 2025 | ICLR | Transformers Can Learn Temporal Difference Methods for In-Context Reinforcement Learning. | Jiuqi Wang, Ethan Blaser, Hadi Daneshmand, Shangtong Zhang |
| 2025 | ICML | Linear Q-Learning Does Not Diverge in L2: Convergence Rates to a Bounded Set. | Xinyu Liu, Zixuan Xie, Shangtong Zhang |
| 2025 | IJCAI | Counterfactual Explanations for Continuous Action Reinforcement Learning. | Shuyang Dong, Shangtong Zhang, Lu Feng |
| 2024 | ICML | Efficient Policy Evaluation with Offline Data Informed Behavior Policy Design. | Shuze Daniel Liu, Shangtong Zhang |
| 2023 | AAAI | A New Challenge in Policy Evaluation. | Shangtong Zhang |
| 2023 | ICML | On the Convergence of SARSA with Linear Function Approximation. | Shangtong Zhang, Remi Tachet des Combes, Romain Laroche |
| 2022 | AAAI | Learning Expected Emphatic Traces for Deep RL. | Ray Jiang, Shangtong Zhang, Veronica Chelu, Adam White, Hado van Hasselt |
| 2021 | AAAI | Mean-Variance Policy Iteration for Risk-Averse Reinforcement Learning. | Shangtong Zhang, Bo Liu, Shimon Whiteson |
| 2021 | ICML | Average-Reward Off-Policy Policy Evaluation with Function Approximation. | Shangtong Zhang, Yi Wan, Richard S. Sutton, Shimon Whiteson |
| 2021 | ICML | Breaking the Deadly Triad with a Target Network. | Shangtong Zhang, Hengshuai Yao, Shimon Whiteson |
| 2021 | IJCAI | Deep Residual Reinforcement Learning (Extended Abstract). | Shangtong Zhang, Wendelin Boehmer, Shimon Whiteson |
| 2020 | AAAI | Mega-Reward: Achieving Human-Level Play without Extrinsic Rewards. | Yuhang Song, Jianyi Wang, Thomas Lukasiewicz, Zhenghua Xu, Shangtong Zhang, Andrzej Wojcicki, Mai Xu |
| 2020 | ICML | GradientDICE: Rethinking Generalized Offline Estimation of Stationary Values. | Shangtong Zhang, Bo Liu, Shimon Whiteson |
| 2020 | ICML | Provably Convergent Two-Timescale Off-Policy Actor-Critic with Function Approximation. | Shangtong Zhang, Bo Liu, Hengshuai Yao, Shimon Whiteson |
| 2019 | AAAI | ACE: An Actor Ensemble Algorithm for Continuous Control with Tree Search. | Shangtong Zhang, Hengshuai Yao |
| 2019 | AAAI | QUOTA: The Quantile Option Architecture for Reinforcement Learning. | Shangtong Zhang, Hengshuai Yao |