| 2023 | AAAI | The Sufficiency of Off-Policyness and Soft Clipping: PPO Is Still Insufficient according to an Off-Policy Measure. | Xing Chen, Dongcui Diao, Hechang Chen, Hengshuai Yao, Haiyin Piao, Zhixiao Sun, Zhiwei Yang, Randy Goebel, Bei Jiang, Yi Chang |
| 2022 | UAI | Understanding and mitigating the limitations of prioritized experience replay. | Yangchen Pan, Jincheng Mei, Amir-massoud Farahmand, Martha White, Hengshuai Yao, Mohsen Rohani, Jun Luo |
| 2021 | ICML | Breaking the Deadly Triad with a Target Network. | Shangtong Zhang, Hengshuai Yao, Shimon Whiteson |
| 2020 | ICML | Provably Convergent Two-Timescale Off-Policy Actor-Critic with Function Approximation. | Shangtong Zhang, Bo Liu, Hengshuai Yao, Shimon Whiteson |
| 2020 | IJCAI | Weakly Supervised Few-shot Object Segmentation using Co-Attention with Visual and Semantic Embeddings. | Mennatullah Siam, Naren Doraiswamy, Boris N. Oreshkin, Hengshuai Yao, Martin Jgersand |
| 2020 | ICRA | Mapless Navigation among Dynamics with Social-safety-awareness: a reinforcement learning approach from 2D laser scans. | Jun Jin, Nhat M. Nguyen, Nazmus Sakib, Daniel Graves, Hengshuai Yao, Martin Jgersand |
| 2019 | AAAI | ACE: An Actor Ensemble Algorithm for Continuous Control with Tree Search. | Shangtong Zhang, Hengshuai Yao |
| 2019 | AAAI | QUOTA: The Quantile Option Architecture for Reinforcement Learning. | Shangtong Zhang, Hengshuai Yao |
| 2019 | ICDM | M-estimation in Low-Rank Matrix Factorization: A General Framework. | Wei Tu, Peng Liu, Jingyu Zhao, Yi Liu, Linglong Kong, Guodong Li, Bei Jiang, Guangjian Tian, Hengshuai Yao |
| 2019 | ICML | Distributional Reinforcement Learning for Efficient Exploration. | Borislav Mavrin, Hengshuai Yao, Linglong Kong, Kaiwen Wu, Yaoliang Yu |
| 2019 | IJCAI | Hill Climbing on Value Estimates for Search-control in Dyna. | Yangchen Pan, Hengshuai Yao, Amir-massoud Farahmand, Martha White |
| 2014 | WWW | Learning to predict trending queries: classification - based. | Chi-Hoon Lee, Hengshuai Yao, Xu He, Su Han Chan, JieYang Chang, Farzin Maghoul |
| 2012 | AAAI | Approximate Policy Iteration with Linear Action Models. | Hengshuai Yao, Csaba Szepesvri |
| 2008 | ICML | Preconditioned temporal difference learning. | Hengshuai Yao, Zhi-Qiang Liu |
| 2008 | ISAIM | Minimal Residual Approaches for Policy Evaluation in Large Sparse Markov Chains. | Hengshuai Yao, Zhi-Qiang Liu |