| 2026 | ACL | Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards. | Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin |
| 2026 | ACL | Do LLMs Catch Their Own Mistakes? A Comprehensive Benchmark for Reflective Tool Use LLMs. | Zheyuan Liu, Liqiang Xiao, Yang Li, Hyokun Yun, Lihong Li, Chao Zhang, Meng Jiang |
| 2026 | EACL | Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs. | Junbo Li, Peng Zhou, Rui Meng, Meet P. Vadera, Lihong Li, Yang Li |
| 2025 | EMNLP | WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning. | Zhepei Wei, Wenlin Yao, Yao Liu, Weizhi Zhang, Qin Lu, Liang Qiu, Changlong Yu, Puyang Xu, Chao Zhang, Bing Yin, Hyokun Yun, Lihong Li |
| 2022 | ICLR | Understanding Domain Randomization for Sim-to-real Transfer. | Xiaoyu Chen, Jiachen Hu, Chi Jin, Lihong Li, Liwei Wang |
| 2022 | RecSys | Estimating Long-term Effects from Experimental Data. | Ziyang Tang, Yiheng Duan, Steven Zhu, Stephanie Zhang, Lihong Li |
| 2021 | AISTATS | Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with Latent Confounders. | Andrew Bennett, Nathan Kallus, Lihong Li, Ali Mousavi |
| 2021 | ICLR | Efficient Reinforcement Learning in Factored MDPs with Application to Constrained RL. | Xiaoyu Chen, Jiachen Hu, Lihong Li, Liwei Wang |
| 2021 | ICLR | Neural Thompson Sampling. | Weitong Zhang, Dongruo Zhou, Lihong Li, Quanquan Gu |
| 2021 | ICML | Near-Optimal Representation Learning for Linear Bandits and Linear RL. | Jiachen Hu, Xiaoyu Chen, Chi Jin, Lihong Li, Liwei Wang |
| 2021 | ICML | On the Optimality of Batch Policy Optimization Algorithms. | Chenjun Xiao, Yifan Wu, Jincheng Mei, Bo Dai, Tor Lattimore, Lihong Li, Csaba Szepesvri, Dale Schuurmans |
| 2020 | AISTATS | Randomized Exploration in Generalized Linear Bandits. | Branislav Kveton, Manzil Zaheer, Csaba Szepesvri, Lihong Li, Mohammad Ghavamzadeh, Craig Boutilier |
| 2020 | ICLR | Black-box Off-policy Estimation for Infinite-Horizon Reinforcement Learning. | Ali Mousavi, Lihong Li, Qiang Liu, Denny Zhou |
| 2020 | ICLR | Doubly Robust Bias Reduction in Infinite Horizon Off-Policy Estimation. | Ziyang Tang, Yihao Feng, Lihong Li, Dengyong Zhou, Qiang Liu |
| 2020 | ICLR | GenDICE: Generalized Offline Estimation of Stationary Values. | Ruiyi Zhang, Bo Dai, Lihong Li, Dale Schuurmans |
| 2020 | ICML | Batch Stationary Distribution Estimation. | Junfeng Wen, Bo Dai, Lihong Li, Dale Schuurmans |
| 2020 | ICML | Neural Contextual Bandits with UCB-based Exploration. | Dongruo Zhou, Lihong Li, Quanquan Gu |
| 2019 | ICLR | Neural Logic Machines. | Honghua Dong, Jiayuan Mao, Tian Lin, Chong Wang, Lihong Li, Denny Zhou |
| 2019 | ICML | Policy Certificates: Towards Accountable Reinforcement Learning. | Christoph Dann, Lihong Li, Wei Wei, Emma Brunskill |
| 2018 | AAAI | BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems. | Zachary C. Lipton, Xiujun Li, Jianfeng Gao, Lihong Li, Faisal Ahmed, Li Deng |
| 2018 | ACL | Neural Approaches to Conversational AI. | Jianfeng Gao, Michel Galley, Lihong Li |
| 2018 | EMNLP | Subgoal Discovery for Hierarchical Dialogue Policy Learning. | Da Tang, Xiujun Li, Jianfeng Gao, Chong Wang, Lihong Li, Tony Jebara |
| 2018 | ICLR | Boosting the Actor with Dual Critic. | Bo Dai, Albert E. Shaw, Niao He, Lihong Li, Le Song |
| 2018 | ICML | Scalable Bilinear Learning Using State and Action Features. | Yichen Chen, Lihong Li, Mengdi Wang |
| 2018 | ICML | SBEED: Convergent Reinforcement Learning with Nonlinear Function Approximation. | Bo Dai, Albert E. Shaw, Lihong Li, Lin Xiao, Niao He, Zhen Liu, Jianshu Chen, Le Song |
| 2018 | MICCAI | A Fast Automatic Juxta-pleural Lung Nodule Detection Framework Using Convolutional Neural Networks and Vote Algorithm. | Jiaxing Tan, Yumei Huo, Zhengrong Liang, Lihong Li |
| 2018 | SIGIR | Neural Approaches to Conversational AI. | Jianfeng Gao, Michel Galley, Lihong Li |
| 2017 | ACL | Towards End-to-End Reinforcement Learning of Dialogue Agents for Information Access. | Bhuwan Dhingra, Lihong Li, Xiujun Li, Jianfeng Gao, Yun-Nung Chen, Faisal Ahmed, Li Deng |
| 2017 | EMNLP | Composite Task-Completion Dialogue Policy Learning via Hierarchical Deep Reinforcement Learning. | Baolin Peng, Xiujun Li, Lihong Li, Jianfeng Gao, Asli Celikyilmaz, Sungjin Lee, Kam-Fai Wong |
| 2017 | ICLR | Neuro-Symbolic Program Synthesis. | Emilio Parisotto, Abdel-rahman Mohamed, Rishabh Singh, Lihong Li, Dengyong Zhou, Pushmeet Kohli |
| 2017 | ICML | Stochastic Variance Reduction Methods for Policy Evaluation. | Simon S. Du, Jianshu Chen, Lihong Li, Lin Xiao, Dengyong Zhou |
| 2017 | ICML | Provably Optimal Algorithms for Generalized Linear Contextual Bandits. | Lihong Li, Yu Lu, Dengyong Zhou |
| 2017 | IJCNLP | End-to-End Task-Completion Neural Dialogue Systems. | Xiujun Li, Yun-Nung Chen, Lihong Li, Jianfeng Gao, Asli Celikyilmaz |
| 2017 | MICCAI | A Hybrid CNN Feature Model for Pulmonary Nodule Differentiation Task. | Tingting Zhao, Huafeng Wang, Lihong Li, Yifang Qi, Haoqi Gao, Fangfang Han, Zhengrong Liang, Yanmin Qi, Yuan Cao |
| 2016 | ACL | Deep Reinforcement Learning with a Natural Language Action Space. | Ji He, Jianshu Chen, Xiaodong He, Jianfeng Gao, Lihong Li, Li Deng, Mari Ostendorf |
| 2016 | ALT | On the Prior Sensitivity of Thompson Sampling. | Che-Yu Liu, Lihong Li |
| 2016 | COLT | An efficient algorithm for contextual bandits with knapsacks, and an extension to concave objectives. | Shipra Agrawal, Nikhil R. Devanur, Lihong Li |
| 2016 | EMNLP | Deep Reinforcement Learning with a Combinatorial Action Space for Predicting Popular Reddit Threads. | Ji He, Mari Ostendorf, Xiaodong He, Jianshu Chen, Jianfeng Gao, Lihong Li, Li Deng |
| 2016 | ICML | Doubly Robust Off-policy Value Evaluation for Reinforcement Learning. | Nan Jiang, Lihong Li |
| 2016 | SIGIR | Click-based Hot Fixes for Underperforming Torso Queries. | Masrour Zoghi, Toms Tunys, Lihong Li, Damien Jose, Junyan Chen, Chun Ming Chin, Maarten de Rijke |
| 2015 | AISTATS | Toward Minimax Off-policy Value Estimation. | Lihong Li, Rmi Munos, Csaba Szepesvri |
| 2015 | MICCAI | A Novel Dual LevelSets Competition Model for Colon Region Segmentation. | Huafeng Wang, Wenfeng Song, Lihong Li, Haixia Pan, Ming Ma, Weifeng Lv, Zhaohui Zhong, Zhengrong Liang |
| 2015 | WWW | Counterfactual Estimation and Optimization of Click Metrics in Search Engines: A Case Study. | Lihong Li, Shunbao Chen, Jim Kleban, Ankur Gupta |
| 2015 | WSDM | Offline Evaluation and Optimization for Interactive Systems. | Lihong Li |
| 2015 | WSDM | Toward Predicting the Outcome of an A/B Experiment for Search Relevance. | Lihong Li, Jin Young Kim, Imed Zitouni |
| 2014 | ICML | Taming the Monster: A Fast and Simple Algorithm for Contextual Bandits. | Alekh Agarwal, Daniel J. Hsu, Satyen Kale, John Langford, Lihong Li, Robert E. Schapire |
| 2014 | ICML | PAC-inspired Option Discovery in Lifelong Reinforcement Learning. | Emma Brunskill, Lihong Li |
| 2014 | MICCAI | A Novel Approach on the Colon Wall Segmentation and Its' Application. | Huafeng Wang, Wenfeng Song, Lihong Li, Yuan Cao, Haixia Pan, Ming Ma, Jiang Huang, Guangming Mao, Zhengrong Liang |
| 2013 | MICCAI | A Novel Computer Aided Detection (CADe) Scheme for Colonic Polyps Based on the Structure Decomposition. | Huafeng Wang, Lihong Li, Hao Peng, Hao Han, Bowen Song, Yunhong Wang, Xianfeng Gu, Zhengrong Liang |
| 2013 | MICCAI | A 2.5D Colon Wall Flattening Model for CT-Based Virtual Colonoscopy. | Huafeng Wang, Lihong Li, Hao Han, Rui Shi, Bowen Song, Hao Peng, Yan Liu, Xianfeng Gu, Yunhong Wang, Zhengrong Liang |
| 2013 | UAI | Sample Complexity of Multi-task Reinforcement Learning. | Emma Brunskill, Lihong Li |
| 2012 | WWW | Joint relevance and freshness learning from clickthroughs for news search. | Hongning Wang, Anlei Dong, Lihong Li, Yi Chang, Evgeniy Gabrilovich |
| 2012 | UAI | Sample-efficient Nonstationary Policy Evaluation for Contextual Bandits. | Miroslav Dudk, Dumitru Erhan, John Langford, Lihong Li |
| 2011 | ICML | Doubly Robust Policy Evaluation and Learning. | Miroslav Dudk, John Langford, Lihong Li |
| 2011 | KDD | Unbiased online active learning in data streams. | Wei Chu, Martin Zinkevich, Lihong Li, Achint Thomas, Belle L. Tseng |
| 2011 | WSDM | Unbiased offline evaluation of contextual-bandit-based news article recommendation algorithms. | Lihong Li, Wei Chu, John Langford, Xuanhui Wang |
| 2010 | CIKM | Online learning for recency search ranking using real-time user feedback. | Taesup Moon, Lihong Li, Wei Chu, Ciya Liao, Zhaohui Zheng, Yi Chang |
| 2010 | MICCAI | Haustral Fold Segmentation of CT Colonography Using Ridge Line Detection. | Hongbin Zhu, Lihong Li, Yi Fan, Zhengrong Liang |
| 2010 | WWW | A contextual-bandit approach to personalized news article recommendation. | Lihong Li, Wei Chu, John Langford, Robert E. Schapire |
| 2009 | ICIG | A Framework of Face Tracking with Classification Using CAMShift-C and LBP. | Xian Wu, Lihong Li, Jian-Huang Lai, Jian Huang |
| 2009 | ICML | The adaptive | Carlos Diuk, Lihong Li, Bethany R. Leffler |
| 2009 | ICML | Workshop summary: Results of the 2009 reinforcement learning competition. | David Wingate, Carlos Diuk, Lihong Li, Matthew Taylor, Jordan Frank |
| 2009 | Interspeech | Reinforcement learning for dialog management using least-squares Policy iteration and fast feature selection. | Lihong Li, Jason D. Williams, Suhrid Balakrishnan |
| 2009 | UAI | A Bayesian Sampling Approach to Exploration in Reinforcement Learning. | John Asmuth, Lihong Li, Michael L. Littman, Ali Nouri, David Wingate |
| 2008 | APWEB | Feature Matrix Extraction and Classification of XML Pages. | Hongcan Yan, Dianchuan Jin, Lihong Li, Baoxiang Liu, Yanan Hao |
| 2008 | ICML | A worst-case comparison between temporal difference and residual gradient with linear function approximation. | Lihong Li |
| 2008 | ICML | Knows what it knows: a framework for self-aware learning. | Lihong Li, Michael L. Littman, Thomas J. Walsh |
| 2008 | ICML | An analysis of linear models, linear value-function approximation, and feature selection for reinforcement learning. | Ronald Parr, Lihong Li, Gavin Taylor, Christopher Painter-Wakefield, Michael L. Littman |
| 2008 | ISAIM | Efficient Value-Function Approximation via Online Linear Regression. | Lihong Li, Michael L. Littman |
| 2008 | UAI | CORL: A Continuous-state Offset-dynamics Reinforcement Learner. | Emma Brunskill, Bethany R. Leffler, Lihong Li, Michael L. Littman, Nicholas Roy |
| 2007 | ICML | Analyzing feature generation for value-function approximation. | Ronald Parr, Christopher Painter-Wakefield, Lihong Li, Michael L. Littman |
| 2006 | ICASSP | Tissue Mixture Characterization In The Presence of Mri Inhomogeneity by the Em Algorithm. | Zhengrong Liang, Lihong Li, Daria Eremina, Hongbing Lu |
| 2006 | ICML | PAC model-free reinforcement learning. | Alexander L. Strehl, Lihong Li, Eric Wiewiora, John Langford, Michael L. Littman |
| 2006 | ISAIM | Towards a Unified Theory of State Abstraction for MDPs. | Lihong Li, Thomas J. Walsh, Michael L. Littman |
| 2006 | UAI | Incremental Model-based Learners With Formal Learning-Time Guarantees. | Alexander L. Strehl, Lihong Li, Michael L. Littman |
| 2005 | AAAI | Lazy Approximation for Solving Continuous Finite-Horizon MDPs. | Lihong Li, Michael L. Littman |
| 2005 | MASS | AASC: adaptive avoid second-collision backoff algorithm for multihop wireless sensor networks. | Chengliang Na, Tingxian Zhou, Lihong Li, Kexin Wang |
| 2003 | IJCAI | Lookahead Pathologies for Single Agent Search. | Vadim Bulitko, Lihong Li, Russell Greiner, Ilya Levner |