Skip to content

Lihong Li

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

78

Venues

25

Active years

2003–2026

Best venue rank

A*

Where they publish

Papers

78 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLMitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards.Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin
2026ACLDo LLMs Catch Their Own Mistakes? A Comprehensive Benchmark for Reflective Tool Use LLMs.Zheyuan Liu, Liqiang Xiao, Yang Li, Hyokun Yun, Lihong Li, Chao Zhang, Meng Jiang
2026EACLTurn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs.Junbo Li, Peng Zhou, Rui Meng, Meet P. Vadera, Lihong Li, Yang Li
2025EMNLPWebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning.Zhepei Wei, Wenlin Yao, Yao Liu, Weizhi Zhang, Qin Lu, Liang Qiu, Changlong Yu, Puyang Xu, Chao Zhang, Bing Yin, Hyokun Yun, Lihong Li
2022ICLRUnderstanding Domain Randomization for Sim-to-real Transfer.Xiaoyu Chen, Jiachen Hu, Chi Jin, Lihong Li, Liwei Wang
2022RecSysEstimating Long-term Effects from Experimental Data.Ziyang Tang, Yiheng Duan, Steven Zhu, Stephanie Zhang, Lihong Li
2021AISTATSOff-policy Evaluation in Infinite-Horizon Reinforcement Learning with Latent Confounders.Andrew Bennett, Nathan Kallus, Lihong Li, Ali Mousavi
2021ICLREfficient Reinforcement Learning in Factored MDPs with Application to Constrained RL.Xiaoyu Chen, Jiachen Hu, Lihong Li, Liwei Wang
2021ICLRNeural Thompson Sampling.Weitong Zhang, Dongruo Zhou, Lihong Li, Quanquan Gu
2021ICMLNear-Optimal Representation Learning for Linear Bandits and Linear RL.Jiachen Hu, Xiaoyu Chen, Chi Jin, Lihong Li, Liwei Wang
2021ICMLOn the Optimality of Batch Policy Optimization Algorithms.Chenjun Xiao, Yifan Wu, Jincheng Mei, Bo Dai, Tor Lattimore, Lihong Li, Csaba Szepesvri, Dale Schuurmans
2020AISTATSRandomized Exploration in Generalized Linear Bandits.Branislav Kveton, Manzil Zaheer, Csaba Szepesvri, Lihong Li, Mohammad Ghavamzadeh, Craig Boutilier
2020ICLRBlack-box Off-policy Estimation for Infinite-Horizon Reinforcement Learning.Ali Mousavi, Lihong Li, Qiang Liu, Denny Zhou
2020ICLRDoubly Robust Bias Reduction in Infinite Horizon Off-Policy Estimation.Ziyang Tang, Yihao Feng, Lihong Li, Dengyong Zhou, Qiang Liu
2020ICLRGenDICE: Generalized Offline Estimation of Stationary Values.Ruiyi Zhang, Bo Dai, Lihong Li, Dale Schuurmans
2020ICMLBatch Stationary Distribution Estimation.Junfeng Wen, Bo Dai, Lihong Li, Dale Schuurmans
2020ICMLNeural Contextual Bandits with UCB-based Exploration.Dongruo Zhou, Lihong Li, Quanquan Gu
2019ICLRNeural Logic Machines.Honghua Dong, Jiayuan Mao, Tian Lin, Chong Wang, Lihong Li, Denny Zhou
2019ICMLPolicy Certificates: Towards Accountable Reinforcement Learning.Christoph Dann, Lihong Li, Wei Wei, Emma Brunskill
2018AAAIBBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems.Zachary C. Lipton, Xiujun Li, Jianfeng Gao, Lihong Li, Faisal Ahmed, Li Deng
2018ACLNeural Approaches to Conversational AI.Jianfeng Gao, Michel Galley, Lihong Li
2018EMNLPSubgoal Discovery for Hierarchical Dialogue Policy Learning.Da Tang, Xiujun Li, Jianfeng Gao, Chong Wang, Lihong Li, Tony Jebara
2018ICLRBoosting the Actor with Dual Critic.Bo Dai, Albert E. Shaw, Niao He, Lihong Li, Le Song
2018ICMLScalable Bilinear Learning Using State and Action Features.Yichen Chen, Lihong Li, Mengdi Wang
2018ICMLSBEED: Convergent Reinforcement Learning with Nonlinear Function Approximation.Bo Dai, Albert E. Shaw, Lihong Li, Lin Xiao, Niao He, Zhen Liu, Jianshu Chen, Le Song
2018MICCAIA Fast Automatic Juxta-pleural Lung Nodule Detection Framework Using Convolutional Neural Networks and Vote Algorithm.Jiaxing Tan, Yumei Huo, Zhengrong Liang, Lihong Li
2018SIGIRNeural Approaches to Conversational AI.Jianfeng Gao, Michel Galley, Lihong Li
2017ACLTowards End-to-End Reinforcement Learning of Dialogue Agents for Information Access.Bhuwan Dhingra, Lihong Li, Xiujun Li, Jianfeng Gao, Yun-Nung Chen, Faisal Ahmed, Li Deng
2017EMNLPComposite Task-Completion Dialogue Policy Learning via Hierarchical Deep Reinforcement Learning.Baolin Peng, Xiujun Li, Lihong Li, Jianfeng Gao, Asli Celikyilmaz, Sungjin Lee, Kam-Fai Wong
2017ICLRNeuro-Symbolic Program Synthesis.Emilio Parisotto, Abdel-rahman Mohamed, Rishabh Singh, Lihong Li, Dengyong Zhou, Pushmeet Kohli
2017ICMLStochastic Variance Reduction Methods for Policy Evaluation.Simon S. Du, Jianshu Chen, Lihong Li, Lin Xiao, Dengyong Zhou
2017ICMLProvably Optimal Algorithms for Generalized Linear Contextual Bandits.Lihong Li, Yu Lu, Dengyong Zhou
2017IJCNLPEnd-to-End Task-Completion Neural Dialogue Systems.Xiujun Li, Yun-Nung Chen, Lihong Li, Jianfeng Gao, Asli Celikyilmaz
2017MICCAIA Hybrid CNN Feature Model for Pulmonary Nodule Differentiation Task.Tingting Zhao, Huafeng Wang, Lihong Li, Yifang Qi, Haoqi Gao, Fangfang Han, Zhengrong Liang, Yanmin Qi, Yuan Cao
2016ACLDeep Reinforcement Learning with a Natural Language Action Space.Ji He, Jianshu Chen, Xiaodong He, Jianfeng Gao, Lihong Li, Li Deng, Mari Ostendorf
2016ALTOn the Prior Sensitivity of Thompson Sampling.Che-Yu Liu, Lihong Li
2016COLTAn efficient algorithm for contextual bandits with knapsacks, and an extension to concave objectives.Shipra Agrawal, Nikhil R. Devanur, Lihong Li
2016EMNLPDeep Reinforcement Learning with a Combinatorial Action Space for Predicting Popular Reddit Threads.Ji He, Mari Ostendorf, Xiaodong He, Jianshu Chen, Jianfeng Gao, Lihong Li, Li Deng
2016ICMLDoubly Robust Off-policy Value Evaluation for Reinforcement Learning.Nan Jiang, Lihong Li
2016SIGIRClick-based Hot Fixes for Underperforming Torso Queries.Masrour Zoghi, Toms Tunys, Lihong Li, Damien Jose, Junyan Chen, Chun Ming Chin, Maarten de Rijke
2015AISTATSToward Minimax Off-policy Value Estimation.Lihong Li, Rmi Munos, Csaba Szepesvri
2015MICCAIA Novel Dual LevelSets Competition Model for Colon Region Segmentation.Huafeng Wang, Wenfeng Song, Lihong Li, Haixia Pan, Ming Ma, Weifeng Lv, Zhaohui Zhong, Zhengrong Liang
2015WWWCounterfactual Estimation and Optimization of Click Metrics in Search Engines: A Case Study.Lihong Li, Shunbao Chen, Jim Kleban, Ankur Gupta
2015WSDMOffline Evaluation and Optimization for Interactive Systems.Lihong Li
2015WSDMToward Predicting the Outcome of an A/B Experiment for Search Relevance.Lihong Li, Jin Young Kim, Imed Zitouni
2014ICMLTaming the Monster: A Fast and Simple Algorithm for Contextual Bandits.Alekh Agarwal, Daniel J. Hsu, Satyen Kale, John Langford, Lihong Li, Robert E. Schapire
2014ICMLPAC-inspired Option Discovery in Lifelong Reinforcement Learning.Emma Brunskill, Lihong Li
2014MICCAIA Novel Approach on the Colon Wall Segmentation and Its' Application.Huafeng Wang, Wenfeng Song, Lihong Li, Yuan Cao, Haixia Pan, Ming Ma, Jiang Huang, Guangming Mao, Zhengrong Liang
2013MICCAIA Novel Computer Aided Detection (CADe) Scheme for Colonic Polyps Based on the Structure Decomposition.Huafeng Wang, Lihong Li, Hao Peng, Hao Han, Bowen Song, Yunhong Wang, Xianfeng Gu, Zhengrong Liang
2013MICCAIA 2.5D Colon Wall Flattening Model for CT-Based Virtual Colonoscopy.Huafeng Wang, Lihong Li, Hao Han, Rui Shi, Bowen Song, Hao Peng, Yan Liu, Xianfeng Gu, Yunhong Wang, Zhengrong Liang
2013UAISample Complexity of Multi-task Reinforcement Learning.Emma Brunskill, Lihong Li
2012WWWJoint relevance and freshness learning from clickthroughs for news search.Hongning Wang, Anlei Dong, Lihong Li, Yi Chang, Evgeniy Gabrilovich
2012UAISample-efficient Nonstationary Policy Evaluation for Contextual Bandits.Miroslav Dudk, Dumitru Erhan, John Langford, Lihong Li
2011ICMLDoubly Robust Policy Evaluation and Learning.Miroslav Dudk, John Langford, Lihong Li
2011KDDUnbiased online active learning in data streams.Wei Chu, Martin Zinkevich, Lihong Li, Achint Thomas, Belle L. Tseng
2011WSDMUnbiased offline evaluation of contextual-bandit-based news article recommendation algorithms.Lihong Li, Wei Chu, John Langford, Xuanhui Wang
2010CIKMOnline learning for recency search ranking using real-time user feedback.Taesup Moon, Lihong Li, Wei Chu, Ciya Liao, Zhaohui Zheng, Yi Chang
2010MICCAIHaustral Fold Segmentation of CT Colonography Using Ridge Line Detection.Hongbin Zhu, Lihong Li, Yi Fan, Zhengrong Liang
2010WWWA contextual-bandit approach to personalized news article recommendation.Lihong Li, Wei Chu, John Langford, Robert E. Schapire
2009ICIGA Framework of Face Tracking with Classification Using CAMShift-C and LBP.Xian Wu, Lihong Li, Jian-Huang Lai, Jian Huang
2009ICMLThe adaptiveCarlos Diuk, Lihong Li, Bethany R. Leffler
2009ICMLWorkshop summary: Results of the 2009 reinforcement learning competition.David Wingate, Carlos Diuk, Lihong Li, Matthew Taylor, Jordan Frank
2009InterspeechReinforcement learning for dialog management using least-squares Policy iteration and fast feature selection.Lihong Li, Jason D. Williams, Suhrid Balakrishnan
2009UAIA Bayesian Sampling Approach to Exploration in Reinforcement Learning.John Asmuth, Lihong Li, Michael L. Littman, Ali Nouri, David Wingate
2008APWEBFeature Matrix Extraction and Classification of XML Pages.Hongcan Yan, Dianchuan Jin, Lihong Li, Baoxiang Liu, Yanan Hao
2008ICMLA worst-case comparison between temporal difference and residual gradient with linear function approximation.Lihong Li
2008ICMLKnows what it knows: a framework for self-aware learning.Lihong Li, Michael L. Littman, Thomas J. Walsh
2008ICMLAn analysis of linear models, linear value-function approximation, and feature selection for reinforcement learning.Ronald Parr, Lihong Li, Gavin Taylor, Christopher Painter-Wakefield, Michael L. Littman
2008ISAIMEfficient Value-Function Approximation via Online Linear Regression.Lihong Li, Michael L. Littman
2008UAICORL: A Continuous-state Offset-dynamics Reinforcement Learner.Emma Brunskill, Bethany R. Leffler, Lihong Li, Michael L. Littman, Nicholas Roy
2007ICMLAnalyzing feature generation for value-function approximation.Ronald Parr, Christopher Painter-Wakefield, Lihong Li, Michael L. Littman
2006ICASSPTissue Mixture Characterization In The Presence of Mri Inhomogeneity by the Em Algorithm.Zhengrong Liang, Lihong Li, Daria Eremina, Hongbing Lu
2006ICMLPAC model-free reinforcement learning.Alexander L. Strehl, Lihong Li, Eric Wiewiora, John Langford, Michael L. Littman
2006ISAIMTowards a Unified Theory of State Abstraction for MDPs.Lihong Li, Thomas J. Walsh, Michael L. Littman
2006UAIIncremental Model-based Learners With Formal Learning-Time Guarantees.Alexander L. Strehl, Lihong Li, Michael L. Littman
2005AAAILazy Approximation for Solving Continuous Finite-Horizon MDPs.Lihong Li, Michael L. Littman
2005MASSAASC: adaptive avoid second-collision backoff algorithm for multihop wireless sensor networks.Chengliang Na, Tingxian Zhou, Lihong Li, Kexin Wang
2003IJCAILookahead Pathologies for Single Agent Search.Vadim Bulitko, Lihong Li, Russell Greiner, Ilya Levner