Skip to content

Aviral Kumar

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

42

Venues

8

Active years

2017–2025

Best venue rank

A*

Where they publish

Papers

42 indexed papers, newest first.

YearVenueTitleAuthors
2025ICLRRRM: Robust Reward Model Training Mitigates Reward Hacking.Tianqi Liu, Wei Xiong, Jie Ren, Lichang Chen, Junru Wu, Rishabh Joshi, Yang Gao, Jiaming Shen, Zhen Qin, Tianhe Yu, Daniel Sohn, Anastasia Makarova, Jeremiah Zhe Liu, Yuan Liu, Bilal Piot, Abe Ittycheriah, Aviral Kumar, Mohammad Saleh
2025ICLRDigi-Q: Learning VLM Q-Value Functions for Training Device-Control Agents.Hao Bai, Yifei Zhou, Li Erran Li, Sergey Levine, Aviral Kumar
2025ICLRInference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models.Yinlam Chow, Guy Tennenholtz, Izzeddin Gur, Vincent Zhuang, Bo Dai, Aviral Kumar, Rishabh Agarwal, Sridhar Thiagarajan, Craig Boutilier, Aleksandra Faust
2025ICLRTraining Language Models to Self-Correct via Reinforcement Learning.Aviral Kumar, Vincent Zhuang, Rishabh Agarwal, Yi Su, John D. Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M. Zhang, Kay McKinney, Disha Shrivastava, Cosmin Paduraru, George Tucker, Doina Precup, Feryal M. P. Behbahani, Aleksandra Faust
2025ICLRRewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning.Amrith Setlur, Chirag Nagpal, Adam Fisch, Xinyang Geng, Jacob Eisenstein, Rishabh Agarwal, Alekh Agarwal, Jonathan Berant, Aviral Kumar
2025ICLRScaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Parameters for Reasoning.Charlie Victor Snell, Jaehoon Lee, Kelvin Xu, Aviral Kumar
2025ICLRGenerative Verifiers: Reward Modeling as Next-Token Prediction.Lunjun Zhang, Arian Hosseini, Hritik Bansal, Mehran Kazemi, Aviral Kumar, Rishabh Agarwal
2025ICLREfficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data.Zhiyuan Zhou, Andy Peng, Qiyang Li, Sergey Levine, Aviral Kumar
2025ICMLWhat Do Learning Dynamics Reveal About Generalization in LLM Mathematical Reasoning?Katie Kang, Amrith Setlur, Dibya Ghosh, Jacob Steinhardt, Claire J. Tomlin, Sergey Levine, Aviral Kumar
2025ICMLOptimizing Test-Time Compute via Meta Reinforcement Finetuning.Yuxiao Qu, Matthew Y. R. Yang, Amrith Setlur, Lewis Tunstall, Edward Emanuel Beeching, Ruslan Salakhutdinov, Aviral Kumar
2025ICMLValue-Based Deep RL Scales Predictably.Oleh Rybkin, Michal Nauman, Preston Fu, Charlie Victor Snell, Pieter Abbeel, Sergey Levine, Aviral Kumar
2025ICMLScaling Test-Time Compute Without Verification or RL is Suboptimal.Amrith Setlur, Nived Rajaraman, Sergey Levine, Aviral Kumar
2025NAACLUnfamiliar Finetuning Examples Control How Language Models Hallucinate.Katie Kang, Eric Wallace, Claire J. Tomlin, Aviral Kumar, Sergey Levine
2024CoRLSteering Your Generalists: Improving Robotic Foundation Models via Value Guidance.Mitsuhiko Nakamoto, Oier Mees, Aviral Kumar, Sergey Levine
2024ICLRZero-Shot Robotic Manipulation with Pre-Trained Image-Editing Diffusion Models.Kevin Black, Mitsuhiko Nakamoto, Pranav Atreya, Homer Rich Walke, Chelsea Finn, Aviral Kumar, Sergey Levine
2024ICMLStop Regressing: Training Value Functions via Classification for Scalable Deep RL.Jesse Farebrother, Jordi Orbay, Quan Vuong, Adrien Ali Taga, Yevgen Chebotar, Ted Xiao, Alex Irpan, Sergey Levine, Pablo Samuel Castro, Aleksandra Faust, Aviral Kumar, Rishabh Agarwal
2024ICMLPreference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data.Fahim Tajwar, Anikait Singh, Archit Sharma, Rafael Rafailov, Jeff Schneider, Tengyang Xie, Stefano Ermon, Chelsea Finn, Aviral Kumar
2024ICMLArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL.Yifei Zhou, Andrea Zanette, Jiayi Pan, Sergey Levine, Aviral Kumar
2024ICRARobotic Offline RL from Internet Videos via Value-Function Learning.Chethan Bhateja, Derek Guo, Dibya Ghosh, Anikait Singh, Manan Tomar, Quan Vuong, Yevgen Chebotar, Sergey Levine, Aviral Kumar
2023CoRLQ-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions.Yevgen Chebotar, Quan Vuong, Karol Hausman, Fei Xia, Yao Lu, Alex Irpan, Aviral Kumar, Tianhe Yu, Alexander Herzog, Karl Pertsch, Keerthana Gopalakrishnan, Julian Ibarz, Ofir Nachum, Sumedh Anand Sontakke, Grecia Salazar, Huong T. Tran, Jodilyn Peralta, Clayton Tan, Deeksha Manjunath, Jaspiar Singh, Brianna Zitkovich, Tomas Jackson, Kanishka Rao, Chelsea Finn, Sergey Levine
2023CoRLAction-Quantized Offline Reinforcement Learning for Robotic Skill Learning.Jianlan Luo, Perry Dong, Jeffrey Wu, Aviral Kumar, Xinyang Geng, Sergey Levine
2023ICLRConfidence-Conditioned Value Functions for Offline Reinforcement Learning.Joey Hong, Aviral Kumar, Sergey Levine
2023ICLROffline Q-learning on Diverse Multi-Task Data Both Scales And Generalizes.Aviral Kumar, Rishabh Agarwal, Xinyang Geng, George Tucker, Sergey Levine
2023ICLREfficient Deep Reinforcement Learning Requires Regulating Overfitting.Qiyang Li, Aviral Kumar, Ilya Kostrikov, Sergey Levine
2022CoRLDon't Start From Scratch: Leveraging Prior Data to Automate Robotic Reinforcement Learning.Homer Walke, Jonathan Yang, Albert Yu, Aviral Kumar, Jedrzej Orbik, Avi Singh, Sergey Levine
2022ICLRDR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization.Aviral Kumar, Rishabh Agarwal, Tengyu Ma, Aaron C. Courville, George Tucker, Sergey Levine
2022ICLRShould I Run Offline Reinforcement Learning or Behavioral Cloning?Aviral Kumar, Joey Hong, Anikait Singh, Sergey Levine
2022ICLRData-Driven Offline Optimization for Architecting Hardware Accelerators.Aviral Kumar, Amir Yazdanbakhsh, Milad Hashemi, Kevin Swersky, Sergey Levine
2022ICMLDesign-Bench: Benchmarks for Data-Driven Offline Model-Based Optimization.Brandon Trabucco, Xinyang Geng, Aviral Kumar, Sergey Levine
2022ICMLHow to Leverage Unlabeled Data in Offline Reinforcement Learning.Tianhe Yu, Aviral Kumar, Yevgen Chebotar, Karol Hausman, Chelsea Finn, Sergey Levine
2022RecSysOff-Policy Actor-critic for Recommender Systems.Minmin Chen, Can Xu, Vince Gatto, Devanshu Jain, Aviral Kumar, Ed H. Chi
2021CoRLA Workflow for Offline Model-Free Robotic Reinforcement Learning.Aviral Kumar, Anikait Singh, Stephen Tian, Chelsea Finn, Sergey Levine
2021ICLROPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement Learning.Anurag Ajay, Aviral Kumar, Pulkit Agrawal, Sergey Levine, Ofir Nachum
2021ICLRConservative Safety Critics for Exploration.Homanga Bharadhwaj, Aviral Kumar, Nicholas Rhinehart, Sergey Levine, Florian Shkurti, Animesh Garg
2021ICLRBenchmarks for Deep Off-Policy Evaluation.Justin Fu, Mohammad Norouzi, Ofir Nachum, George Tucker, Ziyu Wang, Alexander Novikov, Mengjiao Yang, Michael R. Zhang, Yutian Chen, Aviral Kumar, Cosmin Paduraru, Sergey Levine, Tom Le Paine
2021ICLRImplicit Under-Parameterization Inhibits Data-Efficient Deep Reinforcement Learning.Aviral Kumar, Rishabh Agarwal, Dibya Ghosh, Sergey Levine
2021ICMLConservative Objective Models for Effective Offline Model-Based Optimization.Brandon Trabucco, Aviral Kumar, Xinyang Geng, Sergey Levine
2020CoRLChaining Behaviors from Data with Model-Free Reinforcement Learning.Avi Singh, Albert Yu, Jonathan Yang, Jesse Zhang, Aviral Kumar, Sergey Levine
2019ICMLDiagnosing Bottlenecks in Deep Q-learning Algorithms.Justin Fu, Aviral Kumar, Matthew Soh, Sergey Levine
2018ICMLTrainable Calibration Measures For Neural Networks From Kernel Mean Embeddings.Aviral Kumar, Sunita Sarawagi, Ujjwal Jain
2017ATVAThe Reach-Avoid Problem for Constant-Rate Multi-mode Systems.Shankara Narayanan Krishna, Aviral Kumar, Fabio Somenzi, Behrouz Touri, Ashutosh Trivedi
2017CAVChallenges and Tool Implementation of Hybrid Rapidly-Exploring Random Trees.Stanley Bak, Sergiy Bogomolov, Thomas A. Henzinger, Aviral Kumar