Aviral Kumar
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
42
Venues
8
Active years
2017–2025
Best venue rank
A*
Where they publish
Papers
42 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | ICLR | RRM: Robust Reward Model Training Mitigates Reward Hacking. | Tianqi Liu, Wei Xiong, Jie Ren, Lichang Chen, Junru Wu, Rishabh Joshi, Yang Gao, Jiaming Shen, Zhen Qin, Tianhe Yu, Daniel Sohn, Anastasia Makarova, Jeremiah Zhe Liu, Yuan Liu, Bilal Piot, Abe Ittycheriah, Aviral Kumar, Mohammad Saleh |
| 2025 | ICLR | Digi-Q: Learning VLM Q-Value Functions for Training Device-Control Agents. | Hao Bai, Yifei Zhou, Li Erran Li, Sergey Levine, Aviral Kumar |
| 2025 | ICLR | Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models. | Yinlam Chow, Guy Tennenholtz, Izzeddin Gur, Vincent Zhuang, Bo Dai, Aviral Kumar, Rishabh Agarwal, Sridhar Thiagarajan, Craig Boutilier, Aleksandra Faust |
| 2025 | ICLR | Training Language Models to Self-Correct via Reinforcement Learning. | Aviral Kumar, Vincent Zhuang, Rishabh Agarwal, Yi Su, John D. Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M. Zhang, Kay McKinney, Disha Shrivastava, Cosmin Paduraru, George Tucker, Doina Precup, Feryal M. P. Behbahani, Aleksandra Faust |
| 2025 | ICLR | Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning. | Amrith Setlur, Chirag Nagpal, Adam Fisch, Xinyang Geng, Jacob Eisenstein, Rishabh Agarwal, Alekh Agarwal, Jonathan Berant, Aviral Kumar |
| 2025 | ICLR | Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Parameters for Reasoning. | Charlie Victor Snell, Jaehoon Lee, Kelvin Xu, Aviral Kumar |
| 2025 | ICLR | Generative Verifiers: Reward Modeling as Next-Token Prediction. | Lunjun Zhang, Arian Hosseini, Hritik Bansal, Mehran Kazemi, Aviral Kumar, Rishabh Agarwal |
| 2025 | ICLR | Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data. | Zhiyuan Zhou, Andy Peng, Qiyang Li, Sergey Levine, Aviral Kumar |
| 2025 | ICML | What Do Learning Dynamics Reveal About Generalization in LLM Mathematical Reasoning? | Katie Kang, Amrith Setlur, Dibya Ghosh, Jacob Steinhardt, Claire J. Tomlin, Sergey Levine, Aviral Kumar |
| 2025 | ICML | Optimizing Test-Time Compute via Meta Reinforcement Finetuning. | Yuxiao Qu, Matthew Y. R. Yang, Amrith Setlur, Lewis Tunstall, Edward Emanuel Beeching, Ruslan Salakhutdinov, Aviral Kumar |
| 2025 | ICML | Value-Based Deep RL Scales Predictably. | Oleh Rybkin, Michal Nauman, Preston Fu, Charlie Victor Snell, Pieter Abbeel, Sergey Levine, Aviral Kumar |
| 2025 | ICML | Scaling Test-Time Compute Without Verification or RL is Suboptimal. | Amrith Setlur, Nived Rajaraman, Sergey Levine, Aviral Kumar |
| 2025 | NAACL | Unfamiliar Finetuning Examples Control How Language Models Hallucinate. | Katie Kang, Eric Wallace, Claire J. Tomlin, Aviral Kumar, Sergey Levine |
| 2024 | CoRL | Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance. | Mitsuhiko Nakamoto, Oier Mees, Aviral Kumar, Sergey Levine |
| 2024 | ICLR | Zero-Shot Robotic Manipulation with Pre-Trained Image-Editing Diffusion Models. | Kevin Black, Mitsuhiko Nakamoto, Pranav Atreya, Homer Rich Walke, Chelsea Finn, Aviral Kumar, Sergey Levine |
| 2024 | ICML | Stop Regressing: Training Value Functions via Classification for Scalable Deep RL. | Jesse Farebrother, Jordi Orbay, Quan Vuong, Adrien Ali Taga, Yevgen Chebotar, Ted Xiao, Alex Irpan, Sergey Levine, Pablo Samuel Castro, Aleksandra Faust, Aviral Kumar, Rishabh Agarwal |
| 2024 | ICML | Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data. | Fahim Tajwar, Anikait Singh, Archit Sharma, Rafael Rafailov, Jeff Schneider, Tengyang Xie, Stefano Ermon, Chelsea Finn, Aviral Kumar |
| 2024 | ICML | ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL. | Yifei Zhou, Andrea Zanette, Jiayi Pan, Sergey Levine, Aviral Kumar |
| 2024 | ICRA | Robotic Offline RL from Internet Videos via Value-Function Learning. | Chethan Bhateja, Derek Guo, Dibya Ghosh, Anikait Singh, Manan Tomar, Quan Vuong, Yevgen Chebotar, Sergey Levine, Aviral Kumar |
| 2023 | CoRL | Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions. | Yevgen Chebotar, Quan Vuong, Karol Hausman, Fei Xia, Yao Lu, Alex Irpan, Aviral Kumar, Tianhe Yu, Alexander Herzog, Karl Pertsch, Keerthana Gopalakrishnan, Julian Ibarz, Ofir Nachum, Sumedh Anand Sontakke, Grecia Salazar, Huong T. Tran, Jodilyn Peralta, Clayton Tan, Deeksha Manjunath, Jaspiar Singh, Brianna Zitkovich, Tomas Jackson, Kanishka Rao, Chelsea Finn, Sergey Levine |
| 2023 | CoRL | Action-Quantized Offline Reinforcement Learning for Robotic Skill Learning. | Jianlan Luo, Perry Dong, Jeffrey Wu, Aviral Kumar, Xinyang Geng, Sergey Levine |
| 2023 | ICLR | Confidence-Conditioned Value Functions for Offline Reinforcement Learning. | Joey Hong, Aviral Kumar, Sergey Levine |
| 2023 | ICLR | Offline Q-learning on Diverse Multi-Task Data Both Scales And Generalizes. | Aviral Kumar, Rishabh Agarwal, Xinyang Geng, George Tucker, Sergey Levine |
| 2023 | ICLR | Efficient Deep Reinforcement Learning Requires Regulating Overfitting. | Qiyang Li, Aviral Kumar, Ilya Kostrikov, Sergey Levine |
| 2022 | CoRL | Don't Start From Scratch: Leveraging Prior Data to Automate Robotic Reinforcement Learning. | Homer Walke, Jonathan Yang, Albert Yu, Aviral Kumar, Jedrzej Orbik, Avi Singh, Sergey Levine |
| 2022 | ICLR | DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization. | Aviral Kumar, Rishabh Agarwal, Tengyu Ma, Aaron C. Courville, George Tucker, Sergey Levine |
| 2022 | ICLR | Should I Run Offline Reinforcement Learning or Behavioral Cloning? | Aviral Kumar, Joey Hong, Anikait Singh, Sergey Levine |
| 2022 | ICLR | Data-Driven Offline Optimization for Architecting Hardware Accelerators. | Aviral Kumar, Amir Yazdanbakhsh, Milad Hashemi, Kevin Swersky, Sergey Levine |
| 2022 | ICML | Design-Bench: Benchmarks for Data-Driven Offline Model-Based Optimization. | Brandon Trabucco, Xinyang Geng, Aviral Kumar, Sergey Levine |
| 2022 | ICML | How to Leverage Unlabeled Data in Offline Reinforcement Learning. | Tianhe Yu, Aviral Kumar, Yevgen Chebotar, Karol Hausman, Chelsea Finn, Sergey Levine |
| 2022 | RecSys | Off-Policy Actor-critic for Recommender Systems. | Minmin Chen, Can Xu, Vince Gatto, Devanshu Jain, Aviral Kumar, Ed H. Chi |
| 2021 | CoRL | A Workflow for Offline Model-Free Robotic Reinforcement Learning. | Aviral Kumar, Anikait Singh, Stephen Tian, Chelsea Finn, Sergey Levine |
| 2021 | ICLR | OPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement Learning. | Anurag Ajay, Aviral Kumar, Pulkit Agrawal, Sergey Levine, Ofir Nachum |
| 2021 | ICLR | Conservative Safety Critics for Exploration. | Homanga Bharadhwaj, Aviral Kumar, Nicholas Rhinehart, Sergey Levine, Florian Shkurti, Animesh Garg |
| 2021 | ICLR | Benchmarks for Deep Off-Policy Evaluation. | Justin Fu, Mohammad Norouzi, Ofir Nachum, George Tucker, Ziyu Wang, Alexander Novikov, Mengjiao Yang, Michael R. Zhang, Yutian Chen, Aviral Kumar, Cosmin Paduraru, Sergey Levine, Tom Le Paine |
| 2021 | ICLR | Implicit Under-Parameterization Inhibits Data-Efficient Deep Reinforcement Learning. | Aviral Kumar, Rishabh Agarwal, Dibya Ghosh, Sergey Levine |
| 2021 | ICML | Conservative Objective Models for Effective Offline Model-Based Optimization. | Brandon Trabucco, Aviral Kumar, Xinyang Geng, Sergey Levine |
| 2020 | CoRL | Chaining Behaviors from Data with Model-Free Reinforcement Learning. | Avi Singh, Albert Yu, Jonathan Yang, Jesse Zhang, Aviral Kumar, Sergey Levine |
| 2019 | ICML | Diagnosing Bottlenecks in Deep Q-learning Algorithms. | Justin Fu, Aviral Kumar, Matthew Soh, Sergey Levine |
| 2018 | ICML | Trainable Calibration Measures For Neural Networks From Kernel Mean Embeddings. | Aviral Kumar, Sunita Sarawagi, Ujjwal Jain |
| 2017 | ATVA | The Reach-Avoid Problem for Constant-Rate Multi-mode Systems. | Shankara Narayanan Krishna, Aviral Kumar, Fabio Somenzi, Behrouz Touri, Ashutosh Trivedi |
| 2017 | CAV | Challenges and Tool Implementation of Hybrid Rapidly-Exploring Random Trees. | Stanley Bak, Sergiy Bogomolov, Thomas A. Henzinger, Aviral Kumar |