| 2025 | ICLR | Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization. | Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D. Lee, Wen Sun, Akshay Krishnamurthy, Dylan J. Foster |
| 2025 | ICLR | Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF. | Tengyang Xie, Dylan J. Foster, Akshay Krishnamurthy, Corby Rosset, Ahmed Hassan Awadallah, Alexander Rakhlin |
| 2025 | ICML | Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective. | Zeyu Jia, Alexander Rakhlin, Tengyang Xie |
| 2025 | ICML | Reinforce LLM Reasoning through Multi-Agent Reflection. | Yurun Yuan, Tengyang Xie |
| 2024 | ACL | CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples. | Jianrui Zhang, Mu Cai, Tengyang Xie, Yong Jae Lee |
| 2024 | EMNLP | Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts. | Haoxiang Wang, Wei Xiong, Tengyang Xie, Han Zhao, Tong Zhang |
| 2024 | ICLR | Harnessing Density Ratios for Online Reinforcement Learning. | Philip Amortila, Dylan J. Foster, Nan Jiang, Ayush Sekhari, Tengyang Xie |
| 2024 | ICLR | Towards Principled Representation Learning from Videos for Reinforcement Learning. | Dipendra Misra, Akanksha Saran, Tengyang Xie, Alex Lamb, John Langford |
| 2024 | ICML | Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data. | Fahim Tajwar, Anikait Singh, Archit Sharma, Rafael Rafailov, Jeff Schneider, Tengyang Xie, Stefano Ermon, Chelsea Finn, Aviral Kumar |
| 2023 | ICLR | The Role of Coverage in Online Reinforcement Learning. | Tengyang Xie, Dylan J. Foster, Yu Bai, Nan Jiang, Sham M. Kakade |
| 2022 | ICML | Adversarially Trained Actor Critic for Offline Reinforcement Learning. | Ching-An Cheng, Tengyang Xie, Nan Jiang, Alekh Agarwal |
| 2021 | ICML | Interaction-Grounded Learning. | Tengyang Xie, John Langford, Paul Mineiro, Ida Momennejad |
| 2021 | ICML | Batch Value-function Approximation with Only Realizability. | Tengyang Xie, Nan Jiang |
| 2020 | UAI | Q* Approximation Schemes for Batch Reinforcement Learning: A Theoretical Comparison. | Tengyang Xie, Nan Jiang |