| 2026 | ACL | Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math. | Shrey Pandit, Austin Xu, Xuan-Phi Nguyen, Yifei Ming, Caiming Xiong, Shafiq Joty |
| 2026 | ACL | J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization. | Austin Xu, Yilun Zhou, Xuan-Phi Nguyen, Caiming Xiong, Shafiq Joty |
| 2025 | ACL | Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings. | Austin Xu, Srijan Bansal, Yifei Ming, Semih Yavuz, Shafiq Joty |
| 2025 | EMNLP | Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization. | Chuyuan Li, Austin Xu, Shafiq Joty, Giuseppe Carenini |
| 2025 | EMNLP | Direct Judgement Preference Optimization. | Peifeng Wang, Austin Xu, Yilun Zhou, Caiming Xiong, Shafiq Joty |
| 2025 | ICML | Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators. | Yilun Zhou, Austin Xu, Peifeng Wang, Caiming Xiong, Shafiq Joty |
| 2024 | LAK | Large language model augmented exercise retrieval for personalized language learning. | Austin Xu, Will Monroe, Klinton Bicknell |
| 2023 | CVPR | HandsOff: Labeled Dataset Generation With No Additional Human Annotations. | Austin Xu, Mariya I. Vasileva, Achal Dave, Arjun Seshadri |
| 2023 | UAI | Active metric learning and classification using similarity queries. | Namrata Nadagouda, Austin Xu, Mark A. Davenport |
| 2022 | ICASSP | Delta Distancing: A Lifting Approach to Localizing Items from User Comparisons. | Andrew D. McRae, Austin Xu, Jihui Jin, Namrata Nadagouda, Nauman Ahad, Peimeng Guan, Santhosh Karnik, Mark A. Davenport |