| 2026 | ACL | GTA: Generating Long-horizon Tasks for Web Agents at Scale. | Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu |
| 2026 | ACL | J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization. | Austin Xu, Yilun Zhou, Xuan-Phi Nguyen, Caiming Xiong, Shafiq Joty |
| 2025 | EMNLP | All for One: LLMs Solve Mental Math at the Last Token With Information Transferred From Other Tokens. | Siddarth Mamidanna, Daking Rai, Ziyu Yao, Yilun Zhou |
| 2025 | EMNLP | Direct Judgement Preference Optimization. | Peifeng Wang, Austin Xu, Yilun Zhou, Caiming Xiong, Shafiq Joty |
| 2025 | ICLR | BingoGuard: LLM Content Moderation Tools with Risk Levels. | Fan Yin, Philippe Laban, Xiangyu Peng, Yilun Zhou, Yixin Mao, Vaibhav Vats, Linnea Ross, Divyansh Agarwal, Caiming Xiong, Chien-Sheng Wu |
| 2025 | ICML | Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators. | Yilun Zhou, Austin Xu, Peifeng Wang, Caiming Xiong, Shafiq Joty |
| 2024 | ACL | CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities. | Yujun Mao, Yoon Kim, Yilun Zhou |
| 2023 | AAAI | Explaining Large Language Model-Based Neural Semantic Parsers (Student Abstract). | Daking Rai, Yilun Zhou, Bailin Wang, Ziyu Yao |
| 2023 | ACL | Improving Generalization in Language Model-based Text-to-SQL Semantic Parsing: Two Simple Semantic Boundary-based Techniques. | Daking Rai, Bailin Wang, Yilun Zhou, Ziyu Yao |
| 2023 | AIES | Iterative Partial Fulfillment of Counterfactual Explanations: Benefits and Risks. | Yilun Zhou |
| 2023 | EACL | The Solvability of Interpretability Evaluation Metrics. | Yilun Zhou, Julie Shah |
| 2022 | AAAI | Do Feature Attribution Methods Correctly Attribute Features? | Yilun Zhou, Serena Booth, Marco Tlio Ribeiro, Julie Shah |
| 2022 | NAACL | ExSum: From Local Explanations to Model Understanding. | Yilun Zhou, Marco Tlio Ribeiro, Julie Shah |
| 2021 | AAAI | Bayes-TrEx: a Bayesian Sampling Approach to Model Transparency by Example. | Serena Booth, Yilun Zhou, Ankit Shah, Julie Shah |
| 2021 | AISTATS | Towards Understanding the Behaviors of Optimal Deep Active Learning Algorithms. | Yilun Zhou, Adithya Renduchintala, Xian Li, Sida Wang, Yashar Mehdad, Asish Ghoshal |
| 2021 | CoRL | RoCUS: Robot Controller Understanding via Sampling. | Yilun Zhou, Serena Booth, Nadia Figueroa, Julie Shah |
| 2019 | WWW | Predicting ConceptNet Path Quality Using Crowdsourced Assessments of Naturalness. | Yilun Zhou, Steven Schockaert, Julie Shah |
| 2017 | ICRA | Incorporating side-channel information into convolutional neural networks for robotic tasks. | Yilun Zhou, Kris Hauser |