| 2025 | ACL | Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding. | Kung-Hsiang Huang, Can Qin, Haoyi Qiu, Philippe Laban, Shafiq Joty, Caiming Xiong, Chien-Sheng Wu |
| 2025 | ACL | KRISTEVA: Close Reading as a Novel Task for Benchmarking Interpretive Reasoning. | Peiqi Sui, Juan Diego Rodriguez, Philippe Laban, Dean Murphy, Joseph P. Dexter, Richard Jean So, Samuel Baker, Pramit Chaudhuri |
| 2025 | CHI | Can AI writing be salvaged? Mitigating Idiosyncrasies and Improving Human-AI Alignment in the Writing Process through Edits. | Tuhin Chakrabarty, Philippe Laban, Chien-Sheng Wu |
| 2025 | ICLR | BingoGuard: LLM Content Moderation Tools with Risk Levels. | Fan Yin, Philippe Laban, Xiangyu Peng, Yilun Zhou, Yixin Mao, Vaibhav Vats, Linnea Ross, Divyansh Agarwal, Caiming Xiong, Chien-Sheng Wu |
| 2025 | NAACL | CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic Environments. | Kung-Hsiang Huang, Akshara Prabhakar, Sidharth Dhawan, Yixin Mao, Huan Wang, Silvio Savarese, Caiming Xiong, Philippe Laban, Chien-Sheng Wu |
| 2025 | NAACL | Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage. | Kaige Xie, Philippe Laban, Prafulla Kumar Choubey, Caiming Xiong, Chien-Sheng Wu |
| 2024 | ACL | Automatic and Human-AI Interactive Text Generation (with a focus on Text Simplification and Revision). | Yao Dou, Philippe Laban, Claire Gardent, Wei Xu |
| 2024 | CHI | Art or Artifice? Large Language Models and the False Promise of Creativity. | Tuhin Chakrabarty, Philippe Laban, Divyansh Agarwal, Smaranda Muresan, Chien-Sheng Wu |
| 2024 | EMNLP | Prompt Leakage effect and mitigation strategies for multi-turn LLM Applications. | Divyansh Agarwal, Alexander R. Fabbri, Ben Risher, Philippe Laban, Shafiq Joty, Chien-Sheng Wu |
| 2024 | EMNLP | Summary of a Haystack: A Challenge to Long-Context LLMs and RAG Systems. | Philippe Laban, Alexander R. Fabbri, Caiming Xiong, Chien-Sheng Wu |
| 2024 | EMNLP | MiniCheck: Efficient Fact-Checking of LLMs on Grounding Documents. | Liyan Tang, Philippe Laban, Greg Durrett |
| 2024 | NAACL | Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News Articles. | Kung-Hsiang Huang, Philippe Laban, Alexander R. Fabbri, Prafulla Kumar Choubey, Shafiq Joty, Caiming Xiong, Chien-Sheng Wu |
| 2024 | UIST | Beyond the Chat: Executable and Verifiable Text-Editing with LLMs. | Philippe Laban, Jesse Vig, Marti A. Hearst, Caiming Xiong, Chien-Sheng Wu |
| 2023 | ACL | SWiPE: A Dataset for Document-Level Simplification of Wikipedia Pages. | Philippe Laban, Jesse Vig, Wojciech Kryscinski, Shafiq Joty, Caiming Xiong, Chien-Sheng Wu |
| 2023 | ACL | Understanding Factual Errors in Summarization: Errors, Summarizers, Datasets, Error Detectors. | Liyan Tang, Tanya Goyal, Alexander R. Fabbri, Philippe Laban, Jiacheng Xu, Semih Yavuz, Wojciech Kryscinski, Justin F. Rousseau, Greg Durrett |
| 2023 | ACL | Did You Read the Instructions? Rethinking the Effectiveness of Task Definitions in Instruction Learning. | Fan Yin, Jesse Vig, Philippe Laban, Shafiq Joty, Caiming Xiong, Chien-Sheng Wu |
| 2023 | CHI | Designing and Evaluating Interfaces that Highlight News Coverage Diversity Using Discord Questions. | Philippe Laban, Chien-Sheng Wu, Lidiya Murakhovs'ka, Xiang 'Anthony' Chen, Caiming Xiong |
| 2023 | EMNLP | SummEdits: Measuring LLM Ability at Factual Reasoning Through The Lens of Summarization. | Philippe Laban, Wojciech Kryscinski, Divyansh Agarwal, Alexander R. Fabbri, Caiming Xiong, Shafiq Joty, Chien-Sheng Wu |
| 2023 | EMNLP | Salespeople vs SalesBot: Exploring the Role of Educational Value in Conversational Recommender Systems. | Lidiya Murakhovs'ka, Philippe Laban, Tian Xie, Caiming Xiong, Chien-Sheng Wu |
| 2023 | EMNLP | INTELMO: Enhancing Models' Adoption of Interactive Interfaces. | Chunxu Yang, Chien-Sheng Wu, Lidiya Murakhovs'ka, Philippe Laban, Xiang Chen |
| 2022 | EMNLP | Near-Negative Distinction: Giving a Second Life to Human Evaluation Datasets. | Philippe Laban, Chien-Sheng Wu, Wenhao Liu, Caiming Xiong |
| 2022 | EMNLP | Discord Questions: A Computational Approach To Diversity Analysis in News Coverage. | Philippe Laban, Chien-Sheng Wu, Lidiya Murakhovs'ka, Xiang 'Anthony' Chen, Caiming Xiong |
| 2022 | IUI | NewsPod: Automatic and Interactive News Podcasts. | Philippe Laban, Elicia Ye, Srujay Korlakunta, John F. Canny, Marti A. Hearst |
| 2022 | NAACL | Quiz Design Task: Helping Teachers Create Quizzes with Automated Question Generation. | Philippe Laban, Chien-Sheng Wu, Lidiya Murakhovs'ka, Wenhao Liu, Caiming Xiong |
| 2022 | NAACL | MixQG: Neural Question Generation with Mixed Answer Types. | Lidiya Murakhovs'ka, Chien-Sheng Wu, Philippe Laban, Tong Niu, Wenhao Liu, Caiming Xiong |
| 2021 | ACL | Can Transformer Models Measure Coherence In Text: Re-Thinking the Shuffle Test. | Philippe Laban, Luke Dai, Lucas Bandarkar, Marti A. Hearst |
| 2021 | ACL | Keep It Simple: Unsupervised Simplification of Multi-Paragraph Text. | Philippe Laban, Tobias Schnabel, Paul N. Bennett, Marti A. Hearst |
| 2021 | NAACL | News Headline Grouping as a Challenging NLU Task. | Philippe Laban, Lucas Bandarkar, Marti A. Hearst |
| 2020 | ACL | What's The Latest? A Question-driven News Chatbot. | Philippe Laban, John F. Canny, Marti A. Hearst |
| 2020 | ACL | The Summary Loop: Learning to Write Abstractive Summaries Without Examples. | Philippe Laban, Andrew Hsi, John F. Canny, Marti A. Hearst |
| 2017 | ACL | newsLens: building and visualizing long-ranging news stories. | Philippe Laban, Marti A. Hearst |