| 2025 | SWAN: An Efficient and Scalable Approach for Long-Context Language Modeling. | Krishna C. Puvvada, Faisal Ladhak, Santiago Akle Serano, Cheng-Ping Hsieh, Shantanu Acharya, Somshubra Majumdar, Fei Jia, Samuel Kriman, Simeng Sun, Dima Rekesh, Boris Ginsburg |
| 2025 | X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning. | Prasanna Reddy Pulakurthi, Jiamian Wang, Majid Rabbani, Sohail A. Dianat, Raghuveer Rao, Zhiqiang Tao |
| 2025 | Dynamic Evaluation for Oversensitivity in LLMs. | Sophia Xiao Pu, Sitao Cheng, Xin Eric Wang, William Yang Wang |
| 2025 | Advancing Oversight Reasoning across Languages for Audit Sycophantic Behaviour via X-Agent. | Giulia Pucci, Leonardo Ranaldi |
| 2025 | Attacking Misinformation Detection Using Adversarial Examples Generated by Language Models. | Piotr Przybyla, Euan McGill, Horacio Saggion |
| 2025 | Enhancing Study-Level Inference from Clinical Trial Papers via Reinforcement Learning-Based Numeric Reasoning. | Massimiliano Pronesti, Michela Lorandi, Paul Flanagan, Oisin Redmond, Anya Belz, Yufang Hou |
| 2025 | Estimating Machine Translation Difficulty. | Lorenzo Proietti, Stefano Perrella, Vilm Zouhar, Roberto Navigli, Tom Kocmi |
| 2025 | We Argue to Agree: Towards Personality-Driven Argumentation-Based Negotiation Dialogue Systems for Tourism. | Priyanshu Priya, Saurav Dudhate, Desai Yasheshbhai, Asif Ekbal |
| 2025 | FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks. | Tanawan Premsri, Parisa Kordjamshidi |
| 2025 | Glitter: A Multi-Sentence, Multi-Reference Benchmark for Gender-Fair German Machine Translation. | A Pranav, Jania Hackenbuchner, Giuseppe Attanasio, Manuel Lardelli, Anne Lauscher |
| 2025 | SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala. | Ashmari Pramodya, Nirasha Nelki, Heshan Shalinda, Chamila Liyanage, Yusuke Sakai, Randil Pushpananda, Ruvan Weerasinghe, Hidetaka Kamigaito, Taro Watanabe |
| 2025 | Divide, Link, and Conquer: Recall-oriented Schema Linking for NL-to-SQL via Question Decomposition. | Kiran Pradeep, Kirushikesh D. B., Nishtha Madaan, Sameep Mehta, Pushpak Bhattacharyya |
| 2025 | The Power of Framing: How News Headlines Guide Search Behavior. | Amrit Poudel, Maria Milkowski, Tim Weninger |
| 2025 | Can Role Vectors Affect LLM Behaviour? | Daniele Potert, Andrea Seveso, Fabio Mercorio |
| 2025 | Cache Saver: A Modular Framework for Efficient, Affordable, and Reproducible LLM Inference. | Nearchos Potamitis, Lars Henning Klein, Bardia Mohammadi, Chongyang Xu, Attreyee Mukherjee, Niket Tandon, Laurent Bindschaedler, Akhil Arora |
| 2025 | Bhaasha, Bhāṣā, Zaban: A Survey for Low-Resourced Languages in South Asia - Current Stage and Challenges. | Sampoorna Poria, Xiaolei Huang |
| 2025 | Refined Assessment for Translation Evaluation: Rethinking Machine Translation Evaluation in the Era of Human-Level Systems. | Dmitry Popov, Vladislav Negodin, Ekaterina Enikeeva, Iana Matrosova, Nikolay Karpachev, Max Ryabinin |
| 2025 | Extractive Fact Decomposition for Interpretable Natural Language Inference in one Forward Pass. | Nicholas Popovic, Michael Frber |
| 2025 | Dissecting Persona-Driven Reasoning in Language Models via Activation Patching. | Ansh Poonia, Maeghal Jain |
| 2025 | Interpretability Analysis of Arithmetic In-Context Learning in Large Language Models. | Gregory Polyakov, Christian Hepting, Carsten Eickhoff, Seyed Ali Bahrainian |
| 2025 | Reliable Evaluation and Benchmarks for Statement Autoformalization. | Auguste Poiroux, Gail Weiss, Viktor Kuncak, Antoine Bosselut |
| 2025 | RLMEval: Evaluating Research-Level Neural Theorem Proving. | Auguste Poiroux, Antoine Bosselut, Viktor Kuncak |
| 2025 | Hope vs. Hate: Understanding User Interactions with LGBTQ+ News Content in Mainstream US News Media through the Lens of Hope Speech. | Jonathan Pofcher, Christopher M. Homan, Randall Sell, Ashiqur R. KhudaBukhsh |
| 2025 | RAGulator: Lightweight Out-of-Context Detectors for Grounded Text Generation. | Ian Poey, Jiajun Liu, Qishuai Zhong |
| 2025 | Confounding Factors in Relating Model Performance to Morphology. | Wessel Poelman, Thomas Bauwens, Miryam de Lhoneux |