| 2025 | Towards Language-Agnostic STIPA: Universal Phonetic Transcription to Support Language Documentation at Scale. | Jacob Lee Suchardt, Hana El-Shazli, Pierluigi Cassotti |
| 2025 | SimBA: Simplifying Benchmark Analysis Using Performance Matrices Alone. | Nishant Subramani, Alfredo Gomez, Mona T. Diab |
| 2025 | Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding. | Melanie Subbiah, Akankshya Mishra, Grace Kim, Liyan Tang, Greg Durrett, Kathleen McKeown |
| 2025 | TSVer: A Benchmark for Fact Verification Against Time-Series Evidence. | Marek Strong, Andreas Vlachos |
| 2025 | Transparent and Coherent Procedural Mistake Detection. | Shane Storks, Itamar Bar-Yossef, Yayuan Li, Zheyuan Zhang, Jason J. Corso, Joyce Chai |
| 2025 | ReCoVeR the Target Language: Language Steering without Sacrificing Task Performance. | Hannah Sterz, Fabian David Schmidt, Goran Glavas, Ivan Vulic |
| 2025 | Debatable Intelligence: Benchmarking LLM Judges via Debate Speech Evaluation. | Noy Sternlicht, Ariel Gera, Roy Bar-Haim, Tom Hope, Noam Slonim |
| 2025 | GmSLM : Generative Marmoset Spoken Language Modeling. | Talia Sternberg, Michael London, David Omer, Yossi Adi |
| 2025 | An Improved, Strong Baseline for Pre-Trained Large Language Models as Task-Oriented Dialogue Systems. | Sebastian Steindl, Andr Kestler, Ulrich Schfer, Bernd Ludwig |
| 2025 | On the Effectiveness of Prompt-Moderated LLMs for Math Tutoring at the Tertiary Level. | Sebastian Steindl, Fabian Brunner, Nada Sissouno, Dominik Schwagerl, Florian Schler-Niewiera, Ulrich Schfer |
| 2025 | Can Out-of-Distribution Evaluations Uncover Reliance on Prediction Shortcuts? A Case Study in Question Answering. | Michal Stefnik, Timothee Mickus, Michal Spiegel, Marek Kadlck, Josef Kuchar |
| 2025 | The Effect of Language Diversity When Fine-Tuning Large Language Models for Translation. | David Stap, Christof Monz |
| 2025 | The Role of Outgoing Connection Heterogeneity in Feedforward Layers of Large Language Models. | Felix Stahlberg, Shankar Kumar |
| 2025 | LLMs cannot spot math errors, even when allowed to peek into the solution. | KV Aditya Srivatsa, Kaushal Kumar Maurya, Ekaterina Kochmar |
| 2025 | OWL: Probing Cross-Lingual Recall of Memorized Texts via World Literature. | Alisha Srivastava, Emir Korukluoglu, Minh Nhat Le, Duyen Tran, Chau Minh Pham, Marzena Karpinska, Mohit Iyyer |
| 2025 | ThinkSLM: Towards Reasoning in Small Language Models. | Gaurav Srivastava, Shuxiang Cao, Xuan Wang |
| 2025 | DEBATE, TRAIN, EVOLVE: Self-Evolution of Language Model Reasoning. | Gaurav Srivastava, Zhenyu Bi, Meng Lu, Xuan Wang |
| 2025 | Large Language Models Threaten Language's Epistemic and Communicative Foundations. | Shashank Srivastava |
| 2025 | SQLSpace: A Representation Space for Text-to-SQL to Discover and Mitigate Robustness Gaps. | Neha Srikanth, Victor S. Bursztyn, Puneet Mathur, Ani Nenkova |
| 2025 | Aligning Text/Speech Representations from Multimodal Models with MEG Brain Activity During Listening. | Padakanti Srijith, Khushbu Pahwa, Radhika Mamidi, Bapi Raju Surampudi, Manish Gupta, Subba Reddy Oota |
| 2025 | Unsupervised Hallucination Detection by Inspecting Reasoning Processes. | Ponhvoan Srey, Xiaobao Wu, Anh Tuan Luu |
| 2025 | Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models. | Makesh Narsimhan Sreedhar, Traian Rebedea, Christopher Parisien |
| 2025 | RG-VQA: Leveraging Retriever-Generator Pipelines for Knowledge Intensive Visual Question Answering. | Settaluri Lakshmi Sravanthi, Pulkit Agarwal, Debjyoti Mondal, Rituraj Singh, Subhadarshi Panda, Ankit Mishra, Kiran Pradeep, Srihari K. B, Godawari Sudhakar Rao, Pushpak Bhattacharyya |
| 2025 | PSET: a Phonetics-Semantics Evaluation Testbed. | Gianluca Sperduti, Dong Nguyen |
| 2025 | Toward Machine Interpreting: Lessons from Human Interpreting Studies. | Matthias Sperber, Maureen de Seyssel, Jiajun Bao, Matthias Paulik |