| 2026 | Physical Commonsense Reasoning for Lower-Resourced Languages and Dialects: A Study on Basque. | Jaione Bengoetxea, Itziar Gonzalez-Dios, Rodrigo Agerri |
| 2026 | Challenges in Image-Caption Association in Portuguese: Evaluating the CLIP Model on the FM30K Dataset. | Vitria Colonetti Benedet, Gustavo Lopes Tamiosso, Rafael Oleques Nunes, Dennis Giovani Balreira |
| 2026 | German Counseling Grounding-Act Corpus (GRACO). | Milena Belosevic |
| 2026 | MedInjection-FR: Exploring the Role of Native, Synthetic, and Translated Data in Biomedical Instruction Tuning. | Ikram Belmadani, Oumaima El Khettari, Pacme Constant dit Beaufils, Benot Favre, Richard Dufour |
| 2026 | This House Debates AI: Evaluating a Language Model in Oxford-Style Debates against Human Experts. | Umberto Belluzzo, Kobi Hackenburg, Hannah Rose Kirk, Scott Hale, Paul Rttger |
| 2026 | Enhancing Multi-Label Emotion Analysis and Corresponding Intensities for Ethiopian Languages. | Tadesse Destaw Belay, Dawit Ketema Gete, Abinew Ali Ayele, Olga Kolesnikova, Iqra Ameer, Grigori Sidorov, Seid Muhie Yimam |
| 2026 | A Typology of Synthetic Datasets for Dialogue Processing in Clinical Contexts. | Steven Bedrick, A. Seza Dogruz, Sergiu Nisioi |
| 2026 | Assessing the Effectiveness of LLMs in Delivering Cognitive Behavioral Therapy. | Navdeep Singh Bedi, Ana-Maria Bucur, Noriko Kando, Fabio Crestani |
| 2026 | The Moralization Corpus: Frame-Based Annotation and Analysis of Moralizing Speech Acts across Diverse Text Genres. | Maria Becker, Mirko Sommer, Lars Tapken, Yi Wan Teh, Bruno Brocai |
| 2026 | Medispeech: A French Reading and Spontaneous Speech Corpus for Sleepiness Estimation. | Colleen Beaumard, Vincent P. Martin, Charles Brazier, Julien Coelho, Jean-Luc Rouas, Pierre Philip |
| 2026 | Uhura: A Benchmark for Evaluating Scientific Question Answering and Truthfulness in Low-Resource African Languages. | Edward Thomas Bayes, Israel Abebe Azime, Jesujoba Alabi, Jonas Kgomo, Tyna Eloundou, Elizabeth Proehl, Kai Chen, Imaan Khadir, Naome A. Etori, Shamsuddeen Hassan Muhammad, Choice Mpanza, Igneciah Pocia Thete, Dietrich Klakow, David Ifeoluwa Adelani |
| 2026 | How Many Samples Do We Need? A Toolkit for Power-Aware Evaluation Design. | Angelo Basile, Areg Mikael Sarvazyan, Jos ngel Gonzlez |
| 2026 | Corruption-Based Data Augmentation for Arabic Essay Scoring: A Preliminary Study on the Organization Trait. | May Saed Bashendy, Tamer Elsayed |
| 2026 | Towards Dynamic Metaphor Identification: Evaluating GPT O-Series Models on Five Metaphoricity Cues in U.S. Trade Corpora. | Berkay Bas, Jelke Bloem, Xiaojuan Tan |
| 2026 | Text+: A National Hub Including Legacy Language Data. | Florian Barth, Christoph Draxler, Jennifer Ecker, Stefan Fischer, Philippe Gent, Alina Hemmer, Timm Lehmberg, Thorsten Trippel, Andreas Witt, Arden Zimmermann, Claus Zinn |
| 2026 | Joint Identification and Induction of Semantic Frames with Scalable Semi-Supervised Graph Clustering. | Fabian Barteld, Steffen Remus, Saba Anwar, Julian Stawecki, Alexander Ziem, Chris Biemann |
| 2026 | Evaluation of Two Leading Polish Language Models in a Real-world RAG Scenario. | Szymon Bartanowicz, Krzysztof Jassem |
| 2026 | MultiGraSCCo: A Multilingual Anonymization Benchmark with Annotations of Personal Identifiers. | Ibrahim Baroud, Christoph Otto, Vera Czehmann, Christine Hovhannisyan, Lisa Raithel, Sebastian Mller, Roland Roller |
| 2026 | DaLA: Danish Linguistic Acceptability Evaluation Guided by Real World Errors. | Gianluca Barmina, Nathalie Carmen Hau Norman, Peter Schneider-Kamp, Lukas Galke Poech |
| 2026 | CREST: Universal Safety Guardrails through Cluster-Guided Cross-Lingual Transfer. | Lavish Bansal, Naman Mishra |
| 2026 | Pragmatic Modelling in Language Learning: Caregiver Question-Answer Feedback in Child-Directed Dialogue. | Maryam Bala, Johannes Heim, Elspeth Edelstein, Arabella Sinclair |
| 2026 | Using LLMs for Automatic Discipline Annotation in a Diachronic Corpus of English Scientific Papers. | Sergei Bagdasarov, Diego Alves, Stefan Fischer, Elke Teich |
| 2026 | Beyond Lemmas and Syntax: Comparing Human and LLM-Generated Scientific Abstracts. | Sergei Bagdasarov, Diego Alves |
| 2026 | Automatic Essay Scoring and Feedback Generation in Basque Language Learning. | Ekhi Azurmendi, Xabier Arregi, Oier Lopez de Lacalle |
| 2026 | Do Language Models Know Theo Has a Wife? Investigating the Proviso Problem. | Tara Azin, Daniel Dumitrescu, Diana Inkpen, Raj Singh |