| 2026 | Towards Improving Multimodal Machine Translation with LLMs: A Focus on Indic Languages. | Amulya Ratna Dash, Chirag Wadhwa, Yashvardhan Sharma |
| 2026 | MaiChat: A Text-based Dialogue Corpus Rich in Conversational Features. | Mai Hoang Dao, Catherine Lai, Peter Bell |
| 2026 | A Dataset of Historical Medical Periodicals Annotated with Textual Genre. | Vera Danilova, Sara Stymne |
| 2026 | C4: A Multilingual Benchmark for Retrieval-Augmented Generation Based on the Catechism of the Catholic Church and Its Compendium. | Pius von Dniken, Mark Cieliebak, Jan Deriu |
| 2026 | Toward Generalized Cross-Lingual Hateful Language Detection with Web-Scale Data and Ensemble LLM Annotations. | Dang Hai Dang, Jelena Mitrovic, Michael Granitzer |
| 2026 | MetaCORA: A Meta-Learned Curriculum for Adversarial and Contrastive Robustness in Speech Recognition. | Yuqian Dai, Chun Fai Chan, Ying Ki Wong, Tsz Ho Pun |
| 2026 | Towards the Generation and Application of Dynamic Web-Based Visualization of UIMA-based Annotations for Big-Data Corpora with the Help of Unified Dynamic Annotation Visualizer. | Thiemo Dahmann, Julian Schneider, Philipp Stephan, Giuseppe Abrami, Alexander Mehler |
| 2026 | A Resource on Dialogical Moves in Native and Non-Native Academic Writers of English. | Giulia D'Agostino, Narjes Sheikh Asadi, Elena Musi |
| 2026 | LocalGovPL: A Corpus of Speaker-Attributed Polish Local Government Transcripts. | Dariusz Czerski, Maciej Ogrodniczuk |
| 2026 | A Historical Database for the Study of Obstruent-Lateral Palatalization in Ibero-Romance. | Andrea Garca Covelo |
| 2026 | Diacritic Restoration for Low-Resource Indigenous Languages: Case Study with Bribri and Cook Islands Māori. | Rolando Coto-Solano, Daisy Li, Manoela Teleginski Ferraz, Olivia Sasse, Cha Krupka, Sharid Loiciga, Sally Akevai Tenamu Nicholas |
| 2026 | HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning. | Alexis Correa, Carlos Gmez-Rodrguez, David Vilares |
| 2026 | Voice, Bias, and Coreference: An Interpretability Study of Gender in Speech Translation. | Lina Conti, Dennis Fucci, Marco Gaido, Matteo Negri, Guillaume Wisniewski, Luisa Bentivogli |
| 2026 | A Corpus of Misunderstood Irony on Turkish Social Media. | agri ltekin, Gliz Gnes |
| 2026 | A Fine-tuned ASR Model for Historical American Dialect Recordings. | Steven Coats |
| 2026 | CoMMA, a Large-scale Corpus of Multilingual Medieval Archives. | Thibault Clrice, Simon Gabay, Malamatenia Vlachou-Efstathiou, Ariane Pinche, Benot Sagot |
| 2026 | SENSEI-ASG: A Challenging Dataset for Argument Summary Graph Parsing. | Jonathan Clayton, Marco Damonte, Robert J. Gaizauskas |
| 2026 | PsihoRo: Depression and Anxiety Romanian Text Corpus. | Alexandra Ciobotaru, Ana-Maria Bucur, Liviu P. Dinu |
| 2026 | Meta-Prompting Follow-Ups for Unsupervised Dialogue Evaluation Using Open-Source Large Language Models. | Gaetano Cimino, Chuyuan Li, Giuseppe Carenini, Vincenzo Deufemia |
| 2026 | The Foggia Occupator Corpus: Digitisation, Annotation, and Computational Analysis of an Occupation-Era Newspaper (1945-1946). | Michele Ciletti |
| 2026 | Incivility and Rigidity: Evaluating the Risks of Fine-Tuning LLMs for Political Argumentation. | Svetlana Churina, Kokil Jaidka |
| 2026 | Detecting Potentially Under-annotated Explicit Discourse Connectives in the Penn Discourse Treebank (PDTB-3) with LLMs. | Yueh-Ting Chuang, Xixian Liao, Bonnie Webber |
| 2026 | JAPAS: A Benchmark and Neural Approach for Japanese Patent Support Relation Extraction. | Katsuki Chousa, Ryosuke Sugiura |
| 2026 | Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering. | Purva Chiniya, Kevin Joseph Scaria, Sagar Chaturvedi |
| 2026 | User Profiling for Specification-Sensitive Recommendations with Large Language Model Prompting. | Chih-Yu Chien, An-Zi Yen, Hen-Hsen Huang, Hsin-Hsi Chen |