| 2025 | ACL | The Reader is the Metric: How Textual Features and Reader Profiles Explain Conflicting Evaluations of AI Creative Writing. | Guillermo Marco, Julio Gonzalo, Vctor Fresno |
| 2025 | COLING | Small Language Models can Outperform Humans in Short Creative Writing: A Study Comparing SLMs with Humans and LLMs. | Guillermo Marco, Luz Rello, Julio Gonzalo |
| 2025 | COLING | Bilingual Evaluation of Language Models on General Knowledge in University Entrance Exams with Minimal Contamination. | Eva Snchez-Salido, Roser Morante, Julio Gonzalo, Guillermo Marco, Jorge Carrillo-de-Albornoz, Laura Plaza, Enrique Amig, Andrs Fernndez Garca, Alejandro Benito-Santos, Adrin Ghajari Espinosa, Vctor Fresno |
| 2024 | COLING | A Web Portal about the State of the Art of NLP Tasks in Spanish. | Enrique Amig, Jorge Carrillo-de-Albornoz, Andrs Fernndez, Julio Gonzalo, Guillermo Marco, Roser Morante, Laura Plaza, Jacobo Pedrosa |
| 2024 | EMNLP | Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing? | Guillermo Marco, Julio Gonzalo, Mara Teresa Mateo Girona, Ramn Santos |