| 2026 | EACL | RoSE: Round-robin Synthetic Data Evaluation for Selecting LLM Generators without Human Test Sets. | Jn Cegin, Branislav Pecher, Ivan Srba, Jakub Simko |
| 2026 | EACL | MultiCW: A Large-Scale Balanced Benchmark Dataset for Training Robust Check-Worthiness Detection Models. | Martin Hyben, Sebastian Kula, Jn Cegin, Jakub Simko, Ivan Srba, Rbert Mro |
| 2026 | EACL | Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification. | Branislav Pecher, Jn Cegin, Rbert Belanec, Ivan Srba, Jakub Simko, Mria Bielikov |
| 2025 | EMNLP | A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages. | Tatiana Anikina, Jn Cegin, Jakub Simko, Simon Ostermann |
| 2025 | EMNLP | Use Random Selection for Now: Investigation of Few-Shot Selection Strategies in LLM-based Text Augmentation. | Jn Cegin, Branislav Pecher, Jakub Simko, Ivan Srba, Mria Bielikov, Peter Brusilovsky |
| 2025 | NAACL | LLMs vs Established Text Augmentation Techniques for Classification: When do the Benefits Outweight the Costs? | Jn Cegin, Jakub Simko, Peter Brusilovsky |
| 2024 | ACL | Effects of diversity incentives on sample diversity and downstream model performance in LLM-based text augmentation. | Jn Cegin, Branislav Pecher, Jakub Simko, Ivan Srba, Mria Bielikov, Peter Brusilovsky |
| 2024 | EMNLP | Fighting Randomness with Randomness: Mitigating Optimisation Instability of Fine-Tuning using Delayed Ensemble and Noisy Interpolation. | Branislav Pecher, Jn Cegin, Rbert Belanec, Jakub Simko, Ivan Srba, Mria Bielikov |
| 2023 | EMNLP | ChatGPT to Replace Crowdsourcing of Paraphrases for Intent Classification: Higher Diversity and Comparable Model Robustness. | Jn Cegin, Jakub Simko, Peter Brusilovsky |
| 2020 | ICST | Test Data Generation for MC/DC Criterion using Reinforcement Learning. | Jn Cegin, Karol Rstocn |
| 2020 | QRS | Synthesized dataset for search-based test data generation methods focused on MC/DC criterion. | Jn Cegin, Karol Rstocn, Mria Bielikov |