Ondrej Bojar
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
75
Venues
19
Active years
2005–2026
Best venue rank
A*
Where they publish
Papers
75 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | EACL | Thesis proposal: Are We Losing Textual Diversity to Natural Language Processing? | Josef Jon, Ondrej Bojar |
| 2026 | EACL | Machine Translation for Low-Resource Languages through Monolingual Data and LLM: A Case Study of English-to-Basque. | Nam Luu, Aitor Soroa, German Rigau, Ondrej Bojar |
| 2026 | ECIR | ELOQUENT Lab at CLEF 2026: Evaluation of Generative Language Model Quality. | Jussi Karlgren, Maria Barrett, Ondrej Bojar, Marie Isabel Engels, Diandra Fabre, Lorraine Goeuriot, Josiane Mothe, Philippe Mulhem, Mario Piacentini, Luis Francisco Vargas Madriz, Didier Schwab, Pavel Sindelr, George Stampoulidis, Katherina Thomas, Markarit Vartampetian |
| 2026 | LREC | CzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia. | Josef Jon, Ondrej Bojar |
| 2025 | ACL | MockConf: A Student Interpretation Dataset: Analysis, Word- and Span-level Alignment and Baselines. | Dvid Javorsk, Ondrej Bojar, Franois Yvon |
| 2025 | COLING | OVQA: A Dataset for Visual Question Answering and Multimodal Research in Odia Language. | Shantipriya Parida, Shashikanta Sahoo, Sambit Sekhar, Kalyanamalini Sahoo, Ketan Kotwal, Sonal Khosla, Satya Ranjan Dash, Aneesh Bose, Guneet Singh Kohli, Smruti Smita Lenka, Ondrej Bojar |
| 2025 | ECIR | ELOQUENT CLEF Shared Tasks for Evaluation of Generative Language Model Quality, 2025 Edition. | Jussi Karlgren, Ekaterina Artemova, Ondrej Bojar, Vladislav Mikhailov, Magnus Sahlgren, Erik Velldal, Lilja vrelid |
| 2025 | RANLP | LLM Compression: How Far Can We Go in Balancing Size and Performance? | Sahil Sk, Debashish Dhal, Sonal Khosla, Akash Dhaka, Shantipriya Parida, Sk Shahid, Sambit Shekhar, Dilip K. Prasad, Ondrej Bojar |
| 2024 | COLING | Khan Academy Corpus: A Multilingual Corpus of Khan Academy Lectures. | Dominika Duriskov, Daniela Jursov, Mats Zilinec, Eduard Subert, Ondrej Bojar |
| 2024 | COLING | GAATME: A Genetic Algorithm for Adversarial Translation Metrics Evaluation. | Josef Jon, Ondrej Bojar |
| 2024 | COLING | Evaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation. | Matthias Sperber, Ondrej Bojar, Barry Haddow, Dvid Javorsk, Xutai Ma, Matteo Negri, Jan Niehues, Peter Polk, Elizabeth Salesky, Katsuhito Sudoh, Marco Turchi |
| 2024 | ICLR | On Difficulties of Attention Factorization through Shared Memory. | Uladzislau Yorsh, Martin Holena, Ondrej Bojar, David Herel |
| 2023 | ACL | Assessing Word Importance Using Models Trained for Semantic Tasks. | Dvid Javorsk, Ondrej Bojar, Franois Yvon |
| 2023 | ACL | Breeding Machine Translations: Evolutionary approach to survive and thrive in the world of automated evaluation. | Josef Jon, Ondrej Bojar |
| 2023 | ACL | Robustness of Multi-Source MT to Transcription Errors. | Dominik Machcek, Peter Polak, Ondrej Bojar, Raj Dabre |
| 2023 | ACL | HaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language. | Shantipriya Parida, Idris Abdulmumin, Shamsuddeen Hassan Muhammad, Aneesh Bose, Guneet Singh Kohli, Ibrahim Said Ahmad, Ketan Kotwal, Sayan Deb Sarkar, Ondrej Bojar, Habeebah A. Kakudi |
| 2023 | INLG | Overview of the Second Shared Task on Automatic Minuting (AutoMin) at INLG 2023. | Tirthankar Ghosal, Ondrej Bojar, Marie Hledkov, Tom Kocmi, Anna Nedoluzhko |
| 2023 | INLG | Team Iterate @ AutoMin 2023 - Experiments with Iterative Minuting. | Frantisek Kmjec, Ondrej Bojar |
| 2023 | Interspeech | Incremental Blockwise Beam Search for Simultaneous Speech Translation with Controllable Quality-Latency Tradeoff. | Peter Polk, Brian Yan, Shinji Watanabe, Alex Waibel, Ondrej Bojar |
| 2022 | LREC | Hausa Visual Genome: A Dataset for Multi-Modal English to Hausa Machine Translation. | Idris Abdulmumin, Satya Ranjan Dash, Musa Abdullahi Dawud, Shantipriya Parida, Shamsuddeen Hassan Muhammad, Ibrahim Said Ahmad, Subhadarshi Panda, Ondrej Bojar, Bashir Shehu Galadanci, Bello Shehu Bello |
| 2022 | LREC | Multimodality for NLP-Centered Applications: Resources, Advances and Frontiers. | Muskan Garg, Seema Wazarkar, Muskaan Singh, Ondrej Bojar |
| 2022 | LREC | ELITR Minuting Corpus: A Novel Dataset for Automatic Minuting from Multi-Party Meetings in English and Czech. | Anna Nedoluzhko, Muskaan Singh, Marie Hledkov, Tirthankar Ghosal, Ondrej Bojar |
| 2022 | LREC | ALIGNMEET: A Comprehensive Tool for Meeting Annotation, Alignment, and Evaluation. | Peter Polk, Muskaan Singh, Anna Nedoluzhko, Ondrej Bojar |
| 2022 | PACLIC | Automatic Minuting: A Pipeline Method for Generating Minutes from Multi-Party Meeting Proceedings. | Kartik Shinde, Tirthankar Ghosal, Muskaan Singh, Ondrej Bojar |
| 2021 | ACL | End-to-End Lexically Constrained Machine Translation for Morphologically Rich Languages. | Josef Jon, Joo Paulo Aires, Dusan Varis, Ondrej Bojar |
| 2021 | EACL | SLTEV: Comprehensive Evaluation of Spoken Language Translation. | Ebrahim Ansari, Ondrej Bojar, Barry Haddow, Mohammad Mahmoudi |
| 2021 | EACL | ELITR Multilingual Live Subtitling: Demo and Strategy. | Ondrej Bojar, Dominik Machcek, Sangeet Sagar, Otakar Smrz, Jons Kratochvl, Peter Polak, Ebrahim Ansari, Mohammad Mahmoudi, Rishu Kumar, Dario Franceschini, Chiara Canton, Ivan Simonini, Thai-Son Nguyen, Felix Schneider, Sebastian Stker, Alex Waibel, Barry Haddow, Rico Sennrich, Philip Williams |
| 2021 | ECIR | THEaiTRE 1.0: Interactive Generation of Theatre Play Scripts. | Rudolf Rosa, Toms Musil, Ondrej Dusek, Dominik Jurko, Patrcia Schmidtov, David Marecek, Ondrej Bojar, Tom Kocmi, Daniel Hrbek, David Kostk, Martina Kinsk, Marie Novkov, Josef Dolezal, Klra Voseck, Toms Studenk, Petr Zabka |
| 2021 | EMNLP | Sequence Length is a Domain: Length-based Overfitting in Transformer Models. | Dusan Varis, Ondrej Bojar |
| 2021 | EMNLP | Neural Machine Translation Quality and Post-Editing Performance. | Vilm Zouhar, Martin Popel, Ondrej Bojar, Ales Tamchyna |
| 2021 | Interspeech | Lost in Interpreting: Speech Translation from Source or Interpreter? | Dominik Machcek, Mats Zilinec, Ondrej Bojar |
| 2021 | NAACL | Backtranslation Feedback Improves User Confidence in MT, Not Quality. | Vilm Zouhar, Michal Novk, Mats Zilinec, Ondrej Bojar, Mateo Obregn, Robin L. Hill, Frdric Blain, Marina Fomicheva, Lucia Specia, Lisa Yankovskaya |
| 2021 | PACLIC | An Empirical Performance Analysis of State-of-the-Art Summarization Models for Automatic Minuting. | Muskaan Singh, Tirthankar Ghosal, Ondrej Bojar |
| 2020 | ACL | Unsupervised Multilingual Sentence Embeddings for Parallel Corpus Mining. | Ivana Kvapilkov, Mikel Artetxe, Gorka Labaka, Eneko Agirre, Ondrej Bojar |
| 2020 | EAMT | ELITR: European Live Translator. | Ondrej Bojar, Dominik Machcek, Sangeet Sagar, Otakar Smrz, Jons Kratochvl, Ebrahim Ansari, Dario Franceschini, Chiara Canton, Ivan Simonini, Thai-Son Nguyen, Felix Schneider, Sebastian Stker, Alex Waibel, Barry Haddow, Rico Sennrich, Philip Williams |
| 2020 | EAMT | Efficiently Reusing Old Models Across Languages via Transfer Learning. | Tom Kocmi, Ondrej Bojar |
| 2020 | IJCAI | THEaiTRE: Artificial Intelligence to Write a Theatre Play. | Rudolf Rosa, Ondrej Dusek, Tom Kocmi, David Marecek, Toms Musil, Patrcia Schmidtov, Dominik Jurko, Ondrej Bojar, Daniel Hrbek, David Kostk, Martina Kinsk, Josef Dolezal, Klra Voseck |
| 2020 | LREC | COSTRA 1.0: A Dataset of Complex Sentence Transformations. | Petra Baranckov, Ondrej Bojar |
| 2020 | LREC | Two Huge Title and Keyword Generation Corpora of Research Articles. | Erion ano, Ondrej Bojar |
| 2020 | LREC | Removing European Language Barriers with Innovative Machine Translation Technology. | Dario Franceschini, Chiara Canton, Ivan Simonini, Armin Schweinfurth, Adelheid Glott, Sebastian Stker, Thai-Son Nguyen, Felix Schneider, Thanh-Le Ha, Alex Waibel, Barry Haddow, Philip Williams, Rico Sennrich, Ondrej Bojar, Sangeet Sagar, Dominik Machcek, Otakar Smrz |
| 2020 | LREC | Large Corpus of Czech Parliament Plenary Hearings. | Jons Kratochvl, Peter Polak, Ondrej Bojar |
| 2020 | LREC | Outbound Translation User Interface Ptakopet: A Pilot Study. | Vilm Zouhar, Ondrej Bojar |
| 2019 | ACL | Unsupervised Pretraining for Neural Machine Translation Using Elastic Weight Consolidation. | Dusan Varis, Ondrej Bojar |
| 2019 | FRUCT | Keyphrase Generation: A Multi-Aspect Survey. | Erion ano, Ondrej Bojar |
| 2019 | ICAART | Sentiment Analysis of Czech Texts: An Algorithmic Survey. | Erion ano, Ondrej Bojar |
| 2019 | INLG | Efficiency Metrics for Data-Driven Models: A Text Summarization Case Study. | Erion ano, Ondrej Bojar |
| 2019 | NAACL | Keyphrase Generation: A Text Summarization Struggle. | Erion ano, Ondrej Bojar |
| 2018 | ACL | Are BLEU and Meaning Representation in Opposition? | Ondrej Cfka, Ondrej Bojar |
| 2018 | AMTA | Neural Monkey: The Current State and Beyond. | Jindrich Helcl, Jindrich Libovick, Tom Kocmi, Toms Musil, Ondrej Cfka, Dusan Varis, Ondrej Bojar |
| 2018 | EAMT | Translating Short Segments with NMT: A Case Study in English-to-Hindi. | Shantipriya Parida, Ondrej Bojar |
| 2017 | EACL | LanideNN: Multilingual Language Identification on Text Stream. | Tom Kocmi, Ondrej Bojar |
| 2017 | EACL | Producing Unseen Morphological Variants in Statistical Machine Translation. | Matthias Huck, Ales Tamchyna, Ondrej Bojar, Alexander M. Fraser |
| 2017 | RANLP | Curriculum Learning and Minibatch Bucketing in Neural Machine Translation. | Tom Kocmi, Ondrej Bojar |
| 2016 | ACL | Target-Side Context for Discriminative Models in Statistical Machine Translation. | Ales Tamchyna, Alexander M. Fraser, Ondrej Bojar, Marcin Junczys-Dowmunt |
| 2016 | EAMT | Pivoting Methods and Data for Czech-Vietnamese Translation via English. | Duc Tam Hoang, Ondrej Bojar |
| 2016 | EAMT | TectoMT - a deep linguistic core of the combined Cimera MT system. | Martin Popel, Roman Sudarikov, Ondrej Bojar, Rudolf Rosa, Jan Hajic |
| 2016 | EMNLP | HUME: Human UCCA-Based Evaluation of Machine Translation. | Alexandra Birch, Omri Abend, Ondrej Bojar, Barry Haddow |
| 2014 | COLING | Comparing Czech and English AMRs. | Jan Hajic, Ondrej Bojar, Zdenka Uresov |
| 2014 | LREC | HindEnCorp - Hindi-English and Hindi-only Corpus for Machine Translation. | Ondrej Bojar, Vojtech Diatka, Pavel Rychl, Pavel Strank, Vit Suchomel, Ales Tamchyna, Daniel Zeman |
| 2014 | LREC | Two-Step Machine Translation with Lattices. | Bushra Jawaid, Ondrej Bojar |
| 2014 | LREC | A Tagged Corpus and a Tagger for Urdu. | Bushra Jawaid, Amir Kamran, Ondrej Bojar |
| 2014 | LREC | Not an Interlingua, But Close: Comparison of English AMRs to Chinese and Czech. | Nianwen Xue, Ondrej Bojar, Jan Hajic, Martha Palmer, Zdenka Uresov, Xiuhong Zhang |
| 2013 | CICLING | No Free Lunch in Factored Phrase-Based Machine Translation. | Ales Tamchyna, Ondrej Bojar |
| 2012 | LREC | Automatic MT Error Analysis: Hjerson Helping Addicter. | Jan Berka, Ondrej Bojar, Mark Fishel, Maja Popovic, Daniel Zeman |
| 2012 | LREC | The Joy of Parallelism with CzEng 1.0. | Ondrej Bojar, Zdenek Zabokrtsk, Ondrej Dusek, Petra Galusckov, Martin Majlis, David Marecek, Jir Marsk, Michal Novk, Martin Popel, Ales Tamchyna |
| 2012 | LREC | Terra: a Collection of Translation Error-Annotated Corpora. | Mark Fishel, Ondrej Bojar, Maja Popovic |
| 2012 | LREC | Announcing Prague Czech-English Dependency Treebank 2.0. | Jan Hajic, Eva Hajicov, Jarmila Panevov, Petr Sgall, Ondrej Bojar, Silvie Cinkov, Eva Fuckov, Marie Mikulov, Petr Pajas, Jan Popelka, Jir Semeck, Jana Sindlerov, Jan Stepnek, Josef Toman, Zdenka Uresov, Zdenek Zabokrtsk |
| 2010 | ACL | Tackling Sparse Data Issue in Machine Translation Evaluation. | Ondrej Bojar, Kamil Kos, David Marecek |
| 2010 | LREC | Evaluating Utility of Data Sources in a Large Parallel Czech-English Corpus CzEng 0.9. | Ondrej Bojar, Adam Liska, Zdenek Zabokrtsk |
| 2010 | LREC | Data Issues in English-to-Hindi Machine Translation. | Ondrej Bojar, Pavel Strank, Daniel Zeman |
| 2010 | LREC | Building a Bilingual ValLex Using Treebank Token Alignment: First Observations. | Jana Sindlerov, Ondrej Bojar |
| 2008 | LREC | CzEng 0.7: Parallel Corpus with Community-Supplied Translations. | Ondrej Bojar, Miroslav Jancek, Zdenek Zabokrtsk, Pavel Ceska, Peter Bena |
| 2007 | ACL | Moses: Open Source Toolkit for Statistical Machine Translation. | Philipp Koehn, Hieu Hoang, Alexandra Birch, Chris Callison-Burch, Marcello Federico, Nicola Bertoldi, Brooke Cowan, Wade Shen, Christine Moran, Richard Zens, Chris Dyer, Ondrej Bojar, Alexandra Constantin, Evan Herbst |
| 2006 | LREC | Czech-English Word Alignment. | Ondrej Bojar, Magdalena Prokopov |
| 2005 | IJCNLP | Problems of Reusing an Existing MT System. | Ondrej Bojar, Petr Homola, Vladislav Kubon |