Skip to content

Ondrej Bojar

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

75

Venues

19

Active years

2005–2026

Best venue rank

A*

Where they publish

Papers

75 indexed papers, newest first.

YearVenueTitleAuthors
2026EACLThesis proposal: Are We Losing Textual Diversity to Natural Language Processing?Josef Jon, Ondrej Bojar
2026EACLMachine Translation for Low-Resource Languages through Monolingual Data and LLM: A Case Study of English-to-Basque.Nam Luu, Aitor Soroa, German Rigau, Ondrej Bojar
2026ECIRELOQUENT Lab at CLEF 2026: Evaluation of Generative Language Model Quality.Jussi Karlgren, Maria Barrett, Ondrej Bojar, Marie Isabel Engels, Diandra Fabre, Lorraine Goeuriot, Josiane Mothe, Philippe Mulhem, Mario Piacentini, Luis Francisco Vargas Madriz, Didier Schwab, Pavel Sindelr, George Stampoulidis, Katherina Thomas, Markarit Vartampetian
2026LRECCzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia.Josef Jon, Ondrej Bojar
2025ACLMockConf: A Student Interpretation Dataset: Analysis, Word- and Span-level Alignment and Baselines.Dvid Javorsk, Ondrej Bojar, Franois Yvon
2025COLINGOVQA: A Dataset for Visual Question Answering and Multimodal Research in Odia Language.Shantipriya Parida, Shashikanta Sahoo, Sambit Sekhar, Kalyanamalini Sahoo, Ketan Kotwal, Sonal Khosla, Satya Ranjan Dash, Aneesh Bose, Guneet Singh Kohli, Smruti Smita Lenka, Ondrej Bojar
2025ECIRELOQUENT CLEF Shared Tasks for Evaluation of Generative Language Model Quality, 2025 Edition.Jussi Karlgren, Ekaterina Artemova, Ondrej Bojar, Vladislav Mikhailov, Magnus Sahlgren, Erik Velldal, Lilja vrelid
2025RANLPLLM Compression: How Far Can We Go in Balancing Size and Performance?Sahil Sk, Debashish Dhal, Sonal Khosla, Akash Dhaka, Shantipriya Parida, Sk Shahid, Sambit Shekhar, Dilip K. Prasad, Ondrej Bojar
2024COLINGKhan Academy Corpus: A Multilingual Corpus of Khan Academy Lectures.Dominika Duriskov, Daniela Jursov, Mats Zilinec, Eduard Subert, Ondrej Bojar
2024COLINGGAATME: A Genetic Algorithm for Adversarial Translation Metrics Evaluation.Josef Jon, Ondrej Bojar
2024COLINGEvaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation.Matthias Sperber, Ondrej Bojar, Barry Haddow, Dvid Javorsk, Xutai Ma, Matteo Negri, Jan Niehues, Peter Polk, Elizabeth Salesky, Katsuhito Sudoh, Marco Turchi
2024ICLROn Difficulties of Attention Factorization through Shared Memory.Uladzislau Yorsh, Martin Holena, Ondrej Bojar, David Herel
2023ACLAssessing Word Importance Using Models Trained for Semantic Tasks.Dvid Javorsk, Ondrej Bojar, Franois Yvon
2023ACLBreeding Machine Translations: Evolutionary approach to survive and thrive in the world of automated evaluation.Josef Jon, Ondrej Bojar
2023ACLRobustness of Multi-Source MT to Transcription Errors.Dominik Machcek, Peter Polak, Ondrej Bojar, Raj Dabre
2023ACLHaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language.Shantipriya Parida, Idris Abdulmumin, Shamsuddeen Hassan Muhammad, Aneesh Bose, Guneet Singh Kohli, Ibrahim Said Ahmad, Ketan Kotwal, Sayan Deb Sarkar, Ondrej Bojar, Habeebah A. Kakudi
2023INLGOverview of the Second Shared Task on Automatic Minuting (AutoMin) at INLG 2023.Tirthankar Ghosal, Ondrej Bojar, Marie Hledkov, Tom Kocmi, Anna Nedoluzhko
2023INLGTeam Iterate @ AutoMin 2023 - Experiments with Iterative Minuting.Frantisek Kmjec, Ondrej Bojar
2023InterspeechIncremental Blockwise Beam Search for Simultaneous Speech Translation with Controllable Quality-Latency Tradeoff.Peter Polk, Brian Yan, Shinji Watanabe, Alex Waibel, Ondrej Bojar
2022LRECHausa Visual Genome: A Dataset for Multi-Modal English to Hausa Machine Translation.Idris Abdulmumin, Satya Ranjan Dash, Musa Abdullahi Dawud, Shantipriya Parida, Shamsuddeen Hassan Muhammad, Ibrahim Said Ahmad, Subhadarshi Panda, Ondrej Bojar, Bashir Shehu Galadanci, Bello Shehu Bello
2022LRECMultimodality for NLP-Centered Applications: Resources, Advances and Frontiers.Muskan Garg, Seema Wazarkar, Muskaan Singh, Ondrej Bojar
2022LRECELITR Minuting Corpus: A Novel Dataset for Automatic Minuting from Multi-Party Meetings in English and Czech.Anna Nedoluzhko, Muskaan Singh, Marie Hledkov, Tirthankar Ghosal, Ondrej Bojar
2022LRECALIGNMEET: A Comprehensive Tool for Meeting Annotation, Alignment, and Evaluation.Peter Polk, Muskaan Singh, Anna Nedoluzhko, Ondrej Bojar
2022PACLICAutomatic Minuting: A Pipeline Method for Generating Minutes from Multi-Party Meeting Proceedings.Kartik Shinde, Tirthankar Ghosal, Muskaan Singh, Ondrej Bojar
2021ACLEnd-to-End Lexically Constrained Machine Translation for Morphologically Rich Languages.Josef Jon, Joo Paulo Aires, Dusan Varis, Ondrej Bojar
2021EACLSLTEV: Comprehensive Evaluation of Spoken Language Translation.Ebrahim Ansari, Ondrej Bojar, Barry Haddow, Mohammad Mahmoudi
2021EACLELITR Multilingual Live Subtitling: Demo and Strategy.Ondrej Bojar, Dominik Machcek, Sangeet Sagar, Otakar Smrz, Jons Kratochvl, Peter Polak, Ebrahim Ansari, Mohammad Mahmoudi, Rishu Kumar, Dario Franceschini, Chiara Canton, Ivan Simonini, Thai-Son Nguyen, Felix Schneider, Sebastian Stker, Alex Waibel, Barry Haddow, Rico Sennrich, Philip Williams
2021ECIRTHEaiTRE 1.0: Interactive Generation of Theatre Play Scripts.Rudolf Rosa, Toms Musil, Ondrej Dusek, Dominik Jurko, Patrcia Schmidtov, David Marecek, Ondrej Bojar, Tom Kocmi, Daniel Hrbek, David Kostk, Martina Kinsk, Marie Novkov, Josef Dolezal, Klra Voseck, Toms Studenk, Petr Zabka
2021EMNLPSequence Length is a Domain: Length-based Overfitting in Transformer Models.Dusan Varis, Ondrej Bojar
2021EMNLPNeural Machine Translation Quality and Post-Editing Performance.Vilm Zouhar, Martin Popel, Ondrej Bojar, Ales Tamchyna
2021InterspeechLost in Interpreting: Speech Translation from Source or Interpreter?Dominik Machcek, Mats Zilinec, Ondrej Bojar
2021NAACLBacktranslation Feedback Improves User Confidence in MT, Not Quality.Vilm Zouhar, Michal Novk, Mats Zilinec, Ondrej Bojar, Mateo Obregn, Robin L. Hill, Frdric Blain, Marina Fomicheva, Lucia Specia, Lisa Yankovskaya
2021PACLICAn Empirical Performance Analysis of State-of-the-Art Summarization Models for Automatic Minuting.Muskaan Singh, Tirthankar Ghosal, Ondrej Bojar
2020ACLUnsupervised Multilingual Sentence Embeddings for Parallel Corpus Mining.Ivana Kvapilkov, Mikel Artetxe, Gorka Labaka, Eneko Agirre, Ondrej Bojar
2020EAMTELITR: European Live Translator.Ondrej Bojar, Dominik Machcek, Sangeet Sagar, Otakar Smrz, Jons Kratochvl, Ebrahim Ansari, Dario Franceschini, Chiara Canton, Ivan Simonini, Thai-Son Nguyen, Felix Schneider, Sebastian Stker, Alex Waibel, Barry Haddow, Rico Sennrich, Philip Williams
2020EAMTEfficiently Reusing Old Models Across Languages via Transfer Learning.Tom Kocmi, Ondrej Bojar
2020IJCAITHEaiTRE: Artificial Intelligence to Write a Theatre Play.Rudolf Rosa, Ondrej Dusek, Tom Kocmi, David Marecek, Toms Musil, Patrcia Schmidtov, Dominik Jurko, Ondrej Bojar, Daniel Hrbek, David Kostk, Martina Kinsk, Josef Dolezal, Klra Voseck
2020LRECCOSTRA 1.0: A Dataset of Complex Sentence Transformations.Petra Baranckov, Ondrej Bojar
2020LRECTwo Huge Title and Keyword Generation Corpora of Research Articles.Erion ano, Ondrej Bojar
2020LRECRemoving European Language Barriers with Innovative Machine Translation Technology.Dario Franceschini, Chiara Canton, Ivan Simonini, Armin Schweinfurth, Adelheid Glott, Sebastian Stker, Thai-Son Nguyen, Felix Schneider, Thanh-Le Ha, Alex Waibel, Barry Haddow, Philip Williams, Rico Sennrich, Ondrej Bojar, Sangeet Sagar, Dominik Machcek, Otakar Smrz
2020LRECLarge Corpus of Czech Parliament Plenary Hearings.Jons Kratochvl, Peter Polak, Ondrej Bojar
2020LRECOutbound Translation User Interface Ptakopet: A Pilot Study.Vilm Zouhar, Ondrej Bojar
2019ACLUnsupervised Pretraining for Neural Machine Translation Using Elastic Weight Consolidation.Dusan Varis, Ondrej Bojar
2019FRUCTKeyphrase Generation: A Multi-Aspect Survey.Erion ano, Ondrej Bojar
2019ICAARTSentiment Analysis of Czech Texts: An Algorithmic Survey.Erion ano, Ondrej Bojar
2019INLGEfficiency Metrics for Data-Driven Models: A Text Summarization Case Study.Erion ano, Ondrej Bojar
2019NAACLKeyphrase Generation: A Text Summarization Struggle.Erion ano, Ondrej Bojar
2018ACLAre BLEU and Meaning Representation in Opposition?Ondrej Cfka, Ondrej Bojar
2018AMTANeural Monkey: The Current State and Beyond.Jindrich Helcl, Jindrich Libovick, Tom Kocmi, Toms Musil, Ondrej Cfka, Dusan Varis, Ondrej Bojar
2018EAMTTranslating Short Segments with NMT: A Case Study in English-to-Hindi.Shantipriya Parida, Ondrej Bojar
2017EACLLanideNN: Multilingual Language Identification on Text Stream.Tom Kocmi, Ondrej Bojar
2017EACLProducing Unseen Morphological Variants in Statistical Machine Translation.Matthias Huck, Ales Tamchyna, Ondrej Bojar, Alexander M. Fraser
2017RANLPCurriculum Learning and Minibatch Bucketing in Neural Machine Translation.Tom Kocmi, Ondrej Bojar
2016ACLTarget-Side Context for Discriminative Models in Statistical Machine Translation.Ales Tamchyna, Alexander M. Fraser, Ondrej Bojar, Marcin Junczys-Dowmunt
2016EAMTPivoting Methods and Data for Czech-Vietnamese Translation via English.Duc Tam Hoang, Ondrej Bojar
2016EAMTTectoMT - a deep linguistic core of the combined Cimera MT system.Martin Popel, Roman Sudarikov, Ondrej Bojar, Rudolf Rosa, Jan Hajic
2016EMNLPHUME: Human UCCA-Based Evaluation of Machine Translation.Alexandra Birch, Omri Abend, Ondrej Bojar, Barry Haddow
2014COLINGComparing Czech and English AMRs.Jan Hajic, Ondrej Bojar, Zdenka Uresov
2014LRECHindEnCorp - Hindi-English and Hindi-only Corpus for Machine Translation.Ondrej Bojar, Vojtech Diatka, Pavel Rychl, Pavel Strank, Vit Suchomel, Ales Tamchyna, Daniel Zeman
2014LRECTwo-Step Machine Translation with Lattices.Bushra Jawaid, Ondrej Bojar
2014LRECA Tagged Corpus and a Tagger for Urdu.Bushra Jawaid, Amir Kamran, Ondrej Bojar
2014LRECNot an Interlingua, But Close: Comparison of English AMRs to Chinese and Czech.Nianwen Xue, Ondrej Bojar, Jan Hajic, Martha Palmer, Zdenka Uresov, Xiuhong Zhang
2013CICLINGNo Free Lunch in Factored Phrase-Based Machine Translation.Ales Tamchyna, Ondrej Bojar
2012LRECAutomatic MT Error Analysis: Hjerson Helping Addicter.Jan Berka, Ondrej Bojar, Mark Fishel, Maja Popovic, Daniel Zeman
2012LRECThe Joy of Parallelism with CzEng 1.0.Ondrej Bojar, Zdenek Zabokrtsk, Ondrej Dusek, Petra Galusckov, Martin Majlis, David Marecek, Jir Marsk, Michal Novk, Martin Popel, Ales Tamchyna
2012LRECTerra: a Collection of Translation Error-Annotated Corpora.Mark Fishel, Ondrej Bojar, Maja Popovic
2012LRECAnnouncing Prague Czech-English Dependency Treebank 2.0.Jan Hajic, Eva Hajicov, Jarmila Panevov, Petr Sgall, Ondrej Bojar, Silvie Cinkov, Eva Fuckov, Marie Mikulov, Petr Pajas, Jan Popelka, Jir Semeck, Jana Sindlerov, Jan Stepnek, Josef Toman, Zdenka Uresov, Zdenek Zabokrtsk
2010ACLTackling Sparse Data Issue in Machine Translation Evaluation.Ondrej Bojar, Kamil Kos, David Marecek
2010LRECEvaluating Utility of Data Sources in a Large Parallel Czech-English Corpus CzEng 0.9.Ondrej Bojar, Adam Liska, Zdenek Zabokrtsk
2010LRECData Issues in English-to-Hindi Machine Translation.Ondrej Bojar, Pavel Strank, Daniel Zeman
2010LRECBuilding a Bilingual ValLex Using Treebank Token Alignment: First Observations.Jana Sindlerov, Ondrej Bojar
2008LRECCzEng 0.7: Parallel Corpus with Community-Supplied Translations.Ondrej Bojar, Miroslav Jancek, Zdenek Zabokrtsk, Pavel Ceska, Peter Bena
2007ACLMoses: Open Source Toolkit for Statistical Machine Translation.Philipp Koehn, Hieu Hoang, Alexandra Birch, Chris Callison-Burch, Marcello Federico, Nicola Bertoldi, Brooke Cowan, Wade Shen, Christine Moran, Richard Zens, Chris Dyer, Ondrej Bojar, Alexandra Constantin, Evan Herbst
2006LRECCzech-English Word Alignment.Ondrej Bojar, Magdalena Prokopov
2005IJCNLPProblems of Reusing an Existing MT System.Ondrej Bojar, Petr Homola, Vladislav Kubon