Luca Soldaini
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
47
Venues
17
Active years
2015–2026
Best venue rank
A*
Where they publish
Papers
47 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | The olmOCR Project: Building Fully Open OCR using VLMs. | Jake Poznanski, Kyle Lo, Luca Soldaini |
| 2026 | WSDM | WSDM CUP 2026: Multilingual Retrieval. | Dawn J. Lawrie, Sean MacAvaney, James Mayfield, Luca Soldaini, Eugene Yang, Andrew Yates |
| 2025 | AAAI | RouterRetriever: Routing over a Mixture of Expert Embedding Models. | Hyunji Lee, Luca Soldaini, Arman Cohan, Minjoon Seo, Kyle Lo |
| 2025 | ACL | OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training Tokens. | Jiacheng Liu, Taylor Blanton, Yanai Elazar, Sewon Min, Yen-Sung Chen, Arnavi Chheda-Kothary, Huy Tran, Byron Bischoff, Eric Marsh, Michael Schmitz, Cassidy Trier, Aaron Sarnat, Jenna James, Jon Borchardt, Bailey Kuehl, Evie Yu-Yen Cheng, Karen Farley, Taira Anderson, David Albright, Carissa Schoenick, Luca Soldaini, Dirk Groeneveld, Rock Yuren Pang, Pang Wei Koh, Noah A. Smith, Sophie Lebrecht, Yejin Choi, Hannaneh Hajishirzi, Ali Farhadi, Jesse Dodge |
| 2025 | CVPR | Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models. | Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, Jiasen Lu, Taira Anderson, Erin Bransom, Kiana Ehsani, Huong Ngo, Yen-Sung Chen, Ajay Patel, Mark Yatskar, Chris Callison-Burch, Andrew Head, Rose Hendrix, Favyen Bastani, Eli VanderBilt, Nathan Lambert, Yvonne Chou, Arnavi Chheda, Jenna Sparks, Sam Skjonsberg, Michael Schmitz, Aaron Sarnat, Byron Bischoff, Pete Walsh, Chris Newell, Piper Wolters, Tanmay Gupta, Kuo-Hao Zeng, Jon Borchardt, Dirk Groeneveld, Crystal Nam, Sophie Lebrecht, Caitlin Wittlif, Carissa Schoenick, Oscar Michel, Ranjay Krishna, Luca Weihs, Noah A. Smith, Hannaneh Hajishirzi, Ross B. Girshick, Ali Farhadi, Aniruddha Kembhavi |
| 2025 | ECIR | mFollowIR: A Multilingual Benchmark for Instruction Following in Retrieval. | Orion Weller, Benjamin Chang, Eugene Yang, Mahsa Yarmohammadi, Samuel Barham, Sean MacAvaney, Arman Cohan, Luca Soldaini, Benjamin Van Durme, Dawn J. Lawrie |
| 2025 | EMNLP | SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature. | David Wadden, Kejian Shi, Jacob Morrison, Alan Li, Aakanksha Naik, Shruti Singh, Nitzan Barzilay, Kyle Lo, Tom Hope, Luca Soldaini, Shannon Zejiang Shen, Doug Downey, Hannaneh Hajishirzi, Arman Cohan |
| 2025 | ICLR | Language models scale reliably with over-training and on downstream tasks. | Samir Yitzhak Gadre, Georgios Smyrnis, Vaishaal Shankar, Suchin Gururangan, Mitchell Wortsman, Rulin Shao, Jean Mercat, Alex Fang, Jeffrey Li, Sedrick Keh, Rui Xin, Marianna Nezhurina, Igor Vasiljevic, Luca Soldaini, Jenia Jitsev, Alex Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, et al. |
| 2025 | ICLR | OLMoE: Open Mixture-of-Experts Language Models. | Niklas Muennighoff, Luca Soldaini, Dirk Groeneveld, Kyle Lo, Jacob Morrison, Sewon Min, Weijia Shi, Evan Pete Walsh, Oyvind Tafjord, Nathan Lambert, Yuling Gu, Shane Arora, Akshita Bhagia, Dustin Schwenk, David Wadden, Alexander Wettig, Binyuan Hui, Tim Dettmers, Douwe Kiela, Ali Farhadi, et al. |
| 2025 | ICML | DataDecide: How to Predict Best Pretraining Data with Small Experiments. | Ian Magnusson, Nguyen Tai, Ben Bogin, David Heineman, Jena D. Hwang, Luca Soldaini, Akshita Bhagia, Jiacheng Liu, Dirk Groeneveld, Oyvind Tafjord, Noah A. Smith, Pang Wei Koh, Jesse Dodge |
| 2025 | ICML | Organize the Web: Constructing Domains Enhances Pre-Training Data Curation. | Alexander Wettig, Kyle Lo, Sewon Min, Hannaneh Hajishirzi, Danqi Chen, Luca Soldaini |
| 2025 | NAACL | DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images. | Sami Baral, Li Lucy, Ryan Knight, Alice Ng, Luca Soldaini, Neil T. Heffernan, Kyle Lo |
| 2025 | NAACL | FollowIR: Evaluating and Teaching Information Retrieval Models to Follow Instructions. | Orion Weller, Benjamin Chang, Sean MacAvaney, Kyle Lo, Arman Cohan, Benjamin Van Durme, Dawn J. Lawrie, Luca Soldaini |
| 2024 | ACL | OLMo: Accelerating the Science of Language Models. | Dirk Groeneveld, Iz Beltagy, Evan Pete Walsh, Akshita Bhagia, Rodney Kinney, Oyvind Tafjord, Ananya Harsh Jha, Hamish Ivison, Ian Magnusson, Yizhong Wang, Shane Arora, David Atkinson, Russell Authur, Khyathi Raghavi Chandu, Arman Cohan, Jennifer Dumas, Yanai Elazar, Yuling Gu, Jack Hessel, Tushar Khot, William Merrill, Jacob Morrison, Niklas Muennighoff, Aakanksha Naik, Crystal Nam, Matthew E. Peters, Valentina Pyatkin, Abhilasha Ravichander, Dustin Schwenk, Saurabh Shah, Will Smith, Emma Strubell, Nishant Subramani, Mitchell Wortsman, Pradeep Dasigi, Nathan Lambert, Kyle Richardson, Luke Zettlemoyer, Jesse Dodge, Kyle Lo, Luca Soldaini, Noah A. Smith, Hannaneh Hajishirzi |
| 2024 | ACL | AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters. | Li Lucy, Suchin Gururangan, Luca Soldaini, Emma Strubell, David Bamman, Lauren F. Klein, Jesse Dodge |
| 2024 | ACL | Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research. | Luca Soldaini, Rodney Kinney, Akshita Bhagia, Dustin Schwenk, David Atkinson, Russell Authur, Ben Bogin, Khyathi Raghavi Chandu, Jennifer Dumas, Yanai Elazar, Valentin Hofmann, Ananya Harsh Jha, Sachin Kumar, Li Lucy, Xinxi Lyu, Nathan Lambert, Ian Magnusson, Jacob Morrison, Niklas Muennighoff, Aakanksha Naik, Crystal Nam, Matthew E. Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A. Smith, Hannaneh Hajishirzi, Iz Beltagy, Dirk Groeneveld, Jesse Dodge, Kyle Lo |
| 2024 | ACL | KIWI: A Dataset of Knowledge-Intensive Writing Instructions for Answering Research Questions. | Fangyuan Xu, Kyle Lo, Luca Soldaini, Bailey Kuehl, Eunsol Choi, David Wadden |
| 2024 | EACL | When do Generative Query and Document Expansions Fail? A Comprehensive Study Across Methods, Retrievers, and Datasets. | Orion Weller, Kyle Lo, David Wadden, Dawn J. Lawrie, Benjamin Van Durme, Arman Cohan, Luca Soldaini |
| 2024 | EMNLP | MathFish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula. | Li Lucy, Tal August, Rose E. Wang, Luca Soldaini, Courtney Allison, Kyle Lo |
| 2024 | ICLR | What's In My Big Data? | Yanai Elazar, Akshita Bhagia, Ian Magnusson, Abhilasha Ravichander, Dustin Schwenk, Alane Suhr, Evan Pete Walsh, Dirk Groeneveld, Luca Soldaini, Sameer Singh, Hannaneh Hajishirzi, Noah A. Smith, Jesse Dodge |
| 2024 | SIGIR | On the Evaluation of Machine-Generated Reports. | James Mayfield, Eugene Yang, Dawn J. Lawrie, Sean MacAvaney, Paul McNamee, Douglas W. Oard, Luca Soldaini, Ian Soboroff, Orion Weller, Efsun Selin Kayi, Kate Sanders, Marc Mason, Noah Hibbler |
| 2023 | AIES | Bound by the Bounty: Collaboratively Shaping Evaluation Processes for Queer AI Harms. | Nathan Dennler, Anaelia Ovalle, Ashwin Singh, Luca Soldaini, Arjun Subramonian, Huy Tu, William Agnew, Avijit Ghosh, Kyra Yee, Irene Font Peradejordi, Zeerak Talat, Mayra Russo, Jessica de Jesus de Pinho Pinhal |
| 2023 | EACL | Embedding Recycling for Language Models. | Jon Saad-Falcon, Amanpreet Singh, Luca Soldaini, Mike D'Arcy, Arman Cohan, Doug Downey |
| 2023 | EMNLP | Open Domain Multi-document Summarization: A Comprehensive Study of Model Brittleness under Retrieval. | John M. Giorgi, Luca Soldaini, Bo Wang, Gary D. Bader, Kyle Lo, Lucy Lu Wang, Arman Cohan |
| 2023 | EMNLP | PaperMage: A Unified Toolkit for Processing, Representing, and Manipulating Visually-Rich Scientific Documents. | Kyle Lo, Zejiang Shen, Benjamin Newman, Joseph Chee Chang, Russell Authur, Erin Bransom, Stefan Candra, Yoganand Chandrasekhar, Regan Huff, Bailey Kuehl, Amanpreet Singh, Chris Wilhelm, Angele Zamarron, Marti A. Hearst, Daniel S. Weld, Doug Downey, Luca Soldaini |
| 2023 | EMNLP | A Question Answering Framework for Decontextualizing User-facing Snippets from Scientific Documents. | Benjamin Newman, Luca Soldaini, Raymond Fok, Arman Cohan, Kyle Lo |
| 2023 | IUI | Scim: Intelligent Skimming Support for Scientific Papers. | Raymond Fok, Hita Kambhamettu, Luca Soldaini, Jonathan Bragg, Kyle Lo, Marti A. Hearst, Andrew Head, Daniel S. Weld |
| 2023 | SIGIR | One-Shot Labeling for Automatic Relevance Estimation. | Sean MacAvaney, Luca Soldaini |
| 2022 | EMNLP | Knowledge Transfer from Answer Ranking to Answer Generation. | Matteo Gabburo, Rik Koncel-Kedziorski, Siddhant Garg, Luca Soldaini, Alessandro Moschitti |
| 2022 | EMNLP | Pre-training Transformer Models with Sentence-Level Objectives for Answer Sentence Selection. | Luca Di Liello, Siddhant Garg, Luca Soldaini, Alessandro Moschitti |
| 2022 | EMNLP | Ensemble Transformer for Efficient and Accurate Ranking Tasks: an Application to Question Answering Systems. | Yoshitomo Matsubara, Luca Soldaini, Eric Lind, Alessandro Moschitti |
| 2022 | IJCNLP | Cross-Lingual Open-Domain Question Answering with Answer Sentence Generation. | Benjamin Muller, Luca Soldaini, Rik Koncel-Kedziorski, Eric Lind, Alessandro Moschitti |
| 2022 | NAACL | Paragraph-based Transformer Pre-training for Multi-Sentence Inference. | Luca Di Liello, Siddhant Garg, Luca Soldaini, Alessandro Moschitti |
| 2021 | ACL | Answer Generation for Retrieval-based Question Answering Systems. | Chao-Chun Hsu, Eric Lind, Luca Soldaini, Alessandro Moschitti |
| 2021 | EACL | Modeling Context in Answer Sentence Selection Systems on a Latency Budget. | Rujun Han, Luca Soldaini, Alessandro Moschitti |
| 2020 | ACL | The Cascade Transformer: an Application for Efficient Answer Sentence Selection. | Luca Soldaini, Alessandro Moschitti |
| 2020 | COLING | Multi-task Learning of Spoken Language Understanding by Integrating N-Best Hypotheses with Hierarchical Attention. | Mingda Li, Xinyue Liu, Weitong Ruan, Luca Soldaini, Wael Hamza, Chengwei Su |
| 2020 | ECIR | Teaching a New Dog Old Tricks: Resurrecting Multilingual Retrieval Using Zero-Shot Learning. | Sean MacAvaney, Luca Soldaini, Nazli Goharian |
| 2020 | WWW | Don't Parse, Generate! A Sequence to Sequence Architecture for Task-Oriented Semantic Parsing. | Subendhu Rongali, Luca Soldaini, Emilio Monti, Wael Hamza |
| 2018 | COLING | SMHD: a Large-Scale Resource for Exploring Online Language Usage for Multiple Mental Health Conditions. | Arman Cohan, Bart Desmet, Andrew Yates, Luca Soldaini, Sean MacAvaney, Nazli Goharian |
| 2018 | SIGIR | Characterizing Question Facets for Complex Answer Retrieval. | Sean MacAvaney, Andrew Yates, Arman Cohan, Luca Soldaini, Kai Hui, Nazli Goharian, Ophir Frieder |
| 2018 | SIGIR | Overcoming Low-Utility Facets for Complex Answer Retrieval. | Sean MacAvaney, Andrew Yates, Arman Cohan, Luca Soldaini, Kai Hui, Nazli Goharian, Ophir Frieder |
| 2017 | CIKM | Denoising Clinical Notes for Medical Literature Retrieval with Convolutional Neural Model. | Luca Soldaini, Andrew Yates, Nazli Goharian |
| 2017 | ECIR | Learning to Rank for Consumer Health Search: A Semantic Approach. | Luca Soldaini, Nazli Goharian |
| 2017 | WWW | Inferring Individual Attributes from Search Engine Queries and Auxiliary Information. | Luca Soldaini, Elad Yom-Tov |
| 2015 | ECIR | Retrieving Medical Literature for Clinical Decision Support. | Luca Soldaini, Arman Cohan, Andrew Yates, Nazli Goharian, Ophir Frieder |
| 2015 | NAACL | Matching Citation Text and Cited Spans in Biomedical Literature: a Search-Oriented Approach. | Arman Cohan, Luca Soldaini, Nazli Goharian |