| 2025 | COLING | SUMIE: A Synthetic Benchmark for Incremental Entity Summarization. | Eunjeong Hwang, Yichao Zhou, Beliz Gunel, James Bradley Wendt, Sandeep Tata |
| 2025 | EMNLP | PRISM: Efficient Long-Range Reasoning With Short-Context LLMs. | Dulhan Jayalath, James Bradley Wendt, Nicholas Monath, Sandeep Tata, Beliz Gunel |
| 2024 | EMNLP | Enhancing Incremental Summarization with Structured Representations. | Eunjeong Hwang, Yichao Zhou, James B. Wendt, Beliz Gunel, Nguyen Vo, Jing Xie, Sandeep Tata |
| 2024 | ICDE | FieldSwap: Data Augmentation for Effective Form-Like Document Extraction. | Jing Xie, James B. Wendt, Yichao Zhou, Seth Ebner, Sandeep Tata |
| 2024 | KDD | Measuring an LLM's Proficiency at using APIs: A Query Generation Strategy. | Ying Sheng, Sudeep Gandhe, Bhargav Kanagal, Nick Edmonds, Zachary Fisher, Sandeep Tata, Aarush Selvan |
| 2023 | EMNLP | Selective Labeling: How to Radically Lower Data-Labeling Costs for Document Extraction Models. | Yichao Zhou, James B. Wendt, Navneet Potti, Jing Xie, Sandeep Tata |
| 2023 | KDD | VRDU: A Benchmark for Visually-rich Document Understanding. | Zilong Wang, Yichao Zhou, Wei Wei, Chen-Yu Lee, Sandeep Tata |
| 2023 | WWW | STRUM: Extractive Aspect-Based Contrastive Summarization. | Beliz Gunel, Sandeep Tata, Marc Najork |
| 2022 | KDD | DI-2022: The Third Document Intelligence Workshop. | Ani Nenkova, Douglas Burdick, Benjamin Han, Dave Lewis, Sandeep Tata, Dan Tecuci |
| 2022 | WSDM | Learning Transferable Node Representations for Attribute Extraction from Web Documents. | Yichao Zhou, Ying Sheng, Nguyen Vo, Nick Edmonds, Sandeep Tata |
| 2021 | KDD | DI-2021: The Second Document Intelligence Workshop. | Benjamin Han, Douglas Burdick, Dave Lewis, Yijuan Lu, Hamid Motahari, Sandeep Tata |
| 2020 | ACL | Representation Learning for Information Extraction from Form-like Documents. | Bodhisattwa Prasad Majumder, Navneet Potti, Sandeep Tata, James Bradley Wendt, Qi Zhao, Marc Najork |
| 2020 | CIDR | Migrating a Privacy-Safe Information Extraction System to a Software 2.0 Design. | Ying Sheng, Nguyen Vo, James B. Wendt, Sandeep Tata, Marc Najork |
| 2020 | KDD | Improving Recommendation Quality in Google Drive. | Suming J. Chen, Zhen Qin, Zac Wilson, Brian Calaci, Michael Rose, Ryan Evans, Sean Abraham, Donald Metzler, Sandeep Tata, Mike Colagrosso |
| 2020 | KDD | FreeDOM: A Transferable Neural Architecture for Structured Information Extraction on Web Documents. | Bill Yuchen Lin, Ying Sheng, Nguyen Vo, Sandeep Tata |
| 2019 | CIDR | ItemSuggest: A Data Management Platform for Machine Learned Ranking Services. | Sandeep Tata, Vlad Panait, Suming J. Chen, Mike Colagrosso |
| 2019 | WWW | RiSER: Learning Better Representations for Richly Structured Emails. | Furkan Kocayusufoglu, Ying Sheng, Nguyen Vo, James B. Wendt, Qi Zhao, Sandeep Tata, Marc Najork |
| 2018 | ICDE | Recommendations for All: Solving Thousands of Recommendation Problems Daily. | Bhargav Kanagal, Sandeep Tata |
| 2018 | KDD | Anatomy of a Privacy-Safe Large-Scale Information Extraction System Over Email. | Ying Sheng, Sandeep Tata, James B. Wendt, Jing Xie, Qi Zhao, Marc Najork |
| 2018 | WWW | Hidden in Plain Sight: Classifying Emails Using Embedded Image Contents. | Navneet Potti, James B. Wendt, Qi Zhao, Sandeep Tata, Marc Najork |
| 2017 | KDD | Quick Access: Building a Smart Experience for Google Drive. | Sandeep Tata, Alexandrin Popescul, Marc Najork, Mike Colagrosso, Julian Gibbons, Alan Green, Alexandre Mah, Michael Smith, Divanshu Garg, Cayden Meyer, Reuben Kan |
| 2014 | EDBT | Diff-Index: Differentiated Index in Distributed Log-Structured Data Stores. | Wei Tan, Sandeep Tata, Yuzhe Richard Tang, Liana L. Fong |
| 2013 | EDBT | Sparkler: supporting large-scale matrix factorization. | Boduo Li, Sandeep Tata, Yannis Sismanis |
| 2012 | EDBT | Clydesdale: structured data processing on MapReduce. | Tim Kaldewey, Eugene J. Shekita, Sandeep Tata |
| 2012 | SIGMOD | Clydesdale: structured data processing on hadoop. | Andrey Balmin, Tim Kaldewey, Sandeep Tata |
| 2010 | ICDE | Efficient and accurate discovery of patterns in sequence datasets. | Avrilia Floratou, Sandeep Tata, Jignesh M. Patel |
| 2009 | CIKM | Leveraging a scalable row store to build a distributed text index. | Ning Li, Jun Rao, Eugene J. Shekita, Sandeep Tata |
| 2008 | ICDE | FLAME: Shedding Light on Hidden Frequent Patterns in Sequence Datasets. | Sandeep Tata, Jignesh M. Patel |
| 2008 | ICDE | On common tools for databases - The case for a client-based index advisor. | Sandeep Tata, Lin Qiao, Guy M. Lohman |
| 2008 | SIGMOD | SQAK: doing more with keywords. | Sandeep Tata, Guy M. Lohman |
| 2007 | VLDB | Periscope/SQ: Interactive Exploration of Biological Sequence Databases. | Sandeep Tata, Willis Lang, Jignesh M. Patel |
| 2006 | ICDE | Declarative Querying for Biological Sequences. | Sandeep Tata, Jignesh M. Patel, James S. Friedman, Anand Swaroop |
| 2004 | VLDB | Practical Suffix Tree Construction. | Sandeep Tata, Richard A. Hankins, Jignesh M. Patel |
| 2003 | SSDBM | PiQA: An Algebra for Querying Protein Data Sets. | Sandeep Tata, Jignesh M. Patel |