| 2026 | ACL | The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining. | Jiandong Shao, Raphael Tang, Crystina Zhang, Karin Sevegnani, Pontus Stenetorp, Jianfei Yang, Yao Lu |
| 2025 | ECIR | Rank-Without-GPT: Building GPT-Independent Listwise Rerankers on Open-Source Large Language Models. | Crystina Zhang, Sebastian Hofsttter, Patrick Lewis, Raphael Tang, Jimmy Lin |
| 2025 | EMNLP | Lost in Embeddings: Information Loss in Vision-Language Models. | Wenyan Li, Raphael Tang, Chengzu Li, Caiqi Zhang, Ivan Vulic, Anders Sgaard |
| 2025 | EMNLP | Multilingual Language Model Pretraining using Machine-translated Data. | Jiayi Wang, Yao Lu, Maurice Weber, Max Ryabinin, David Ifeoluwa Adelani, Yihong Chen, Raphael Tang, Pontus Stenetorp |
| 2024 | ACL | Understanding Retrieval Robustness for Retrieval-augmented Image Captioning. | Wenyan Li, Jiaang Li, Rita Ramos, Raphael Tang, Desmond Elliott |
| 2024 | EMNLP | FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food Culture. | Wenyan Li, Xinyu Zhang, Jiaang Li, Qiwei Peng, Raphael Tang, Li Zhou, Weijia Zhang, Guimin Hu, Yifei Yuan, Anders Sgaard, Daniel Hershcovich, Desmond Elliott |
| 2024 | EMNLP | Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation. | Raphael Tang, Xinyu Zhang, Lixinyu Xu, Yao Lu, Wenyan Li, Pontus Stenetorp, Jimmy Lin, Ferhan Ture |
| 2024 | NAACL | Strings from the Library of Babel: Random Sampling as a Strong Baseline for Prompt Optimisation. | Yao Lu, Jiayi Wang, Raphael Tang, Sebastian Riedel, Pontus Stenetorp |
| 2024 | NAACL | Found in the Middle: Permutation Self-Consistency Improves Listwise Ranking in Large Language Models. | Raphael Tang, Xinyu Zhang, Xueguang Ma, Jimmy Lin, Ferhan Ture |
| 2024 | SIGIR | "Ask Me Anything": How Comcast Uses LLMs to Assist Agents in Real Time. | Scott Rome, Tianwen Chen, Raphael Tang, Luwei Zhou, Ferhan Ture |
| 2023 | ACL | "Low-Resource" Text Classification: A Parameter-Free Classification Method with Compressors. | Zhiying Jiang, Matthew Y. R. Yang, Mikhail Tsirlin, Raphael Tang, Yiqin Dai, Jimmy Lin |
| 2023 | ACL | What the DAAM: Interpreting Stable Diffusion Using Cross Attention. | Raphael Tang, Linqing Liu, Akshat Pandey, Zhiying Jiang, Gefei Yang, Karun Kumar, Pontus Stenetorp, Jimmy Lin, Ferhan Ture |
| 2023 | ACL | Operator Selection and Ordering in a Pipeline Approach to Efficiency Optimizations for Transformers. | Ji Xin, Raphael Tang, Zhiying Jiang, Yaoliang Yu, Jimmy Lin |
| 2022 | EMNLP | SpeechNet: Weakly Supervised, End-to-End Speech Recognition at Industrial Scale. | Raphael Tang, Karun Kumar, Gefei Yang, Akshat Pandey, Yajie Mao, Vladislav Belyaev, Madhuri Emmadi, G. Craig Murray, Ferhan Ture, Jimmy Lin |
| 2022 | ICASSP | Temporal Early Exiting for Streaming Speech Commands Recognition. | Raphael Tang, Karun Kumar, Ji Xin, Piyush Vyas, Wenyan Li, Gefei Yang, Yajie Mao, G. Craig Murray, Jimmy Lin |
| 2021 | ACL | The Art of Abstention: Selective Prediction and Error Regularization for Natural Language Processing. | Ji Xin, Raphael Tang, Yaoliang Yu, Jimmy Lin |
| 2021 | EACL | BERxiT: Early Exiting for BERT with Better Fine-Tuning and Extension to Regression. | Ji Xin, Raphael Tang, Yaoliang Yu, Jimmy Lin |
| 2021 | EMNLP | Voice Query Auto Completion. | Raphael Tang, Karun Kumar, Kendra Chalkley, Ji Xin, Liming Zhang, Wenyan Li, Gefei Yang, Yajie Mao, Junho Shin, Geoffrey Craig Murray, Jimmy Lin |
| 2020 | ACL | Showing Your Work Doesn't Always Work. | Raphael Tang, Jaejun Lee, Ji Xin, Xinyu Liu, Yaoliang Yu, Jimmy Lin |
| 2020 | ACL | DeeBERT: Dynamic Early Exiting for Accelerating BERT Inference. | Ji Xin, Raphael Tang, Jaejun Lee, Yaoliang Yu, Jimmy Lin |
| 2020 | EMNLP | Inserting Information Bottleneck for Attribution in Transformers. | Zhiying Jiang, Raphael Tang, Ji Xin, Jimmy Lin |
| 2020 | EMNLP | Covidex: Neural Ranking Models and Keyword Search Infrastructure for the COVID-19 Open Research Dataset. | Edwin Zhang, Nikhil Gupta, Raphael Tang, Xiao Han, Ronak Pradeep, Kuang Lu, Yue Zhang, Rodrigo Nogueira, Kyunghyun Cho, Hui Fang, Jimmy Lin |
| 2019 | EMNLP | Honkling: In-Browser Personalization for Ubiquitous Keyword Spotting. | Jaejun Lee, Raphael Tang, Jimmy Lin |
| 2019 | EMNLP | Incorporating Contextual and Syntactic Structures Improves Semantic Similarity Modeling. | Linqing Liu, Wei Yang, Jinfeng Rao, Raphael Tang, Jimmy Lin |
| 2019 | IUI | Universal voice-enabled user interfaces using JavaScript. | Jaejun Lee, Raphael Tang, Jimmy Lin |
| 2019 | NAACL | Rethinking Complex Neural Network Architectures for Document Classification. | Ashutosh Adhikari, Achyudh Ram, Raphael Tang, Jimmy Lin |
| 2019 | SIGIR | Yelling at Your TV: An Analysis of Speech Recognition Errors and Subsequent User Behavior on Entertainment Systems. | Raphael Tang, Ferhan Tre, Jimmy Lin |
| 2019 | SIGIR | Challenges and Opportunities in Understanding Spoken Queries Directed at Modern Entertainment Platforms. | Ferhan Tre, Jinfeng Rao, Raphael Tang, Jimmy Lin |
| 2018 | ICASSP | Deep Residual Learning for Small-Footprint Keyword Spotting. | Raphael Tang, Jimmy Lin |
| 2018 | ICASSP | An Experimental Analysis of the Power Consumption of Convolutional Neural Networks for Keyword Spotting. | Raphael Tang, Weijie Wang, Zhucheng Tu, Jimmy Lin |