| 2022 | LREC | MultiSubs: A Large-scale Multimodal and Multilingual Dataset. | Josiah Wang, Josiel Figueiredo, Lucia Specia |
| 2019 | ACL | VIFIDEL: Evaluating the Visual Fidelity of Image Descriptions. | Pranava Madhyastha, Josiah Wang, Lucia Specia |
| 2019 | ICCV | Phrase Localization Without Paired Training Examples. | Josiah Wang, Lucia Specia |
| 2018 | BMVC | End-to-end Image Captioning Exploits Distributional Similarity in Multimodal Space. | Pranava Swaroop Madhyastha, Josiah Wang, Lucia Specia |
| 2018 | EMNLP | End-to-end Image Captioning Exploits Distributional Similarity in Multimodal Space. | Pranava Swaroop Madhyastha, Josiah Wang, Lucia Specia |
| 2018 | NAACL | Defoiling Foiled Image Captions. | Pranava Swaroop Madhyastha, Josiah Wang, Lucia Specia |
| 2018 | NAACL | Object Counts! Bringing Explicit Detections Back into Image Captioning. | Josiah Wang, Pranava Swaroop Madhyastha, Lucia Specia |
| 2016 | CVPR | Large Scale Semi-Supervised Object Detection Using Visual and Semantic Knowledge Transfer. | Yuxing Tang, Josiah Wang, Boyang Gao, Emmanuel Dellandra, Robert J. Gaizauskas, Liming Chen |
| 2016 | ECIR | Harvesting Training Images for Fine-Grained Object Categories Using Visual Descriptions. | Josiah Wang, Katja Markert, Mark Everingham |
| 2016 | INLG | Don't Mention the Shoe! A Learning to Rank Approach to Content Selection for Image Description Generation. | Josiah Wang, Robert J. Gaizauskas |
| 2016 | LREC | Cross-validating Image Description Datasets and Evaluation Metrics. | Josiah Wang, Robert J. Gaizauskas |
| 2015 | EMNLP | Combining Geometric, Textual and Visual Features for Predicting Prepositions in Image Descriptions. | Arnau Ramisa, Josiah Wang, Ying Lu, Emmanuel Dellandra, Francesc Moreno-Noguer, Robert J. Gaizauskas |
| 2009 | BMVC | Learning Models for Object Recognition from Natural Language Descriptions. | Josiah Wang, Katja Markert, Mark Everingham |