| 2026 | ACL | A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends. | Yihao Ding, Siwen Luo, Yue Dai, Yanbei Jiang, Zechuan Li, Qiang Sun, Geoffrey Martin, Wei Liu, Yifan Peng |
| 2026 | WWW | Docs2Synth: A Synthetic Data Tuned Retriever Framework for Documents Understanding. | Yihao Ding, Qiang Sun, Puzhen Wu, Sirui Li, Siwen Luo, Wei Liu |
| 2025 | AAAI | Multimodal Commonsense Knowledge Distillation for Visual Question Answering (Student Abstract). | Shuo Yang, Siwen Luo, Soyeon Caren Han |
| 2025 | ACL | 'No' Matters: Out-of-Distribution Detection in Multimodality Multi-Turn Interactive Dialogue Download PDF. | Rena Wei Gao, Xuetong Wu, Siwen Luo, Caren Han, Feng Liu |
| 2025 | ACL | MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering. | Shuo Yang, Caren Han, Siwen Luo, Eduard H. Hovy |
| 2024 | CIKM | 3M-Health: Multimodal Multi-Teacher Knowledge Distillation for Mental Health Detection. | Rina Carines Cabral, Siwen Luo, Josiah Poon, Soyeon Caren Han |
| 2024 | IJCAI | MMVQA: A Comprehensive Dataset for Investigating Multipage Multimodal Information Retrieval in PDF-based Visual Question Answering. | Yihao Ding, Kaixuan Ren, Jiabin Huang, Siwen Luo, Soyeon Caren Han |
| 2023 | CIKM | Workshop on Document Intelligence Understanding. | Soyeon Caren Han, Yihao Ding, Siwen Luo, Josiah Poon, Hee-Guen Yoon, Zhe Huang, Paul Duuring, Eun-Jung Holden |
| 2023 | WSDM | PiggyBack: Pretrained Visual Question Answering Environment for Backing up Non-deep Learning Professionals. | Zhihao Zhang, Siwen Luo, Junyi Chen, Sijia Lai, Siqu Long, Hyunsuk Chung, Soyeon Caren Han |
| 2022 | COLING | Doc-GCN: Heterogeneous Graph Convolutional Networks for Document Layout Analysis. | Siwen Luo, Yihao Ding, Siqu Long, Josiah Poon, Soyeon Caren Han |
| 2020 | COLING | VICTR: Visual Information Captured Text Representation for Text-to-Vision Multimodal Tasks. | Soyeon Caren Han, Siqu Long, Siwen Luo, Kunze Wang, Josiah Poon |
| 2020 | ICONIP | REXUP: I REason, I EXtract, I UPdate with Structured Compositional Reasoning for Visual Question Answering. | Siwen Luo, Soyeon Caren Han, Kaiyuan Sun, Josiah Poon |
| 2013 | ADMA | Cluster Labeling Extraction and Ranking Feature Selection for High Quality XML Pseudo Relevance Feedback Fragments Set. | Minjuan Zhong, Changxuan Wan, Dexi Liu, Shumei Liao, Siwen Luo |