| 2026 | AAAI | State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal Models. | Geewook Kim, Minjoon Seo |
| 2026 | EACL | Instruction Tuning with and without Context: Behavioral Shifts and Downstream Impact. | Hyunji Lee, Seunghyun Yoon, Yunjae Won, Hanseok Oh, Geewook Kim, Trung Bui, Franck Dernoncourt, Elias Stengel-Eskin, Mohit Bansal, Minjoon Seo |
| 2025 | ACL | MMRefine: Unveiling the Obstacles to Robust Refinement in Multimodal Large Language Models. | Gio Paik, Geewook Kim, Jinbae Im |
| 2025 | ICLR | How Does Vision-Language Adaptation Impact the Safety of Vision Language Models? | Seongyun Lee, Geewook Kim, Jiyeon Kim, Hyunji Lee, Hoyeon Chang, Sue Hyun Park, Minjoon Seo |
| 2025 | NAACL | Evaluating Multimodal Generative AI with Korean Educational Standards. | Sanghee Park, Geewook Kim |
| 2024 | ACL | Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation. | Seongyun Lee, Seungone Kim, Sue Hyun Park, Geewook Kim, Minjoon Seo |
| 2024 | EMNLP | On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning. | Geewook Kim, Minjoon Seo |
| 2024 | ICDAR | CREPE: Coordinate-Aware End-to-End Document Parser. | Yamato Okamoto, Youngmin Baek, Geewook Kim, Ryota Nakao, DongHyun Kim, Moonbin Yim, Seunghyun Park, Bado Lee |
| 2023 | EMNLP | Visually-Situated Natural Language Understanding with Contrastive Reading Model and Frozen Large Language Models. | Geewook Kim, Hodong Lee, Daehee Kim, Haeji Jung, Sanghee Park, Yoonsik Kim, Sangdoo Yun, Taeho Kil, Bado Lee, Seunghyun Park |
| 2023 | ICCV | SCOB: Universal Text Understanding via Character-wise Supervised Contrastive Learning with Online Text Rendering for Bridging Domain Gap. | Daehee Kim, Yoonsik Kim, Donghyun Kim, Yumin Lim, Geewook Kim, Taeho Kil |
| 2023 | ICDAR | On Web-based Visual Corpus Construction for Visual Document Understanding. | Donghyun Kim, Teakgyu Hong, Moonbin Yim, Yoonsik Kim, Geewook Kim |
| 2023 | ICDAR | On Text Localization in End-to-End OCR-Free Document Understanding Transformer Without Text Localization Supervision. | Geewook Kim, Shuhei Yokoo, Sukmin Seo, Atsuki Osanai, Yamato Okamoto, Youngmin Baek |
| 2022 | ECCV | OCR-Free Document Understanding Transformer. | Geewook Kim, Teakgyu Hong, Moonbin Yim, JeongYeon Nam, Jinyoung Park, Jinyeong Yim, Wonseok Hwang, Sangdoo Yun, Dongyoon Han, Seunghyun Park |
| 2021 | EMNLP | Cost-effective End-to-end Information Extraction for Semi-structured Document Images. | Wonseok Hwang, Hyunji Lee, Jinyeong Yim, Geewook Kim, Minjoon Seo |
| 2020 | COLING | Scale down Transformer by Grouping Features for a Lightweight Character-level Language Model. | Sungrae Park, Geewook Kim, Junyeop Lee, Junbum Cha, Ji-Hoon Kim, Hwalsuk Lee |
| 2019 | AISTATS | Graph Embedding with Shifted Inner Product Similarity and Its Improved Approximation Capability. | Akifumi Okuno, Geewook Kim, Hidetoshi Shimodaira |
| 2019 | ICCV | What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis. | Jeonghun Baek, Geewook Kim, Junyeop Lee, Sungrae Park, Dongyoon Han, Sangdoo Yun, Seong Joon Oh, Hwalsuk Lee |
| 2019 | IJCAI | Representation Learning with Weighted Inner Product for Universal Approximation of General Similarities. | Geewook Kim, Akifumi Okuno, Kazuki Fukui, Hidetoshi Shimodaira |
| 2019 | NAACL | Segmentation-free compositional n-gram embedding. | Geewook Kim, Kazuki Fukui, Hidetoshi Shimodaira |