| 2025 | Non-linear Audio-Visual Storytelling from Scanned Comics: A Character-Centric Approach. | Ansh Kushwaha, Sandeep Khanna, Lenin Khangjrakpam, Chiranjoy Chattopadhyay, Gaurav Bhatnagar |
| 2025 | TexTAR: Textual Attribute Recognition in Multi-domain and Multi-lingual Document Images. | Rohan Kumar, Jyothi Swaroopa Jinka, Ravi Kiran Sarvadevabhatla |
| 2025 | Epimethee - A Workflow from OCR to Spatial Mapping. | Caroline Koudoro-Parfait, Marceau Hernandez, Gal Lejeune, Yoann Dupont |
| 2025 | TextBite: A Historical Czech Document Dataset for Logical Page Segmentation. | Martin Kostelnk, Karel Benes, Michal Hradis |
| 2025 | Self-HTR: A Novel Self-supervised Handwritten Text Recognition Framework Using Generative Adversarial Networks. | Lisa Koopmans, Maruf A. Dhali, Lambert Schomaker |
| 2025 | Practical Fine-Tuning of Autoregressive Models on Limited Handwritten Texts. | Jan Koht, Michal Hradis |
| 2025 | BiblioPage: A Dataset of Scanned Title Pages for Bibliographic Metadata Extraction. | Jan Koht, Martin Docekal, Michal Hradis, Marek Vasko |
| 2025 | Optimizing Chart Image Classification: A Study of Data Augmentation and Training Strategies. | Josh Knize, Kenny Davila |
| 2025 | AnnoPage Dataset: Dataset of Non-textual Elements in Documents with Fine-Grained Categorization. | Martin Kiss, Michal Hradis, Martina Dvorkov, Vclav Jirousek, Filip Kersch |
| 2025 | Masked Self-supervised Pre-training for Text Recognition Transformers on Large-Scale Datasets. | Martin Kiss, Michal Hradis |
| 2025 | Version 5 of the Kraken ATR Engine for the Humanities. | Benjamin Kiessling |
| 2025 | From Notes to Keys: A VR Learning Environment for Sheet Music Interpretation. | Sandeep Khanna, Atanu Saha, Rahul Kumar Ray, Rakesh Patibanda, Chiranjoy Chattopadhyay |
| 2025 | KIEval: Evaluation Metric for Document Key Information Extraction. | Minsoo Khang, Sang Chul Jung, Sungrae Park, Teakgyu Hong |
| 2025 | Visual Text Generation in Khmer Language: Challenges and Trends with Diffusion Models. | Saly Keo, Vannkinh Nom, Souhail Bakkali, Muhammad Muzzamil Luqman, Mickal Coustaty, Jean-Marc Ogier |
| 2025 | Historic Scripts to Modern Vision: A Novel Dataset and A VLM Framework for Transliteration of Modi Script to Devanagari. | Harshal Kausadikar, Tanvi Kale, Onkar Susladkar, Sparsh Mittal |
| 2025 | LLM-Driven Medical Document Analysis: Enhancing Trustworthy Pathology and Differential Diagnosis. | Lei Kang, Xuanshuo Fu, Oriol Ramos Terrades, Javier Vazquez-Corral, Ernest Valveny, Dimosthenis Karatzas |
| 2025 | Expertise Finding: Domain Extraction from Documents Using Fuzzy Clustering. | Dipendra Sharma Kafle, Esma Talhi, Mickal Coustaty, Antoine Doucet |
| 2025 | Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models. | Michael Jungo, Andreas Fischer |
| 2025 | Towards Scene Text Recognition in Rainy Weather Conditions. | Anandita Jamwal, Lalithya Koneti, Manikandan Ravikiran, Dinesh Singh, Rohit Saluja |
| 2025 | Computer-Aided Multi-stroke Character Simplification by Stroke Removal. | Ryo Ishiyama, Shinnosuke Matsuo, Seiichi Uchida |
| 2025 | ExamCleaner: Examination-Paper Handwritten Text Erasure via Large Receptive Field Context Anchor Attention. | Lei Hu, Dongwei Liu, Yujia Chen, Zhenwei Wang, Yamin Li |
| 2025 | Multimodal Content Alignment with LLM for Visual Presentation of Papers. | Huiying Hu, Zhicheng He, Yixiao Zhou, Tongwei Zhang, Xiaoqing Lyu |
| 2025 | StrokeNet: Unveiling How to Learn Fine-Grained Interactions in Online Handwritten Stroke Classification. | Yiheng Huang, Shuang She, Zewei Wei, Jianmin Lin, Ming Yang, Wenyin Liu |
| 2025 | Open Set Oracle Character Recognition via Adaptive Decision Boundary. | Shuangping Huang, Zonghao Liu, Beibei Liu, Wenjie Peng, Yongge Liu |
| 2025 | TABLET: Table Structure Recognition Using Encoder-only Transformers. | Qiyu Hou, Jun Wang |