| 2025 | AAAI | ProcTag: Process Tagging for Assessing the Efficacy of Document Instruction Data. | Yufan Shen, Chuwei Luo, Zhaoqing Zhu, Yang Chen, Qi Zheng, Zhi Yu, Jiajun Bu, Cong Yao |
| 2024 | AAAI | FontDiffuser: One-Shot Font Generation via Denoising Diffusion with Multi-Scale Content Aggregation and Style Contrastive Learning. | Zhenhua Yang, Dezhi Peng, Yuxin Kong, Yuyi Zhang, Cong Yao, Lianwen Jin |
| 2024 | CVPR | LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding. | Chuwei Luo, Yufan Shen, Zhaoqing Zhu, Qi Zheng, Zhi Yu, Cong Yao |
| 2024 | CVPR | OMNIPARSER: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition. | Jianqiang Wan, Sibo Song, Wenwen Yu, Yuliang Liu, Wenqing Cheng, Fei Huang, Xiang Bai, Cong Yao, Zhibo Yang |
| 2024 | ECCV | WebRPG: Automatic Web Rendering Parameters Generation for Visual Presentation. | Zirui Shao, Feiyu Gao, Hangdi Xing, Zepeng Zhu, Zhi Yu, Jiajun Bu, Qi Zheng, Cong Yao |
| 2024 | ECCV | Platypus: A Generalized Specialist Model for Reading Text in Various Forms. | Peng Wang, Zhaohai Li, Jun Tang, Humen Zhong, Fei Huang, Zhibo Yang, Cong Yao |
| 2024 | ECCV | Visual Text Generation in the Wild. | Yuanzhi Zhu, Jiawei Liu, Feiyu Gao, Wenyu Liu, Xinggang Wang, Peng Wang, Fei Huang, Cong Yao, Zhibo Yang |
| 2024 | EMNLP | DocHieNet: A Large and Diverse Dataset for Document Hierarchy Parsing. | Hangdi Xing, Changxu Cheng, Feiyu Gao, Zirui Shao, Zhi Yu, Jiajun Bu, Qi Zheng, Cong Yao |
| 2023 | AAAI | LORE: Logical Location Regression Network for Table Structure Recognition. | Hangdi Xing, Feiyu Gao, Rujiao Long, Jiajun Bu, Qi Zheng, Liangcheng Li, Cong Yao, Zhi Yu |
| 2023 | BMVC | Building A Mobile Text Recognizer via Truncated SVD-based Knowledge Distillation-Guided NAS. | Weifeng Lin, Canyu Xie, Dezhi Peng, Jiapeng Wang, Lianwen Jin, Wei Ding, Cong Yao, Mengchao He |
| 2023 | CVPR | GeoLayoutLM: Geometric Pre-training for Visual Information Extraction. | Chuwei Luo, Changxu Cheng, Qi Zheng, Cong Yao |
| 2023 | CVPR | Modeling Entities as Semantic Points for Visual Information Extraction in the Wild. | Zhibo Yang, Rujiao Long, Pengfei Wang, Sibo Song, Humen Zhong, Wenqing Cheng, Xiang Bai, Cong Yao |
| 2023 | CVPR | Conditional Text Image Generation with Diffusion Models. | Yuanzhi Zhu, Zhaohai Li, Tianwei Wang, Mengchao He, Cong Yao |
| 2023 | ICCV | LISTER: Neighbor Decoding for Length-Insensitive Scene Text Recognition. | Changxu Cheng, Peng Wang, Cheng Da, Qi Zheng, Cong Yao |
| 2023 | ICCV | Vision Grid Transformer for Document Layout Analysis. | Cheng Da, Chuwei Luo, Qi Zheng, Cong Yao |
| 2023 | ICDAR | ICDAR 2023 Competition on Born Digital Video Text Question Answering. | Zhibo Yang, Xiaoge Song, Sibo Song, Tong Lu, Xiang Bai, Cheng-Lin Liu, Fei Huang, Cong Yao |
| 2022 | CVPR | Revisiting Document Image Dewarping by Grid Regularization. | Xiangwei Jiang, Rujiao Long, Nan Xue, Zhibo Yang, Cong Yao, Gui-Song Xia |
| 2022 | CVPR | Vision-Language Pre-Training for Boosting Scene Text Detectors. | Sibo Song, Jianqiang Wan, Zhibo Yang, Jun Tang, Wenqing Cheng, Xiang Bai, Cong Yao |
| 2022 | ECCV | Levenshtein OCR. | Cheng Da, Peng Wang, Cong Yao |
| 2022 | ECCV | Multi-granularity Prediction for Scene Text Recognition. | Peng Wang, Cheng Da, Cong Yao |
| 2022 | WACV | Facial Attribute Transformers for Precise and Robust Makeup Transfer. | Zhaoyi Wan, Haoran Chen, Jie An, Wentao Jiang, Cong Yao, Jiebo Luo |
| 2021 | CVPR | MOST: A Multi-Oriented Scene Text Detector With Localization Refinement. | Minghang He, Minghui Liao, Zhibo Yang, Humen Zhong, Jun Tang, Wenqing Cheng, Cong Yao, Yongpan Wang, Xiang Bai |
| 2020 | AAAI | Real-Time Scene Text Detection with Differentiable Binarization. | Minghui Liao, Zhaoyi Wan, Cong Yao, Kai Chen, Xiang Bai |
| 2020 | AAAI | TextScanner: Reading Characters in Order for Robust Scene Text Recognition. | Zhaoyi Wan, Minghang He, Haoran Chen, Xiang Bai, Cong Yao |
| 2020 | CVPR | On Vocabulary Reliance in Scene Text Recognition. | Zhaoyi Wan, Jielei Zhang, Liang Zhang, Jiebo Luo, Cong Yao |
| 2020 | ECCV | Differentiable Feature Aggregation Search for Knowledge Distillation. | Yushuo Guan, Pengyu Zhao, Bingxuan Wang, Yuanxing Zhang, Cong Yao, Kaigui Bian, Jian Tang |
| 2020 | ICASSP | A New Perspective for Flexible Feature Gathering in Scene Text Recognition Via Character Anchor Pooling. | Shangbang Long, Yushuo Guan, Kaigui Bian, Cong Yao |
| 2019 | AAAI | Scene Text Recognition from Two-Dimensional Perspective. | Minghui Liao, Jian Zhang, Zhaoyi Wan, Fengming Xie, Jiajun Liang, Pengyuan Lyu, Cong Yao, Xiang Bai |
| 2019 | AAAI | Scene Text Detection with Supervised Pyramid Context Network. | Enze Xie, Yuhang Zang, Shuai Shao, Gang Yu, Cong Yao, Guangyao Li |
| 2019 | ICCV | Symmetry-Constrained Rectification Network for Scene Text Recognition. | Mingkun Yang, Yushuo Guan, Minghui Liao, Xin He, Kaigui Bian, Song Bai, Cong Yao, Xiang Bai |
| 2018 | CVPR | Multi-Oriented Scene Text Detection via Corner Localization and Region Segmentation. | Pengyuan Lyu, Cong Yao, Wenhao Wu, Shuicheng Yan, Xiang Bai |
| 2018 | ECCV | TextSnake: A Flexible Representation for Detecting Text of Arbitrary Shapes. | Shangbang Long, Jiaqiang Ruan, Wenjie Zhang, Xin He, Wenhao Wu, Cong Yao |
| 2018 | ECCV | Mask TextSpotter: An End-to-End Trainable Neural Network for Spotting Text with Arbitrary Shapes. | Pengyuan Lyu, Minghui Liao, Cong Yao, Wenhao Wu, Xiang Bai |
| 2017 | CVPR | EAST: An Efficient and Accurate Scene Text Detector. | Xinyu Zhou, Cong Yao, He Wen, Yuzhi Wang, Shuchang Zhou, Weiran He, Jiajun Liang |
| 2017 | ICDAR | Auto-Encoder Guided GAN for Chinese Calligraphy Synthesis. | Pengyuan Lyu, Xiang Bai, Cong Yao, Zhen Zhu, Tengteng Huang, Wenyu Liu |
| 2017 | ICDAR | ICDAR2017 Competition on Reading Chinese Text in the Wild (RCTW-17). | Baoguang Shi, Cong Yao, Minghui Liao, Mingkun Yang, Pei Xu, Linyan Cui, Serge J. Belongie, Shijian Lu, Xiang Bai |
| 2016 | CVPR | Robust Scene Text Recognition with Automatic Rectification. | Baoguang Shi, Xinggang Wang, Pengyuan Lyu, Cong Yao, Xiang Bai |
| 2016 | CVPR | Multi-oriented Text Detection with Fully Convolutional Networks. | Zheng Zhang, Chengquan Zhang, Wei Shen, Cong Yao, Wenyu Liu, Xiang Bai |
| 2015 | CVPR | Symmetry-based text line detection in natural scenes. | Zheng Zhang, Wei Shen, Cong Yao, Xiang Bai |
| 2015 | ICCV | Relaxed Multiple-Instance SVM with Application to Object Discovery. | Xinggang Wang, Zhuotun Zhu, Cong Yao, Xiang Bai |
| 2015 | ICDAR | Automatic script identification in the wild. | Baoguang Shi, Cong Yao, Chengquan Zhang, Xiaowei Guo, Feiyue Huang, Xiang Bai |
| 2015 | ICDAR | Automatic discrimination of text and non-text natural images. | Chengquan Zhang, Cong Yao, Baoguang Shi, Xiang Bai |
| 2014 | ACCV | Multiple Stage Residual Model for Accurate Image Classification. | Song Bai, Xinggang Wang, Cong Yao, Xiang Bai |
| 2014 | CVPR | Strokelets: A Learned Multi-scale Representation for Scene Text Recognition. | Cong Yao, Xiang Bai, Baoguang Shi, Wenyu Liu |
| 2014 | ECCV | Human Detection Using Learned Part Alphabet and Pose Dictionary. | Cong Yao, Xiang Bai, Wenyu Liu, Longin Jan Latecki |
| 2013 | ICIP | Traffic sign classification using two-layer image representation. | Yingying Zhu, Xinggang Wang, Cong Yao, Xiang Bai |
| 2012 | CVPR | Randomness and sparsity induced codebook learning with application to cancer image classification. | Quannan Li, Cong Yao, Liwei Wang, Zhuowen Tu |
| 2012 | CVPR | Detecting texts of arbitrary orientations in natural images. | Cong Yao, Xiang Bai, Wenyu Liu, Yi Ma, Zhuowen Tu |
| 2012 | ICPR | Online Random Ferns for robust visual tracking. | Cong Rao, Cong Yao, Xiang Bai, Weichao Qiu, Wenyu Liu |
| 2012 | MICCAI | Randomness and Sparsity Induced Codebook Learning with Application to Cancer Image Classification. | Quannan Li, Cong Yao, Liwei Wang, Zhuowen Tu |