| 2025 | ACL | AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity. | Zhibin Lan, Liqiang Niu, Fandong Meng, Wenbo Li, Jie Zhou, Jinsong Su |
| 2025 | EMNLP | LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning. | Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su |
| 2025 | EMNLP | PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models. | Wanru Zhuang, Wenbo Li, Zhibin Lan, Xu Han, Peng Li, Jinsong Su |
| 2025 | ICASSP | "I've Heard of You!": Generate Spoken Named Entity Recognition Data for Unseen Entities. | Jiawei Yu, Xiang Geng, Yuang Li, Mengxin Ren, Wei Tang, Jiahuan Li, Zhibin Lan, Min Zhang, Hao Yang, Shujian Huang, Jinsong Su |
| 2024 | ACL | Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation. | Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Min Zhang, Jinsong Su |
| 2024 | EMNLP | Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training. | Wenbo Li, Guohao Li, Zhibin Lan, Xue Xu, Wanru Zhuang, Jiachen Liu, Xinyan Xiao, Jinsong Su |
| 2023 | ACL | Exploring Better Text Image Translation with Multimodal Codebook. | Zhibin Lan, Jiawei Yu, Xiang Li, Wen Zhang, Jian Luan, Bin Wang, Degen Huang, Jinsong Su |