| 2026 | ACL | ArrowGEV: Grounding Events in Video via Learning the Arrow of Time. | Fangxu Yu, Ziyao Lu, Liqiang Niu, Fandong Meng, Jie Zhou |
| 2025 | ACL | AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity. | Zhibin Lan, Liqiang Niu, Fandong Meng, Wenbo Li, Jie Zhou, Jinsong Su |
| 2025 | EMNLP | LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning. | Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su |
| 2025 | EMNLP | TIU-Bench: A Benchmark for Evaluating Large Multimodal Models on Text-rich Image Understanding. | Kun Zhang, Liqiang Niu, Zhen Cao, Fandong Meng, Jie Zhou |
| 2024 | ACL | Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation. | Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Min Zhang, Jinsong Su |
| 2024 | COLING | UMTIT: Unifying Recognition, Translation, and Generation for Multimodal Text Image Translation. | Liqiang Niu, Fandong Meng, Jie Zhou |
| 2015 | ACML | A Unified Framework for Jointly Learning Distributed Representations of Word and Attributes. | Liqiang Niu, Xin-Yu Dai, Shujian Huang, Jiajun Chen |