| 2026 | AAAI | RegionRAG: Region-level Retrieval-Augmented Generation for Visual Document Understanding. | Yinglu Li, Zhiying Lu, Zhihang Liu, Yiwei Sun, Chuanbin Liu, Hongtao Xie |
| 2026 | AAAI | SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability. | Jiankang Wang, Zhihan Zhang, Zhihang Liu, Yang Li, Jiannan Ge, Hongtao Xie, Yongdong Zhang |
| 2026 | ISCAS | Efficient FPGA Deployment of Power-of-Two Quantized Networks via Dynamic Hierarchical Base-Exponent Offset Encoding. | Zongcheng Yue, Zhihang Liu, Sean Longyu Ma, Chiu-Wing Sham |
| 2025 | CVPR | Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models. | Zhihang Liu, Chen-Wei Xie, Pandeng Li, Liming Zhao, Longxiang Tang, Yun Zheng, Chuanbin Liu, Hongtao Xie |
| 2025 | IJCNN | A Novel Computing Paradigm for MobileNetV3 using Memristor. | Jiale Li, Zhihang Liu, Sean Longyu Ma, Chiu-Wing Sham, Chong Fu |
| 2024 | AAAI | Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval. | Zhihang Liu, Jun Li, Hongtao Xie, Pandeng Li, Jiannan Ge, Sun'ao Liu, Guoqing Jin |
| 2024 | ECAI | CLIP-based Cross-Level Semantic Interaction and Recombination Network for Composed Image Retrieval. | Zhihang Liu, Qiang Huang, Yingying Zhu |