| 2026 | AAAI | Q Cache: Visual Attention Is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model. | Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu |
| 2025 | AAAI | Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints. | Ming Dai, Jian Li, Jiedong Zhuang, Xian Zhang, Wankou Yang |
| 2025 | AAAI | ST3: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming. | Jiedong Zhuang, Lu Lu, Ming Dai, Rui Hu, Jian Chen, Qiang Liu, Haoji Hu |
| 2025 | ICCV | PropVG: End-To-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination. | Ming Dai, Wenxuan Cheng, Jiedong Zhuang, Jiang-jiang Liu, Hongshen Zhao, Zhenhua Feng, Wankou Yang |
| 2024 | ECCV | FALIP: Visual Prompt as Foveal Attention Boosts CLIP Zero-Shot Performance. | Jiedong Zhuang, Jiaqi Hu, Lianrui Mu, Rui Hu, Xiaoyu Liang, Jiangnan Ye, Haoji Hu |
| 2024 | PRICAI | Zero-Shot Referring Image Segmentation with Hierarchical Prompts and Frequency Domain Fusion. | Changlong Li, Jiedong Zhuang, Jiaqi Hu, Haoji Hu |
| 2024 | PRICAI | Data-Free Quantization of Vision Transformers Through Perturbation-Aware Image Synthesis. | Yuchen Yang, Lianrui Mu, Jiedong Zhuang, Xiaoyu Liang, Jiangnan Ye, Haoji Hu |