| 2025 | IJCNN | What Happens in the Surroundings: A Benchmark for 360° image Captioning. | Wenhui Jiang, Tiancong Xu, Haijun Li, Zichen Li, Yuming Fang, Zhen Tang |
| 2024 | AAAI | Comprehensive Visual Grounding for Video Description. | Wenhui Jiang, Yibo Cheng, Linxin Liu, Yuming Fang, Yuxin Peng, Yang Liu |
| 2023 | VCIP | Feature Adaptive YOLO for Remote Sensing Detection in Adverse Weather Conditions. | Chaojun Ni, Wenhui Jiang, Chao Cai, Qishou Zhu, Yuming Fang |
| 2022 | ICASSP | Informative Attention Supervision for Grounded Video Description. | Boyang Wan, Wenhui Jiang, Yuming Fang |
| 2022 | MMSP | Bilinear CNNs for Blind Quality Assessment of Fine-Grained Images. | Lixia Liu, Jiebin Yan, Yuming Fang, Wenhui Jiang |
| 2022 | VCIP | Dual-stream Self-attention Network for Image Captioning. | Boyang Wan, Wenhui Jiang, Yuming Fang, Wenying Wen, Hantao Liu |
| 2016 | ICASSP | ALADDIN: A locality aligned deep model for instance search. | Wenhui Jiang, Zhicheng Zhao, Fei Su, Anni Cai |
| 2015 | VCIP | Part-based deep network for pedestrian detection in surveillance videos. | Qi Chen, Wenhui Jiang, Yanyun Zhao, Zhicheng Zhao |