| 2026 | AAAI | S³-MSD: Large Vision-Language Model for Explainable and Generalizable Multi-modal Sarcasm Detection. | Zhihong Zhu, Fan Zhang, Yunyan Zhang, Jinghan Sun, Guimin Hu, Hao Wu, Yuyan Chen, Bowen Xing, Xian Wu |
| 2026 | AAAI | CMID: Towards Medical Visual Question Answering via Contrastive Mutual Information Decoding. | Zhihong Zhu, Yunyan Zhang, Fan Zhang, Bowen Xing, Xian Wu |
| 2026 | ACL | Beyond Surface Features: Advancing Medical Vision-Language Alignment via Dynamic Evidence-Guided Preference Optimization. | Zixuan Huang, Zhihong Zhu, Xiaolong Liu, Yanchao Hao, Manman Zhang, Zheng Wei, Bowen Xing, Xian Wu, Ye Li, Fen Miao, Yefeng Zheng |
| 2026 | ACL | MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models. | Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang |
| 2026 | ACL | Multimodal Dual-Path Decoding for Medical Report Generation. | Jinghan Sun, Dong Wei, Zhihong Zhu, Yuyang Xue, Steven McDonagh, Xian Wu |
| 2025 | AAAI | Harnessing Large Language Models for Knowledge Graph Question Answering via Adaptive Multi-Aspect Retrieval-Augmentation. | Derong Xu, Xinhang Li, Ziheng Zhang, Zhenxi Lin, Zhihong Zhu, Zhi Zheng, Xian Wu, Xiangyu Zhao, Tong Xu, Enhong Chen |
| 2025 | ACL | HTML: Hierarchical Topology Multi-task Learning for Semantic Parsing in Knowledge Base Question Answering. | Aziguli Wulamu, Lyu Zhengyu, Kaiyuan Gong, Yu Han, Zewen Wang, Zhihong Zhu, Bowen Xing |
| 2025 | ACL | A Survey on Foundation Language Models for Single-cell Biology. | Fan Zhang, Hao Chen, Zhihong Zhu, Ziheng Zhang, Zhenxi Lin, Ziyue Qiao, Yefeng Zheng, Xian Wu |
| 2025 | ACL | Can We Trust AI Doctors? A Survey of Medical Hallucination in Large Language and Large Vision-Language Models. | Zhihong Zhu, Yunyan Zhang, Xianwei Zhuang, Fan Zhang, Zhongwei Wan, Yuyan Chen, Qingqing Long, Yefeng Zheng, Xian Wu |
| 2025 | CVPR | VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification. | Xianwei Zhuang, Zhihong Zhu, Yuxin Xie, Liming Liang, Yuexian Zou |
| 2025 | EMNLP | RTE-GMoE: A Model-agnostic Approach for Relation Triplet Extraction via Graph-based Mixture-of-Expert Mutual Learning. | Aziguli Wulamu, Kaiyuan Gong, Lyu Zhengyu, Yu Han, Zhihong Zhu, Bowen Xing |
| 2025 | EMNLP | CMedCalc-Bench: A Fine-Grained Benchmark for Chinese Medical Calculations in LLM. | Yunyan Zhang, Zhihong Zhu, Xian Wu |
| 2025 | EMNLP | A Survey on Multi-modal Intent Recognition: Recent Advances and New Frontiers. | Zhihong Zhu, Fan Zhang, Yunyan Zhang, Jinghan Sun, Zhiqi Huang, Qingqing Long, Bowen Xing, Xian Wu |
| 2025 | ICASSP | Towards Zero-shot Cross-lingual SLU with Syntax-aware Multi-view Contrastive Learning. | Yuxin Xie, Zhen Xiong, Tinghe Zhang, Mengke Cui, Yuqi Li, Zhiqi Huang, Zhihong Zhu |
| 2025 | ICASSP | HCoTT: Hierarchical Chain-of-Thought Distillation. | Zhichang Wang, Xianwei Zhuang, Zhihong Zhu, Yuexian Zou |
| 2025 | ICASSP | Rethinking Decoding in Multi-intent Spoken Language Understanding. | Ying Xia, Zhen Xiong, Kefan Shen, Zhihong Zhu, Shaorong Xie, Wei Liu |
| 2025 | ICASSP | Enhancing Image Generation Fidelity via Progressive Prompts. | Zhen Xiong, Yuqi Li, Chuanguang Yang, Tiao Tan, Zhihong Zhu, Siyuan Li, Yue Ma |
| 2025 | ICLR | DisPose: Disentangling Pose Guidance for Controllable Human Image Animation. | Hongxiang Li, Yaowei Li, Yuhang Yang, Junjie Cao, Zhihong Zhu, Xuxin Cheng, Long Chen |
| 2025 | ICLR | D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models. | Zhongwei Wan, Xinjian Wu, Yu Zhang, Yi Xin, Chaofan Tao, Zhihong Zhu, Xin Wang, Siqi Luo, Jing Xiong, Longyue Wang, Mi Zhang |
| 2025 | ICLR | UniCoTT: A Unified Framework for Structural Chain-of-Thought Distillation. | Xianwei Zhuang, Zhihong Zhu, Zhichang Wang, Xuxin Cheng, Yuexian Zou |
| 2025 | IJCNN | HACL: A Hybrid Adaptive Curriculum Learning Framework for Multi-modal Sarcasm Detection. | Kefan Shen, Yukang Huang, Wenyao Wang, Shaorong Xie, Zhihong Zhu, Wei Liu |
| 2024 | AAAI | Towards Multi-Intent Spoken Language Understanding via Hierarchical Attention and Optimal Transport. | Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Yaowei Li, Xianwei Zhuang, Yuexian Zou |
| 2024 | AAAI | Exploiting Auxiliary Caption for Video Grounding. | Hongxiang Li, Meng Cao, Xuxin Cheng, Yaowei Li, Zhihong Zhu, Yuexian Zou |
| 2024 | AAAI | Aligner²: Enhancing Joint Multiple Intent Detection and Slot Filling via Adjustive and Forced Cross-Task Alignment. | Zhihong Zhu, Xuxin Cheng, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2024 | ACL | Cyclical Contrastive Learning Based on Geodesic for Zero-shot Cross-lingual Spoken Language Understanding. | Xuxin Cheng, Zhihong Zhu, Bang Yang, Xianwei Zhuang, Hongxiang Li, Yuexian Zou |
| 2024 | ACL | MoE-SLU: Towards ASR-Robust Spoken Language Understanding via Mixture-of-Experts. | Xuxin Cheng, Zhihong Zhu, Xianwei Zhuang, Zhanpeng Chen, Zhiqi Huang, Yuexian Zou |
| 2024 | ACL | Code-Switching Can be Better Aligners: Advancing Cross-Lingual SLU through Representation-Level and Prediction-Level Alignment. | Zhihong Zhu, Xuxin Cheng, Zhanpeng Chen, Xianwei Zhuang, Zhiqi Huang, Yuexian Zou |
| 2024 | CIKM | PIXEL: Prompt-based Zero-shot Hashing via Visual and Textual Semantic Alignment. | Zeyu Dong, Qingqing Long, Yihang Zhou, Pengfei Wang, Zhihong Zhu, Xiao Luo, Yidong Wang, Pengyang Wang, Yuanchun Zhou |
| 2024 | CIKM | MOAT: Graph Prompting for 3D Molecular Graphs. | Qingqing Long, Yuchen Yan, Wentao Cui, Wei Ju, Zhihong Zhu, Yuanchun Zhou, Xuezhi Wang, Meng Xiao |
| 2024 | CIKM | Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models. | Derong Xu, Ziheng Zhang, Zhihong Zhu, Zhenxi Lin, Qidong Liu, Xian Wu, Tong Xu, Wanyu Wang, Yuyang Ye, Xiangyu Zhao, Enhong Chen, Yefeng Zheng |
| 2024 | CIKM | SaLa: Scenario-aware Label Graph Interaction for Multi-intent Spoken Language Understanding. | Zhihong Zhu, Xuxin Cheng, Zhanpeng Chen, Zhichang Wang, Zhiqi Huang, Yuexian Zou |
| 2024 | COLING | Knowledge-enhanced Prompt Tuning for Dialogue-based Relation Extraction with Trigger and Label Semantic. | Hao An, Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Yuexian Zou |
| 2024 | COLING | InfoEnh: Towards Multimodal Sentiment Analysis via Information Bottleneck Filter and Optimal Transport Alignment. | Yifeng Xie, Zhihong Zhu, Xuan Lu, Zhiqi Huang, Haoran Xiong |
| 2024 | COLING | Multi-perspective Improvement of Knowledge Graph Completion with Large Language Models. | Derong Xu, Ziheng Zhang, Zhenxi Lin, Xian Wu, Zhihong Zhu, Tong Xu, Xiangyu Zhao, Yefeng Zheng, Enhong Chen |
| 2024 | COLING | Zero-Shot Spoken Language Understanding via Large Language Models: A Preliminary Study. | Zhihong Zhu, Xuxin Cheng, Hao An, Zhichang Wang, Dongsheng Chen, Zhiqi Huang |
| 2024 | COLING | Towards Multi-modal Sarcasm Detection via Disentangled Multi-grained Multi-modal Distilling. | Zhihong Zhu, Xuxin Cheng, Guimin Hu, Yaowei Li, Zhiqi Huang, Yuexian Zou |
| 2024 | COLING | Alignment before Awareness: Towards Visual Question Localized-Answering in Robotic Surgery via Optimal Transport and Answer Semantics. | Zhihong Zhu, Yunyan Zhang, Xuxin Cheng, Zhiqi Huang, Derong Xu, Xian Wu, Yefeng Zheng |
| 2024 | ECCV | KDProR: A Knowledge-Decoupling Probabilistic Framework for Video-Text Retrieval. | Xianwei Zhuang, Hongxiang Li, Xuxin Cheng, Zhihong Zhu, Yuxin Xie, Yuexian Zou |
| 2024 | EMNLP | Relevance Is a Guiding Light: Relevance-aware Adaptive Learning for End-to-end Task-oriented Dialogue System. | Zhanpeng Chen, Zhihong Zhu, Wanshi Xu, Xianwei Zhuang, Yuexian Zou |
| 2024 | EMNLP | Dual-oriented Disentangled Network with Counterfactual Intervention for Multimodal Intent Detection. | Zhanpeng Chen, Zhihong Zhu, Xianwei Zhuang, Zhiqi Huang, Yuexian Zou |
| 2024 | EMNLP | UniMEEC: Towards Unified Multimodal Emotion Recognition and Emotion Cause. | Guimin Hu, Zhihong Zhu, Daniel Hershcovich, Lijie Hu, Hasti Seifi, Jiayuan Xie |
| 2024 | EMNLP | LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference. | Zhongwei Wan, Ziang Wu, Che Liu, Jinfa Huang, Zhihong Zhu, Peng Jin, Longyue Wang, Li Yuan |
| 2024 | EMNLP | Learning to Match Representations is Better for End-to-End Task-Oriented Dialog System. | Wanshi Xu, Xuxin Cheng, Zhihong Zhu, Zhanpeng Chen, Yuexian Zou |
| 2024 | EMNLP | What are the Generator Preferences for End-to-end Task-Oriented Dialog System? | Wanshi Xu, Xianwei Zhuang, Zhanpeng Chen, Zhihong Zhu, Xuxin Cheng, Yuexian Zou |
| 2024 | EMNLP | Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decoding. | Derong Xu, Ziheng Zhang, Zhihong Zhu, Zhenxi Lin, Qidong Liu, Xian Wu, Tong Xu, Xiangyu Zhao, Yefeng Zheng, Enhong Chen |
| 2024 | EMNLP | Game on Tree: Visual Hallucination Mitigation via Coarse-to-Fine View Tree and Game Theory. | Xianwei Zhuang, Zhihong Zhu, Zhanpeng Chen, Yuxin Xie, Liming Liang, Yuexian Zou |
| 2024 | EMNLP | DGLF: A Dual Graph-based Learning Framework for Multi-modal Sarcasm Detection. | Zhihong Zhu, Kefan Shen, Zhaorun Chen, Yunyan Zhang, Yuyan Chen, Xiaoqi Jiao, Zhongwei Wan, Shaorong Xie, Wei Liu, Xian Wu, Yefeng Zheng |
| 2024 | ICASSP | KC-Prompt: End-To-End Knowledge-Complementary Prompting for Rehearsal-Free Continual Learning. | Yaowei Li, Yating Liu, Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Bang Yang, Zhiqi Huang |
| 2024 | IJCAI | TFCD: Towards Multi-modal Sarcasm Detection via Training-Free Counterfactual Debiasing. | Zhihong Zhu, Xianwei Zhuang, Yunyan Zhang, Derong Xu, Guimin Hu, Xian Wu, Yefeng Zheng |
| 2024 | Interspeech | GPA: Global and Prototype Alignment for Audio-Text Retrieval. | Yuxin Xie, Zhihong Zhu, Xianwei Zhuang, Liming Liang, Zhichang Wang, Yuexian Zou |
| 2024 | Interspeech | DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval. | Yifei Xin, Xuxin Cheng, Zhihong Zhu, Xusheng Yang, Yuexian Zou |
| 2024 | Interspeech | Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation. | Yifei Xin, Zhihong Zhu, Xuxin Cheng, Xusheng Yang, Yuexian Zou |
| 2024 | MICCAI | Textual Inversion and Self-supervised Refinement for Radiology Report Generation. | Yuanjiang Luo, Hongxiang Li, Xuan Wu, Meng Cao, Xiaoshuang Huang, Zhihong Zhu, Peixi Liao, Hu Chen, Yi Zhang |
| 2024 | MICCAI | Multivariate Cooperative Game for Image-Report Pairs: Hierarchical Semantic Alignment for Medical Report Generation. | Zhihong Zhu, Xuxin Cheng, Yunyan Zhang, Zhaorun Chen, Qingqing Long, Hongxiang Li, Zhiqi Huang, Xian Wu, Yefeng Zheng |
| 2024 | NAACL | AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition. | Zhaorun Chen, Zhuokai Zhao, Zhihong Zhu, Ruiqi Zhang, Xiang Li, Bhiksha Raj, Huaxiu Yao |
| 2024 | WSDM | Dance with Labels: Dual-Heterogeneous Label Graph Interaction for Multi-intent Spoken Language Understanding. | Zhihong Zhu, Xuxin Cheng, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2023 | ACL | ML-LMCL: Mutual Learning and Large-Margin Contrastive Learning for Improving ASR Robustness in Spoken Language Understanding. | Xuxin Cheng, Bowen Cao, Qichen Ye, Zhihong Zhu, Hongxiang Li, Yuexian Zou |
| 2023 | ACL | Towards Unified Spoken Language Understanding Decoding via Label-aware Compact Linguistics Representations. | Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Dongsheng Chen, Yuexian Zou |
| 2023 | CIKM | Towards Spoken Language Understanding via Multi-level Multi-grained Contrastive Learning. | Xuxin Cheng, Wanshi Xu, Zhihong Zhu, Hongxiang Li, Yuexian Zou |
| 2023 | CIKM | DAS-CL: Towards Multimodal Machine Translation via Dual-Level Asymmetric Contrastive Learning. | Xuxin Cheng, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | CSCWD | TLAG: An Informative Trigger and Label-Aware Knowledge Guided Model for Dialogue-based Relation Extraction. | Hao An, Dongsheng Chen, Weiyuan Xu, Zhihong Zhu, Yuexian Zou |
| 2023 | EMNLP | MRRL: Modifying the Reference via Reinforcement Learning for Non-Autoregressive Joint Multiple Intent Detection and Slot Filling. | Xuxin Cheng, Zhihong Zhu, Bowen Cao, Qichen Ye, Yuexian Zou |
| 2023 | EMNLP | Accelerating Multiple Intent Detection and Slot Filling via Targeted Knowledge Distillation. | Xuxin Cheng, Zhihong Zhu, Wanshi Xu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | EMNLP | MCLF: A Multi-grained Contrastive Learning Framework for ASR-robust Spoken Language Understanding. | Zhiqi Huang, Dongsheng Chen, Zhihong Zhu, Xuxin Cheng |
| 2023 | EMNLP | Syntax Matters: Towards Spoken Language Understanding via Syntax-Aware Attention. | Yifeng Xie, Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Dongsheng Chen |
| 2023 | EMNLP | Enhancing Code-Switching for Cross-lingual SLU: A Unified View of Semantic and Grammatical Coherence. | Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Dongsheng Chen, Yuexian Zou |
| 2023 | ICA3PP | A Grouping-Based Multi-task Scheduling Strategy with Deadline Constraint on Heterogeneous Edge Computing. | Xiaoyong Tang, Wenbiao Cao, Tan Deng, Chao Xu, Zhihong Zhu |
| 2023 | ICASSP | SSVMR: Saliency-Based Self-Training for Video-Music Retrieval. | Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2023 | ICASSP | Improving Retrieval-Based Dialogue System Via Syntax-Informed Attention. | Tengtao Song, Nuo Chen, Ji Jiang, Zhihong Zhu, Yuexian Zou |
| 2023 | ICASSP | A Dynamic Graph Interactive Framework with Label-Semantic Injection for Spoken Language Understanding. | Zhihong Zhu, Weiyuan Xu, Xuxin Cheng, Tengtao Song, Yuexian Zou |
| 2023 | ICCV | G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory. | Hongxiang Li, Meng Cao, Xuxin Cheng, Yaowei Li, Zhihong Zhu, Yuexian Zou |
| 2023 | ICCV | Unify, Align and Refine: Multi-Level Semantic Alignment for Radiology Report Generation. | Yaowei Li, Bang Yang, Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Yuexian Zou |
| 2023 | Interspeech | C²A-SLU: Cross and Contrastive Attention for Improving ASR Robustness in Spoken Language Understanding. | Xuxin Cheng, Ziyu Yao, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | Interspeech | FC-MTLF: A Fine- and Coarse-grained Multi-Task Learning Framework for Cross-Lingual Spoken Language Understanding. | Xuxin Cheng, Wanshi Xu, Ziyu Yao, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | Interspeech | GhostT5: Generate More Features with Cheap Operations to Improve Textless Spoken Question Answering. | Xuxin Cheng, Zhihong Zhu, Ziyu Yao, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2023 | Interspeech | Mix before Align: Towards Zero-shot Cross-lingual Sentiment Analysis via Soft-Mix and Multi-View Learning. | Zhihong Zhu, Xuxin Cheng, Dongsheng Chen, Zhiqi Huang, Hongxiang Li, Yuexian Zou |
| 2022 | UIC | An Improved LightGBM Job Running Status Prediction Algorithm Integrating Combinatorial Feature Selection and Bayesian Hyperparameter Optimization on Spark. | Xiaoyong Tang, Cheng Shi, Wenzheng Liu, Zhihong Zhu |