| 2025 | AAAI | Leveraging Large Vision-Language Model as User Intent-Aware Encoder for Composed Image Retrieval. | Zelong Sun, Dong Jing, Guoxing Yang, Nanyi Fei, Zhiwu Lu |
| 2024 | ICASSP | DIFFSC: Semantic Communication Framework With Enhanced Denoising Through Diffusion Probabilistic Models. | Zeyu Jiang, Xiaohong Liu, Guoxing Yang, Weizhi Li, Aini Li, Guangyu Wang |
| 2024 | ICASSP | Image Retrieval with Composed Query by Multi-Scale Multi-Modal Fusion. | Zelong Sun, Guoxing Yang, Zhiwu Lu, Hao Jiang, Guojie Zhu, Zhao Cao |
| 2024 | ICASSP | Progressive Image Synthesis from Semantics to Details with Denoising Diffusion GAN. | Guoxing Yang, Haoyu Lu, Chongxuan Li, Guang Zhou, Haoran Wu, Zhiwu Lu |
| 2024 | ICLR | UniAdapter: Unified Parameter-Efficient Transfer Learning for Cross-modal Modeling. | Haoyu Lu, Yuqi Huo, Guoxing Yang, Zhiwu Lu, Wei Zhan, Masayoshi Tomizuka, Mingyu Ding |
| 2024 | ICLR | VDT: General-purpose Video Diffusion Transformers via Mask Modeling. | Haoyu Lu, Guoxing Yang, Nanyi Fei, Yuqi Huo, Zhiwu Lu, Ping Luo, Mingyu Ding |
| 2023 | ADMA | Song-to-Video Translation: Writing a Video from Song Lyrics Based on Multimodal Pre-training. | Feifei Fu, Zelong Sun, Guoxing Yang, Xiaolong He, Zhiwu Lu |
| 2022 | COLING | Visual Prompt Tuning for Few-Shot Text Classification. | Jingyuan Wen, Yutian Luo, Nanyi Fei, Guoxing Yang, Zhiwu Lu, Hao Jiang, Jie Jiang, Zhao Cao |
| 2021 | CVPR | L2M-GAN: Learning To Manipulate Latent Space Semantics for Facial Attribute Editing. | Guoxing Yang, Nanyi Fei, Mingyu Ding, Guangzhen Liu, Zhiwu Lu, Tao Xiang |