| 2025 | AAAI | Bridge Diffusion Model: Bridge Chinese Text-to-Image Diffusion Model with English Communities. | Shanyuan Liu, Bo Cheng, Yuhang Ma, Liebucha Wu, Ao Ma, Xiaoyu Wu, Dawei Leng, Yuhui Yin |
| 2025 | AAAI | IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities. | Bin Wang, Chunyu Xie, Dawei Leng, Yuhui Yin |
| 2025 | ICCV | PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models. | Runze He, Bo Cheng, Yuhang Ma, Qingxiang Jia, Shanyuan Liu, Ao Ma, Xiaoyu Wu, Liebucha Wu, Dawei Leng, Yuhui Yin |
| 2025 | ICCV | LMM-Det: Make Large Multimodal Models Excel in Object Detection. | Jincheng Li, Chunyu Xie, Ji Ao, Dawei Leng, Yuhui Yin |
| 2025 | ICLR | Prompt as Knowledge Bank: Boost Vision-language model via Structural Representation for zero-shot medical detection. | Yuguang Yang, Tongfei Chen, Haoyu Huang, Linlin Yang, Chunyu Xie, Dawei Leng, Xianbin Cao, Baochang Zhang |
| 2025 | ICLR | PT-T2I/V: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Image/Video-Task. | Jing Wang, Ao Ma, Jiasong Feng, Dawei Leng, Yuhui Yin, Xiaodan Liang |
| 2025 | ICML | FG-CLIP: Fine-Grained Visual and Textual Alignment. | Chunyu Xie, Bin Wang, Fanjing Kong, Jincheng Li, Dawei Liang, Gengshen Zhang, Dawei Leng, Yuhui Yin |
| 2016 | ICFHR | Random Projected Convolutional Feature for Scene Text Recognition. | Rui Wu, Shuli Yang, Dawei Leng, Zhenbo Luo, Yunhong Wang |