| 2026 | ACL | Efficient Training for Cross-lingual Speech Language Models. | Yan Zhou, Qingkai Fang, Yun Hong, Yang Feng |
| 2025 | ACL | LLaMA-Omni 2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis. | Qingkai Fang, Yan Zhou, Shoutao Guo, Shaolei Zhang, Yang Feng |
| 2025 | ICLR | LLaMA-Omni: Seamless Speech Interaction with Large Language Models. | Qingkai Fang, Shoutao Guo, Yan Zhou, Zhengrui Ma, Shaolei Zhang, Yang Feng |
| 2025 | ICLR | LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token. | Shaolei Zhang, Qingkai Fang, Zhe Yang, Yang Feng |
| 2024 | ACL | CTC-based Non-autoregressive Textless Speech-to-Speech Translation. | Qingkai Fang, Zhengrui Ma, Yan Zhou, Min Zhang, Yang Feng |
| 2024 | ACL | Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data? | Qingkai Fang, Shaolei Zhang, Zhengrui Ma, Min Zhang, Yang Feng |
| 2024 | ACL | A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Any Translation. | Zhengrui Ma, Qingkai Fang, Shaolei Zhang, Shoutao Guo, Yang Feng, Min Zhang |
| 2024 | ACL | StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning. | Shaolei Zhang, Qingkai Fang, Shoutao Guo, Zhengrui Ma, Min Zhang, Yang Feng |
| 2023 | ACL | Back Translation for Speech-to-text Translation Without Transcripts. | Qingkai Fang, Yang Feng |
| 2023 | ACL | Understanding and Bridging the Modality Gap for Speech Translation. | Qingkai Fang, Yang Feng |
| 2023 | ACL | CMOT: Cross-modal Mixup via Optimal Transport for Speech Translation. | Yan Zhou, Qingkai Fang, Yang Feng |
| 2023 | EMNLP | Bridging the Gap between Synthetic and Authentic Images for Multimodal Machine Translation. | Wenyu Guo, Qingkai Fang, Dong Yu, Yang Feng |
| 2022 | ACL | Neural Machine Translation with Phrase-Level Universal Visual Representations. | Qingkai Fang, Yang Feng |
| 2022 | ACL | STEMM: Self-learning with Speech-text Manifold Mixup for Speech Translation. | Qingkai Fang, Rong Ye, Lei Li, Yang Feng, Mingxuan Wang |
| 2022 | EMNLP | Low-resource Neural Machine Translation with Cross-modal Alignment. | Zhe Yang, Qingkai Fang, Yang Feng |
| 2021 | ICDAR | Geometric Object 3D Reconstruction from Single Line Drawing Image Based on a Network for Classification and Sketch Extraction. | Zhuoying Wang, Qingkai Fang, Yongtao Wang |