| 2025 | EMNLP | VocalNet: Speech LLMs with Multi-Token Prediction for Faster and High-Quality Generation. | Yuhao Wang, Heyang Liu, Ziyang Cheng, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang |
| 2025 | Interspeech | SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant. | Yixuan Hou, Heyang Liu, Yuhao Wang, Ziyang Cheng, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang |
| 2024 | ACL | M³AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset. | Zhe Chen, Heyang Liu, Wenyi Yu, Guangzhi Sun, Hongcheng Liu, Ji Wu, Chao Zhang, Yu Wang, Yanfeng Wang |
| 2024 | ACL | MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception. | Yuhao Wang, Yusheng Liao, Heyang Liu, Hongcheng Liu, Yanfeng Wang, Yu Wang |
| 2024 | COLING | Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview. | Heyang Liu, Yanfeng Wang, Yu Wang |
| 2024 | Interspeech | Towards an End-to-End Framework for Invasive Brain Signal Decoding with Large Language Models. | Sheng Feng, Heyang Liu, Yu Wang, Yanfeng Wang |