| 2026 | ACL | MMSearch-R1: Incentivizing LMMs to Search. | Jinming Wu, Zihao Deng, Wei Li, Yiding Liu, Bo You, Bo Li, Zejun Ma, Ziwei Liu |
| 2025 | CVPR | LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale. | Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li, Zejun Ma, Mike Zheng Shou |
| 2025 | DASFAA | SCM: Enhancing Large Language Model with Self-Controlled Memory Framework. | Bing Wang, Xinnian Liang, Jian Yang, Hui Huang, Zhenhe Wu, Shuangzhi Wu, Zejun Ma, Zhoujun Li |
| 2025 | EMNLP | Audio-centric Video Understanding Benchmark without Text Shortcut. | Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang |
| 2025 | ICLR | LLaVA-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models. | Feng Li, Renrui Zhang, Hao Zhang, Yuanhan Zhang, Bo Li, Wei Li, Zejun Ma, Chunyuan Li |
| 2025 | ICML | Improving LLM Video Understanding with 16 Frames Per Second. | Yixuan Li, Changli Tang, Jimin Zhuang, Yudong Yang, Guangzhi Sun, Wei Li, Zejun Ma, Chao Zhang |
| 2025 | ICML | video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model. | Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun Ma, Chao Zhang |
| 2024 | ECCV | RePOSE: 3D Human Pose Estimation via Spatio-Temporal Depth Relational Consistency. | Ziming Sun, Yuan Liang, Zejun Ma, Tianle Zhang, Linchao Bao, Guiqing Li, Shengfeng He |
| 2024 | ICASSP | SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR. | Zhiyun Fan, Linhao Dong, Jun Zhang, Lu Lu, Zejun Ma |
| 2024 | ICASSP | Extending Multilingual ASR to New Languages Using Supplementary Encoder and Decoder Components. | Yerbolat Khassanov, Zhipeng Chen, Tianfeng Chen, Tze Yuang Chong, Wei Li, Lu Lu, Zejun Ma |
| 2024 | ICASSP | Extending Large Language Models for Speech and Audio Captioning. | Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang |
| 2024 | ICASSP | Connecting Speech Encoder and Large Language Model for ASR. | Wenyi Yu, Changli Tang, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang |
| 2024 | ICLR | Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis. | Ziyue Jiang, Jinglin Liu, Yi Ren, Jinzheng He, Zhenhui Ye, Shengpeng Ji, Qian Yang, Chen Zhang, Pengfei Wei, Chunfeng Wang, Xiang Yin, Zejun Ma, Zhou Zhao |
| 2024 | ICLR | PolyVoice: Language Models for Speech to Speech Translation. | Qianqian Dong, Zhiying Huang, Qi Tian, Chen Xu, Tom Ko, Yunlong Zhao, Siyuan Feng, Tang Li, Kexin Wang, Xuxin Cheng, Fengpeng Yue, Ye Bai, Xi Chen, Lu Lu, Zejun Ma, Yuping Wang, Mingxuan Wang, Yuxuan Wang |
| 2024 | ICLR | SALMONN: Towards Generic Hearing Abilities for Large Language Models. | Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang |
| 2024 | ICLR | Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis. | Zhenhui Ye, Tianyun Zhong, Yi Ren, Jiaqi Yang, Weichuang Li, Jiawei Huang, Ziyue Jiang, Jinzheng He, Rongjie Huang, Jinglin Liu, Chen Zhang, Xiang Yin, Zejun Ma, Zhou Zhao |
| 2024 | ICML | video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models. | Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Yuxuan Wang, Chao Zhang |
| 2024 | Interspeech | Can Large Language Models Understand Spatial Audio? | Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Jun Zhang, Lu Lu, Zejun Ma, Yuxuan Wang, Chao Zhang |
| 2024 | Interspeech | MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning. | Hang Zhao, Yifei Xin, Zhesong Yu, Bilei Zhu, Lu Lu, Zejun Ma |
| 2023 | ACL | CIF-PT: Bridging Speech and Text Representations for Spoken Language Understanding via Continuous Integrate-and-Fire Pre-Training. | Linhao Dong, Zhecheng An, Peihao Wu, Jun Zhang, Lu Lu, Zejun Ma |
| 2023 | ASRU | Improving Large-Scale Deep Biasing With Phoneme Features and Text-Only Data in Streaming Transducer. | Jin Qiu, Lu Huang, Boyu Li, Jun Zhang, Lu Lu, Zejun Ma |
| 2023 | ICASSP | Bytecover3: Accurate Cover Song Identification On Short Queries. | Xingjian Du, Zijie Wang, Xia Liang, Huidong Liang, Bilei Zhu, Zejun Ma |
| 2023 | ICASSP | Leveraging Phone-Level Linguistic-Acoustic Similarity For Utterance-Level Pronunciation Scoring. | Wei Liu, Kaiqi Fu, Xiaohai Tian, Shuju Shi, Wei Li, Zejun Ma, Tan Lee |
| 2023 | ICASSP | An ASR-Free Fluency Scoring Approach with Self-Supervised Learning. | Wei Liu, Kaiqi Fu, Xiaohai Tian, Shuju Shi, Wei Li, Zejun Ma, Tan Lee |
| 2023 | ICASSP | Internal Language Model Estimation Based Adaptive Language Model Fusion for Domain Adaptation. | Rao Ma, Xiaobo Wu, Jin Qiu, Yanan Qin, Haihua Xu, Peihao Wu, Zejun Ma |
| 2023 | ICASSP | LiteG2P: A Fast, Light and High Accuracy Model for Grapheme-to-Phoneme Conversion. | Chunfeng Wang, Peisong Huang, Yuxiang Zou, Haoyu Zhang, Shichao Liu, Xiang Yin, Zejun Ma |
| 2023 | ICCV | Virtual Try-On with Pose-Garment Keypoints Guided Inpainting. | Zhi Li, Pengfei Wei, Xiang Yin, Zejun Ma, Alex C. Kot |
| 2023 | IJCAI | AudioQR: Deep Neural Audio Watermarks For QR Code. | Xinghua Qu, Xiang Yin, Pengfei Wei, Lu Lu, Zejun Ma |
| 2023 | Interspeech | Improving Frame-level Classifier for Word Timings with Non-peaky CTC in End-to-End Automatic Speech Recognition. | Xianzhao Chen, Yist Y. Lin, Kang Wang, Yi He, Zejun Ma |
| 2023 | Interspeech | Knowledge Distillation Approach for Efficient Internal Language Model Estimation. | Zhipeng Chen, Haihua Xu, Yerbolat Khassanov, Yi He, Lu Lu, Zejun Ma, Ji Wu |
| 2023 | Interspeech | GenerTTS: Pronunciation Disentanglement for Timbre and Style Generalization in Cross-Lingual Text-to-Speech. | Yahuan Cong, Haoyu Zhang, Haopeng Lin, Shichao Liu, Chunfeng Wang, Yi Ren, Xiang Yin, Zejun Ma |
| 2023 | Interspeech | Language-specific Boundary Learning for Improving Mandarin-English Code-switching Speech Recognition. | Zhiyun Fan, Linhao Dong, Chen Shen, Zhenlin Liang, Jun Zhang, Lu Lu, Zejun Ma |
| 2023 | Interspeech | Phonetic and Prosody-aware Self-supervised Learning Approach for Non-native Fluency Scoring. | Kaiqi Fu, Shaojun Gao, Shuju Shi, Xiaohai Tian, Wei Li, Zejun Ma |
| 2023 | Interspeech | Text-only Domain Adaptation using Unified Speech-Text Representation in Transducer. | Lu Huang, Boyu Li, Jun Zhang, Lu Lu, Zejun Ma |
| 2023 | Interspeech | Random Utterance Concatenation Based Data Augmentation for Improving Short-video Speech Recognition. | Yist Y. Lin, Tao Han, Haihua Xu, Van Tung Pham, Yerbolat Khassanov, Tze Yuang Chong, Yi He, Lu Lu, Zejun Ma |
| 2023 | Interspeech | Disentangling the Contribution of Non-native Speech in Automated Pronunciation Assessment. | Shuju Shi, Kaiqi Fu, Yiwei Gu, Xiaohai Tian, Shaojun Gao, Wei Li, Zejun Ma |
| 2023 | Interspeech | StyleS2ST: Zero-shot Style Transfer for Direct Speech-to-speech Translation. | Kun Song, Yi Ren, Yi Lei, Chunfeng Wang, Kun Wei, Lei Xie, Xiang Yin, Zejun Ma |
| 2023 | Interspeech | S2CD: Self-heuristic Speaker Content Disentanglement for Any-to-Any Voice Conversion. | Pengfei Wei, Xiang Yin, Chunfeng Wang, Zhonghao Li, Xinghua Qu, Zhiqiang Xu, Zejun Ma |
| 2023 | SIGIR | Towards Building Voice-based Conversational Recommender Systems: Datasets, Potential Solutions and Prospects. | Xinghua Qu, Hongyang Liu, Zhu Sun, Xiang Yin, Yew Soon Ong, Lu Lu, Zejun Ma |
| 2022 | AAAI | Zero-Shot Audio Source Separation through Query-Based Learning from Weakly-Labeled Data. | Ke Chen, Xingjian Du, Bilei Zhu, Zejun Ma, Taylor Berg-Kirkpatrick, Shlomo Dubnov |
| 2022 | CIKM | Dynamic Transfer Gaussian Process Regression. | Pengfei Wei, Xinghua Qu, Wen Song, Zejun Ma |
| 2022 | ICASSP | HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection. | Ke Chen, Xingjian Du, Bilei Zhu, Zejun Ma, Taylor Berg-Kirkpatrick, Shlomo Dubnov |
| 2022 | ICASSP | Bytecover2: Towards Dimensionality Reduction of Latent Embedding for Efficient Cover Song Identification. | Xingjian Du, Ke Chen, Zijie Wang, Bilei Zhu, Zejun Ma |
| 2022 | ICASSP | Improving End-to-End Contextual Speech Recognition with Fine-Grained Contextual Knowledge Selection. | Minglun Han, Linhao Dong, Zhenlin Liang, Meng Cai, Shiyu Zhou, Zejun Ma, Bo Xu |
| 2022 | ICASSP | Improving Pseudo-Label Training For End-To-End Speech Recognition Using Gradient Mask. | Shaoshi Ling, Chen Shen, Meng Cai, Zejun Ma |
| 2022 | ICASSP | Language Adaptive Cross-Lingual Speech Representation Learning with Sparse Sharing Sub-Networks. | Yizhou Lu, Mingkun Huang, Xinghua Qu, Pengfei Wei, Zejun Ma |
| 2022 | ICASSP | The Volcspeech System for the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge. | Chen Shen, Yi Liu, Wenzhi Fan, Bin Wang, Shixue Wen, Yao Tian, Jun Zhang, Jingsheng Yang, Zejun Ma |
| 2022 | ICASSP | Towards Using Clothes Style Transfer for Scenario-Aware Person Video Generation. | Jingning Xu, Benlai Tang, Mingjie Wang, Siyuan Bian, Wenyi Guo, Xiang Yin, Zejun Ma |
| 2022 | ICASSP | S3T: Self-Supervised Pre-Training with Swin Transformer For Music Classification. | Hang Zhao, Chen Zhang, Bilei Zhu, Zejun Ma, Kejun Zhang |
| 2022 | IJCAI | BiFSMN: Binary Neural Network for Keyword Spotting. | Haotong Qin, Xudong Ma, Yifu Ding, Xiaoyang Li, Yang Zhang, Yao Tian, Zejun Ma, Jie Luo, Xianglong Liu |
| 2022 | Interspeech | Token-level Speaker Change Detection Using Speaker Difference and Speech Content via Continuous Integrate-and-fire. | Zhiyun Fan, Zhenlin Liang, Linhao Dong, Yi Liu, Shiyu Zhou, Meng Cai, Jun Zhang, Zejun Ma, Bo Xu |
| 2022 | Interspeech | Using Fluency Representation Learned from Sequential Raw Features for Improving Non-native Fluency Scoring. | Kaiqi Fu, Shaojun Gao, Xiaohai Tian, Wei Li, Zejun Ma |
| 2022 | Interspeech | Bring dialogue-context into RNN-T for streaming ASR. | Junfeng Hou, Jinkun Chen, Wanyu Li, Yufeng Tang, Jun Zhang, Zejun Ma |
| 2022 | Interspeech | Internal Language Model Estimation Through Explicit Context Vector Learning for Attention-based Encoder-decoder ASR. | Yufei Liu, Rao Ma, Haihua Xu, Yi He, Zejun Ma, Weibin Zhang |
| 2022 | Interspeech | A Transfer and Multi-Task Learning based Approach for MOS Prediction. | Xiaohai Tian, Kaiqi Fu, Shaojun Gao, Yiwei Gu, Kai Wang, Wei Li, Zejun Ma |
| 2022 | Interspeech | Towards high-fidelity singing voice conversion with acoustic reference and contrastive predictive coding. | Chao Wang, Zhonghao Li, Benlai Tang, Xiang Yin, Yuan Wan, Yibiao Yu, Zejun Ma |
| 2022 | KDD | Importance Prioritized Policy Distillation. | Xinghua Qu, Yew Soon Ong, Abhishek Gupta, Pengfei Wei, Zhu Sun, Zejun Ma |
| 2022 | KDD | Synthesising Audio Adversarial Examples for Automatic Speech Recognition. | Xinghua Qu, Pengfei Wei, Mingyong Gao, Zhu Sun, Yew Soon Ong, Zejun Ma |
| 2022 | NAACL | Improving Contextual Representation with Gloss Regularized Pre-training. | Yu Lin, Zhecheng An, Peihao Wu, Zejun Ma |
| 2021 | ICASSP | Bytecover: Cover Song Identification Via Multi-Loss Training. | Xingjian Du, Zhesong Yu, Bilei Zhu, Xiaoou Chen, Zejun Ma |
| 2021 | ICASSP | Singing Melody Extraction from Polyphonic Music based on Spectral Correlation Modeling. | Xingjian Du, Bilei Zhu, Qiuqiang Kong, Zejun Ma |
| 2021 | ICASSP | An Hrnet-Blstm Model With Two-Stage Training For Singing Melody Extraction. | Yongwei Gao, Xingjian Du, Bilei Zhu, Xiaoheng Sun, Wei Li, Zejun Ma |
| 2021 | ICASSP | Rule-Embedded Network for Audio-Visual Voice Activity Detection in Live Musical Video Streams. | Yuanbo Hou, Yi Deng, Bilei Zhu, Zejun Ma, Dick Botteldooren |
| 2021 | ICASSP | PPG-Based Singing Voice Conversion with Adversarial Representation Learning. | Zhonghao Li, Benlai Tang, Xiang Yin, Yuan Wan, Ling Xu, Chen Shen, Zejun Ma |
| 2021 | ICASSP | A Chapter-Wise Understanding System for Text-To-Speech in Chinese Novels. | Junjie Pan, Lin Wu, Xiang Yin, Pengfei Wu, Chenchang Xu, Zejun Ma |
| 2021 | ICASSP | Improving RNN Transducer Modeling for Small-Footprint Keyword Spotting. | Yao Tian, Haitao Yao, Meng Cai, Yaming Liu, Zejun Ma |
| 2021 | Interspeech | Emitting Word Timings with HMM-Free End-to-End System in Automatic Speech Recognition. | Xianzhao Chen, Hao Ni, Yi He, Kang Wang, Zejun Ma, Zongxia Xie |
| 2021 | Interspeech | Attention-Based Cross-Modal Fusion for Audio-Visual Voice Activity Detection in Musical Video Streams. | Yuanbo Hou, Zhesong Yu, Xia Liang, Xingjian Du, Bilei Zhu, Zejun Ma, Dick Botteldooren |
| 2021 | Interspeech | HMM-Free Encoder Pre-Training for Streaming RNN Transducer. | Lu Huang, Jingyu Sun, Yufeng Tang, Junfeng Hou, Jinkun Chen, Jun Zhang, Zejun Ma |
| 2021 | Interspeech | Fine-Grained Prosody Modeling in Neural Speech Synthesis Using ToBI Representation. | Yuxiang Zou, Shichao Liu, Xiang Yin, Haopeng Lin, Chunfeng Wang, Haoyu Zhang, Zejun Ma |
| 2020 | ICASSP | A Unified Sequence-to-Sequence Front-End Model for Mandarin Text-to-Speech Synthesis. | Junjie Pan, Xiang Yin, Zhiling Zhang, Shichao Liu, Yang Zhang, Zejun Ma, Yuxuan Wang |
| 2020 | ICASSP | A Hybrid Text Normalization System Using Multi-Head Self-Attention For Mandarin. | Junhui Zhang, Junjie Pan, Xiang Yin, Chen Li, Shichao Liu, Yang Zhang, Yuxuan Wang, Zejun Ma |
| 2019 | ASRU | Learning Hierarchical Representations for Expressive Speaking Style in End-to-End Speech Synthesis. | Xiaochun An, Yuxuan Wang, Shan Yang, Zejun Ma, Lei Xie |
| 2012 | ICASSP | Unsupervised training of subspace gaussian mixture models for conversational telephone speech recognition. | Zejun Ma, Xiaorui Wang, Bo Xu |
| 2011 | Interspeech | An Empirical Study of Multilingual Spoken Term Detection. | Zejun Ma, Xiaorui Wang, Bo Xu |
| 2011 | Interspeech | Fusing Multiple Confidence Measures for Chinese Spoken Term Detection. | Zejun Ma, Xiaorui Wang, Bo Xu |