| 2024 | ICASSP | Joint Music and Language Attention Models for Zero-Shot Music Tagging. | Xingjian Du, Zhesong Yu, Jiaju Lin, Bilei Zhu, Qiuqiang Kong |
| 2024 | ICASSP | ByteHum: Fast and Accurate Query-by-Humming in the Wild. | Xingjian Du, Pei Zou, Mingyu Liu, Xia Liang, Minghang Chu, Bilei Zhu |
| 2024 | Interspeech | MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning. | Hang Zhao, Yifei Xin, Zhesong Yu, Bilei Zhu, Lu Lu, Zejun Ma |
| 2023 | ICASSP | Bytecover3: Accurate Cover Song Identification On Short Queries. | Xingjian Du, Zijie Wang, Xia Liang, Huidong Liang, Bilei Zhu, Zejun Ma |
| 2022 | AAAI | Zero-Shot Audio Source Separation through Query-Based Learning from Weakly-Labeled Data. | Ke Chen, Xingjian Du, Bilei Zhu, Zejun Ma, Taylor Berg-Kirkpatrick, Shlomo Dubnov |
| 2022 | ICASSP | HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection. | Ke Chen, Xingjian Du, Bilei Zhu, Zejun Ma, Taylor Berg-Kirkpatrick, Shlomo Dubnov |
| 2022 | ICASSP | Bytecover2: Towards Dimensionality Reduction of Latent Embedding for Efficient Cover Song Identification. | Xingjian Du, Ke Chen, Zijie Wang, Bilei Zhu, Zejun Ma |
| 2022 | ICASSP | S3T: Self-Supervised Pre-Training with Swin Transformer For Music Classification. | Hang Zhao, Chen Zhang, Bilei Zhu, Zejun Ma, Kejun Zhang |
| 2021 | ICASSP | Bytecover: Cover Song Identification Via Multi-Loss Training. | Xingjian Du, Zhesong Yu, Bilei Zhu, Xiaoou Chen, Zejun Ma |
| 2021 | ICASSP | Singing Melody Extraction from Polyphonic Music based on Spectral Correlation Modeling. | Xingjian Du, Bilei Zhu, Qiuqiang Kong, Zejun Ma |
| 2021 | ICASSP | An Hrnet-Blstm Model With Two-Stage Training For Singing Melody Extraction. | Yongwei Gao, Xingjian Du, Bilei Zhu, Xiaoheng Sun, Wei Li, Zejun Ma |
| 2021 | ICASSP | Rule-Embedded Network for Audio-Visual Voice Activity Detection in Live Musical Video Streams. | Yuanbo Hou, Yi Deng, Bilei Zhu, Zejun Ma, Dick Botteldooren |
| 2021 | Interspeech | Attention-Based Cross-Modal Fusion for Audio-Visual Voice Activity Detection in Musical Video Streams. | Yuanbo Hou, Zhesong Yu, Xia Liang, Xingjian Du, Bilei Zhu, Zejun Ma, Dick Botteldooren |
| 2019 | ICASSP | Vocal Melody Extraction via DNN-based Pitch Estimation and Salience-based Pitch Refinement. | Yongwei Gao, Bilei Zhu, Wei Li, Ke Li, Yongjian Wu, Feiyue Huang |
| 2017 | ICASSP | Fusing transcription results from polyphonic and monophonic audio for singing melody transcription in polyphonic music. | Bilei Zhu, Fuzhang Wu, Ke Li, Yongjian Wu, Feiyue Huang, Yunsheng Wu |
| 2015 | ICASSP | Latent time-frequency component analysis: A novel pitch-based approach for singing voice separation. | Xiu Zhang, Wei Li, Bilei Zhu |