| 2025 | ICASSP | Speech Separation for Low-Resource Languages. | Marvin Borsdorf, Zexu Pan, Pascal Himmelmann, Haizhou Li, Tanja Schultz |
| 2025 | ICASSP | Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction. | Cunhang Fan, Youdian Gao, Zexu Pan, Jingjing Zhang, Hongyu Zhang, Jie Zhang, Zhao Lv |
| 2025 | ICASSP | SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG. | Cunhang Fan, Sheng Zhang, Jingjing Zhang, Zexu Pan, Zhao Lv |
| 2025 | ICASSP | HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution. | Shengkui Zhao, Kun Zhou, Zexu Pan, Yukun Ma, Chong Zhang, Bin Ma |
| 2025 | ICASSP | Conditional Latent Diffusion-Based Speech Enhancement via Dual Context Learning. | Shengkui Zhao, Zexu Pan, Kun Zhou, Yukun Ma, Chong Zhang, Bin Ma |
| 2025 | IJCAI | M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction. | Cunhang Fan, Ying Chen, Jian Zhou, Zexu Pan, Jingjing Zhang, Youdian Gao, Xiaoke Yang, Zhengqi Wen, Zhao Lv |
| 2025 | Interspeech | Online Audio-Visual Autoregressive Speaker Extraction. | Zexu Pan, Wupeng Wang, Shengkui Zhao, Chong Zhang, Kun Zhou, Yukun Ma, Bin Ma |
| 2025 | Interspeech | Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction. | Zexu Pan, Shengkui Zhao, Tingting Wang, Kun Zhou, Yukun Ma, Chong Zhang, Bin Ma |
| 2025 | Interspeech | ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment. | Shengkui Zhao, Zexu Pan, Bin Ma |
| 2024 | AAAI | Restoring Speaking Lips from Occlusion for Audio-Visual Speech Recognition. | Jiadong Wang, Zexu Pan, Malu Zhang, Robby T. Tan, Haizhou Li |
| 2024 | ICASSP | Generation or Replication: Auscultating Audio Latent Diffusion Models. | Dimitrios Bralios, Gordon Wichern, Franois G. Germain, Zexu Pan, Sameer Khurana, Chiori Hori, Jonathan Le Roux |
| 2024 | ICASSP | LOCSELECT: Target Speaker Localization with an Auditory Selective Hearing Mechanism. | Yu Chen, Xinyuan Qian, Zexu Pan, Kainan Chen, Haizhou Li |
| 2024 | ICASSP | Audio-Visual Active Speaker Extraction for Sparsely Overlapped Multi-Talker Speech. | Junjie Li, Ruijie Tao, Zexu Pan, Meng Ge, Shuai Wang, Haizhou Li |
| 2024 | ICASSP | NIIRF: Neural IIR Filter Field for HRTF Upsampling and Personalization. | Yoshiki Masuyama, Gordon Wichern, Franois G. Germain, Zexu Pan, Sameer Khurana, Chiori Hori, Jonathan Le Roux |
| 2024 | ICASSP | NeuroHeed+: Improving Neuro-Steered Speaker Extraction with Joint Auditory Attention Detection. | Zexu Pan, Gordon Wichern, Franois G. Germain, Sameer Khurana, Jonathan Le Roux |
| 2024 | ICASSP | Late Audio-Visual Fusion for in-the-Wild Speaker Diarization. | Zexu Pan, Gordon Wichern, Franois G. Germain, Aswin Shanmugam Subramanian, Jonathan Le Roux |
| 2024 | ICASSP | GLMB 3D Speaker Tracking with Video-Assisted Multi-Channel Audio Optimization Functions. | Xinyuan Qian, Zexu Pan, Qiquan Zhang, Kainan Chen, Shoufeng Lin |
| 2024 | Interspeech | wTIMIT2mix: A Cocktail Party Mixtures Database to Study Target Speaker Extraction for Normal and Whispered Speech. | Marvin Borsdorf, Zexu Pan, Haizhou Li, Tanja Schultz |
| 2024 | Interspeech | PARIS: Pseudo-AutoRegressIve Siamese Training for Online Speech Separation. | Zexu Pan, Gordon Wichern, Franois G. Germain, Kohei Saijo, Jonathan Le Roux |
| 2024 | Interspeech | Enhanced Reverberation as Supervision for Unsupervised Speech Separation. | Kohei Saijo, Gordon Wichern, Franois G. Germain, Zexu Pan, Jonathan Le Roux |
| 2023 | ASRU | Scenario-Aware Audio-Visual TF-Gridnet for Target Speech Extraction. | Zexu Pan, Gordon Wichern, Yoshiki Masuyama, Franois G. Germain, Sameer Khurana, Chiori Hori, Jonathan Le Roux |
| 2023 | ICASSP | ImagineNet: Target Speaker Extraction with Intermittent Visual Cue Through Embedding Inpainting. | Zexu Pan, Wupeng Wang, Marvin Borsdorf, Haizhou Li |
| 2023 | Interspeech | Target Active Speaker Detection with Audio-visual Cues. | Yidi Jiang, Ruijie Tao, Zexu Pan, Haizhou Li |
| 2023 | Interspeech | Rethinking the Visual Cues in Audio-Visual Speaker Extraction. | Junjie Li, Meng Ge, Zexu Pan, Rui Cao, Longbiao Wang, Jianwu Dang, Shiliang Zhang |
| 2023 | Interspeech | Speaker Extraction with Detection of Presence and Absence of Target Speakers. | Ke Zhang, Marvin Borsdorf, Zexu Pan, Haizhou Li, Yangjie Wei, Yi Wang |
| 2022 | Interspeech | VCSE: Time-Domain Visual-Contextual Speaker Extraction Network. | Junjie Li, Meng Ge, Zexu Pan, Longbiao Wang, Jianwu Dang |
| 2022 | Interspeech | A Hybrid Continuity Loss to Reduce Over-Suppression for Time-domain Target Speaker Extraction. | Zexu Pan, Meng Ge, Haizhou Li |
| 2021 | ICASSP | Muse: Multi-Modal Target Speaker Extraction with Visual Cues. | Zexu Pan, Ruijie Tao, Chenglin Xu, Haizhou Li |
| 2021 | ICASSP | Multi-Target DoA Estimation with an Audio-Visual Fusion Mechanism. | Xinyuan Qian, Maulik C. Madhavi, Zexu Pan, Jiadong Wang, Haizhou Li |
| 2020 | Interspeech | Multi-Modal Attention for Speech Emotion Recognition. | Zexu Pan, Zhaojie Luo, Jichen Yang, Haizhou Li |