| 2026 | AAAI | USE: A Unified Model for Universal Sound Separation and Extraction. | Hongyu Wang, Chenda Li, Xin Zhou, Shuai Wang, Yanmin Qian |
| 2026 | ACL | A Data-Centric Approach to Generalizable Speech Deepfake Detection. | Wen Huang, Yuchen Mao, Yanmin Qian |
| 2026 | ACL | Beyond Sentence-level Labels: Integrating Conversational Context and Personal Experience for Natural Emotional Expression. | Haiyang Sun, Chenyang Le, Wei Wang, Leying Zhang, Chuang Li, Bing Han, Chenda Li, Mengxiao Bi, Yanmin Qian |
| 2025 | ACL | SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods. | Wen Huang, Yanmei Gu, Zhiming Wang, Huijia Zhu, Yanmin Qian |
| 2025 | ASRU | Less is More: Data Curation Matters in Scaling Speech Enhancement. | Chenda Li, Wangyou Zhang, Wei Wang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Yihui Fu, Marvin Sach, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis. | Kaicheng Luo, Xuefei Gong, Yutao Sun, Jinling He, Yujie Hou, Xiaoyang Xing, Huiyan Li, Bing Han, Yanmin Qian |
| 2025 | ASRU | OOQ: Outlier-Oriented Quantization for Efficient Large Language Models. | Haoyu Wang, Bei Liu, Hang Shao, Bo Xiao, Ke Zeng, Guanglu Wan, Yanmin Qian |
| 2025 | ASRU | URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition. | Jiahe Wang, Chenda Li, Wei Wang, Wangyou Zhang, Samuele Cornell, Marvin Sach, Robin Scheibler, Kohei Saijo, Yihui Fu, Zhaoheng Ni, Anurag Kumar, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment. | Wei Wang, Wangyou Zhang, Chenda Li, Jaitong Shi, Shinji Watanabe, Yanmin Qian |
| 2025 | ASRU | Advancing Controllable Music Generation with Latent Rectified Flow Guided by Rhythm and Harmony. | Haibin Yu, Jiayi Zhou, Wei Wang, Zhiming Wang, Huijia Zhu, Yanmin Qian |
| 2025 | ICASSP | Generalizable Audio Deepfake Detection via Latent Space Refinement and Augmentation. | Wen Huang, Yanmei Gu, Zhiming Wang, Huijia Zhu, Yanmin Qian |
| 2025 | ICASSP | Advancing Non-intrusive Suppression on Enhancement Distortion for Noise Robust ASR. | Wei Wang, Siyi Zhao, Yanmin Qian |
| 2025 | ICASSP | Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching for Speaker Diarization. | Zhengyang Chen, Bing Han, Shuai Wang, Yidi Jiang, Yanmin Qian |
| 2025 | ICASSP | Efficient Pruning for Large-Scale Seq2Seq Speech Models without Back-Propagation. | Tianteng Gu, Bei Liu, Yanmin Qian |
| 2025 | ICASSP | Data-Efficient Low-Complexity Acoustic Scene Classification via Distilling and Progressive Pruning. | Bing Han, Wen Huang, Zhengyang Chen, Anbai Jiang, Pingyi Fan, Cheng Lu, Zhiqiang Lv, Jia Liu, Wei-Qiang Zhang, Yanmin Qian |
| 2025 | ICASSP | SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation. | Haitian Lu, Gaofeng Cheng, Liuping Luo, Leying Zhang, Yanmin Qian, Pengyuan Zhang |
| 2025 | ICASSP | Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction. | Leying Zhang, Wangyou Zhang, Zhengyang Chen, Yanmin Qian |
| 2025 | Interspeech | BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM. | Xun Gong, Anqi Lv, Wangyou Zhang, Zhiming Wang, Huijia Zhu, Yanmin Qian |
| 2025 | Interspeech | Ultra-Low Bit Post-Training Quantization of Large Speech Models via K-Means Clustering and Mixed Precision Allocation. | Tianteng Gu, Bei Liu, Haoyu Wang, Yanmin Qian |
| 2025 | Interspeech | Ranking and Selection of Bias Words for Contextual Bias Speech Recognition. | Haoxiang Hou, Xun Gong, Wangyou Zhang, Wei Wang, Yanmin Qian |
| 2025 | Interspeech | From Sharpness to Better Generalization for Speech Deepfake Detection. | Wen Huang, Xuechen Liu, Xin Wang, Junichi Yamagishi, Yanmin Qian |
| 2025 | Interspeech | Novel Parasitic Dual-Scale Modeling for Efficient and Accurate Multilingual Speech Translation. | Chenyang Le, Yinfeng Xia, Huiyan Li, Manhong Wang, Yutao Sun, Xingyang Ma, Yanmin Qian |
| 2025 | Interspeech | Efficient Multilingual ASR Finetuning via LoRA Language Experts. | Jiahong Li, Yiwen Shao, Jianheng Zhuo, Chenda Li, Liliang Tang, Dong Yu, Yanmin Qian |
| 2025 | Interspeech | E2E-BPVC: End-to-End Background-Preserving Voice Conversion via In-Context Learning. | Yihan Liu, Zhengyang Chen, Leying Zhang, Yanmin Qian |
| 2025 | Interspeech | MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition. | Yinfeng Xia, Huiyan Li, Chenyang Le, Manhong Wang, Yutao Sun, Xingyang Ma, Yanmin Qian |
| 2025 | Interspeech | Lessons Learned from the URGENT 2024 Speech Enhancement Challenge. | Wangyou Zhang, Kohei Saijo, Samuele Cornell, Robin Scheibler, Chenda Li, Zhaoheng Ni, Anurag Kumar, Marvin Sach, Wei Wang, Yihui Fu, Shinji Watanabe, Tim Fingscheidt, Yanmin Qian |
| 2025 | Interspeech | Lightweight Front-end Enhancement for Robust ASR via Frame Resampling and Sub-Band Pruning. | Siyi Zhao, Wei Wang, Yanmin Qian |
| 2024 | ICASSP | Exploring Large Scale Pre-Trained Models for Robust Machine Anomalous Sound Detection. | Bing Han, Zhiqiang Lv, Anbai Jiang, Wen Huang, Zhengyang Chen, Yufeng Deng, Jiawei Ding, Cheng Lu, Wei-Qiang Zhang, Pingyi Fan, Jia Liu, Yanmin Qian |
| 2024 | ICASSP | Robust Cross-Domain Speaker Verification with Multi-Level Domain Adapters. | Wen Huang, Bing Han, Shuai Wang, Zhengyang Chen, Yanmin Qian |
| 2024 | ICASSP | Prompt-Driven Target Speech Diarization. | Yidi Jiang, Zhengyang Chen, Ruijie Tao, Liqun Deng, Yanmin Qian, Haizhou Li |
| 2024 | ICASSP | One-Shot Sensitivity-Aware Mixed Sparsity Pruning for Large Language Models. | Hang Shao, Bei Liu, Yanmin Qian |
| 2024 | ICASSP | Leveraging in-the-wild Data for Effective Self-supervised Pretraining in Speaker Recognition. | Shuai Wang, Qibing Bai, Qi Liu, Jianwei Yu, Zhengyang Chen, Bing Han, Yanmin Qian, Haizhou Li |
| 2024 | ICASSP | Generation-Based Target Speech Extraction with Speech Discretization and Vocoder. | Linfeng Yu, Wangyou Zhang, Chenpeng Du, Leying Zhang, Zheng Liang, Yanmin Qian |
| 2024 | ICASSP | Improving Design of Input Condition Invariant Speech Enhancement. | Wangyou Zhang, Jee-weon Jung, Yanmin Qian |
| 2024 | IJCAI | InstructME: An Instruction Guided Music Edit Framework with Latent Diffusion Models. | Bing Han, Junyu Dai, Weituo Hao, Xinyan He, Dong Guo, Jitong Chen, Yuxuan Wang, Yanmin Qian, Xuchen Song |
| 2024 | Interspeech | Contextual Biasing Speech Recognition in Speech-enhanced Large Language Model. | Xun Gong, Anqi Lv, Zhiming Wang, Yanmin Qian |
| 2024 | Interspeech | Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems. | Zhengyang Chen, Xuechen Liu, Erica Cooper, Junichi Yamagishi, Yanmin Qian |
| 2024 | Interspeech | SparseWAV: Fast and Accurate One-Shot Unstructured Pruning for Large Speech Foundation Models. | Tianteng Gu, Bei Liu, Hang Shao, Yanmin Qian |
| 2024 | Interspeech | AnoPatch: Towards Better Consistency in Machine Anomalous Sound Detection. | Anbai Jiang, Bing Han, Zhiqiang Lv, Yufeng Deng, Wei-Qiang Zhang, Xie Chen, Yanmin Qian, Jia Liu, Pingyi Fan |
| 2024 | Interspeech | WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction. | Shuai Wang, Ke Zhang, Shaoxiong Lin, Junjie Li, Xuefei Wang, Meng Ge, Jianwei Yu, Yanmin Qian, Haizhou Li |
| 2024 | Interspeech | Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement. | Wangyou Zhang, Kohei Saijo, Jee-weon Jung, Chenda Li, Shinji Watanabe, Yanmin Qian |
| 2024 | Interspeech | URGENT Challenge: Universality, Robustness, and Generalizability For Speech Enhancement. | Wangyou Zhang, Robin Scheibler, Kohei Saijo, Samuele Cornell, Chenda Li, Zhaoheng Ni, Jan Pirklbauer, Marvin Sach, Shinji Watanabe, Tim Fingscheidt, Yanmin Qian |
| 2023 | ASRU | Efficient Text-Only Domain Adaptation For CTC-Based ASR. | Chang Chen, Xun Gong, Yanmin Qian |
| 2023 | ASRU | The Second Multi-Channel Multi-Party Meeting Transcription Challenge (M2MeT 2.0): A Benchmark for Speaker-Attributed ASR. | Yuhao Liang, Mohan Shi, Fan Yu, Yangze Li, Shiliang Zhang, Zhihao Du, Qian Chen, Lei Xie, Yanmin Qian, Jian Wu, Zhuo Chen, Kong Aik Lee, Zhijie Yan, Hui Bu |
| 2023 | ASRU | Improving Speech Enhancement Using Audio Tagging Knowledge From Pre-Trained Representations and Multi-Task Learning. | Shaoxiong Lin, Chao Zhang, Yanmin Qian |
| 2023 | ASRU | FAT-HuBERT: Front-End Adaptive Training of Hidden-Unit BERT For Distortion-Invariant Robust Speech Recognition. | Dongning Yang, Wei Wang, Yanmin Qian |
| 2023 | ASRU | Toward Universal Speech Enhancement For Diverse Input Conditions. | Wangyou Zhang, Kohei Saijo, Zhong-Qiu Wang, Shinji Watanabe, Yanmin Qian |
| 2023 | ASRU | Exploring Time-Frequency Domain Target Speaker Extraction For Causal and Non-Causal Processing. | Wangyou Zhang, Lei Yang, Yanmin Qian |
| 2023 | ICASSP | LongFNT: Long-Form Speech Recognition with Factorized Neural Transducer. | Xun Gong, Yu Wu, Jinyu Li, Shujie Liu, Rui Zhao, Xie Chen, Yanmin Qian |
| 2023 | ICASSP | Factorized AED: Factorized Attention-Based Encoder-Decoder for Text-Only Domain Adaptive ASR. | Xun Gong, Wei Wang, Hang Shao, Xie Chen, Yanmin Qian |
| 2023 | ICASSP | Exploring Binary Classification Loss for Speaker Verification. | Bing Han, Zhengyang Chen, Yanmin Qian |
| 2023 | ICASSP | Improving Dino-Based Self-Supervised Speaker Verification with Progressive Cluster-Aware Training. | Bing Han, Wen Huang, Zhengyang Chen, Yanmin Qian |
| 2023 | ICASSP | Robust Audio-Visual ASR with Unified Cross-Modal Attention. | Jiahong Li, Chenda Li, Yifei Wu, Yanmin Qian |
| 2023 | ICASSP | Target Sound Extraction with Variable Cross-Modality Clues. | Chenda Li, Yao Qian, Zhuo Chen, Dongmei Wang, Takuya Yoshioka, Shujie Liu, Yanmin Qian, Michael Zeng |
| 2023 | ICASSP | Multi-Speaker End-to-End Multi-Modal Speaker Diarization System for the MISP 2022 Challenge. | Tao Liu, Zhengyang Chen, Yanmin Qian, Kai Yu |
| 2023 | ICASSP | Predictive Skim: Contrastive Predictive Coding for Low-Latency Online Speech Separation. | Chenda Li, Yifei Wu, Yanmin Qian |
| 2023 | ICASSP | Joint Discriminator and Transfer Based Fast Domain Adaptation For End-To-End Speech Recognition. | Hang Shao, Tian Tan, Wei Wang, Xun Gong, Yanmin Qian |
| 2023 | ICASSP | Lowbit Neural Network Quantization for Speaker Verification. | Haoyu Wang, Bei Liu, Yifei Wu, Zhengyang Chen, Yanmin Qian |
| 2023 | ICASSP | Wespeaker: A Research and Production Oriented Speaker Embedding Learning Toolkit. | Hongji Wang, Chengdong Liang, Shuai Wang, Zhengyang Chen, Binbin Zhang, Xu Xiang, Yanlei Deng, Yanmin Qian |
| 2023 | ICASSP | HuBERT-AGG: Aggregated Representation Distillation of Hidden-Unit Bert for Robust Speech Recognition. | Wei Wang, Yanmin Qian |
| 2023 | ICASSP | Light-Weight Visualvoice: Neural Network Quantization On Audio Visual Speech Separation. | Yifei Wu, Chenda Li, Yanmin Qian |
| 2023 | ICASSP | Code-Switching Text Generation and Injection in Mandarin-English ASR. | Haibin Yu, Yuxuan Hu, Yao Qian, Ma Jin, Linquan Liu, Shujie Liu, Yu Shi, Yanmin Qian, Edward Lin, Michael Zeng |
| 2023 | ICASSP | Adaptive Large Margin Fine-Tuning For Robust Speaker Verification. | Leying Zhang, Zhengyang Chen, Yanmin Qian |
| 2023 | Interspeech | Attention-based Encoder-Decoder Network for End-to-End Neural Speaker Diarization with Target Speaker Attractor. | Zhengyang Chen, Bing Han, Shuai Wang, Yanmin Qian |
| 2023 | Interspeech | Build a SRE Challenge System: Lessons from VoxSRC 2022 and CNSRC 2022. | Zhengyang Chen, Bing Han, Xu Xiang, Houjun Huang, Bei Liu, Yanmin Qian |
| 2023 | Interspeech | Adapting Multi-Lingual ASR Models for Handling Multiple Talkers. | Chenda Li, Yao Qian, Zhuo Chen, Naoyuki Kanda, Dongmei Wang, Takuya Yoshioka, Yanmin Qian, Michael Zeng |
| 2023 | Interspeech | Reversible Neural Networks for Memory-Efficient Speaker Verification. | Bei Liu, Yanmin Qian |
| 2023 | Interspeech | ECAPA++: Fine-grained Deep Embedding Learning for TDNN Based Speaker Verification. | Bei Liu, Yanmin Qian |
| 2023 | Interspeech | Extremely Low Bit Quantization for Mobile Speaker Verification Systems Under 1MB Memory. | Bei Liu, Haoyu Wang, Yanmin Qian |
| 2023 | Interspeech | Text Only Domain Adaptation with Phoneme Guided Data Splicing for End-to-End Speech Recognition. | Wei Wang, Xun Gong, Hang Shao, Dongning Yang, Yanmin Qian |
| 2023 | Interspeech | Adaptive Neural Network Quantization For Lightweight Speaker Verification. | Haoyu Wang, Bei Liu, Yifei Wu, Yanmin Qian |
| 2023 | Interspeech | UniSplice: Universal Cross-Lingual Data Splicing for Low-Resource ASR. | Wei Wang, Yanmin Qian |
| 2023 | Interspeech | Overlap Aware Continuous Speech Separation without Permutation Invariant Training. | Linfeng Yu, Wangyou Zhang, Chenda Li, Yanmin Qian |
| 2023 | Interspeech | Weakly-Supervised Speech Pre-training: A Case Study on Target Speech Recognition. | Wangyou Zhang, Yanmin Qian |
| 2023 | Interspeech | Fast and Efficient Multilingual Self-Supervised Pre-training for Low-Resource Speech Recognition. | Zhilong Zhang, Wei Wang, Yanmin Qian |
| 2022 | ICASSP | Large-Scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification. | Zhengyang Chen, Sanyuan Chen, Yu Wu, Yao Qian, Chengyi Wang, Shujie Liu, Yanmin Qian, Michael Zeng |
| 2022 | ICASSP | MLP-SVNET: A Multi-Layer Perceptrons Based Network for Speaker Verification. | Bing Han, Zhengyang Chen, Bei Liu, Yanmin Qian |
| 2022 | ICASSP | Local Information Modeling with Self-Attention for Speaker Verification. | Bing Han, Zhengyang Chen, Yanmin Qian |
| 2022 | ICASSP | Self-Knowledge Distillation via Feature Enhancement for Speaker Verification. | Bei Liu, Haoyu Wang, Zhengyang Chen, Shuai Wang, Yanmin Qian |
| 2022 | ICASSP | Skim: Skipping Memory Lstm for Low-Latency Real-Time Continuous Speech Separation. | Chenda Li, Lei Yang, Weiqin Wang, Yanmin Qian |
| 2022 | ICASSP | The Sjtu System For Multimodal Information Based Speech Processing Challenge 2021. | Wei Wang, Xun Gong, Yifei Wu, Zhikai Zhou, Chenda Li, Wangyou Zhang, Bing Han, Yanmin Qian |
| 2022 | ICASSP | Optimizing Alignment of Speech and Language Latent Spaces for End-To-End Speech Recognition and Understanding. | Wei Wang, Shuo Ren, Yao Qian, Shujie Liu, Yu Shi, Yanmin Qian, Michael Zeng |
| 2022 | ICASSP | Time-Domain Audio-Visual Speech Separation on Low Quality Videos. | Yifei Wu, Chenda Li, Jinfeng Bai, Zhongqin Wu, Yanmin Qian |
| 2022 | ICASSP | Summary on the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Grand Challenge. | Fan Yu, Shiliang Zhang, Pengcheng Guo, Yihui Fu, Zhihao Du, Siqi Zheng, Weilong Huang, Lei Xie, Zheng-Hua Tan, DeLiang Wang, Yanmin Qian, Kong Aik Lee, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu |
| 2022 | ICASSP | Punctuation Prediction for Streaming On-Device Speech Recognition. | Zhikai Zhou, Tian Tan, Yanmin Qian |
| 2022 | ICASSP | Exploring Effective Data Utilization for Low-Resource Speech Recognition. | Zhikai Zhou, Wei Wang, Wangyou Zhang, Yanmin Qian |
| 2022 | Interspeech | Knowledge Transfer and Distillation from Autoregressive to Non-Autoregessive Speech Recognition. | Xun Gong, Zhikai Zhou, Yanmin Qian |
| 2022 | Interspeech | Self-Supervised Speaker Verification Using Dynamic Loss-Gate and Label Correction. | Bing Han, Zhengyang Chen, Yanmin Qian |
| 2022 | Interspeech | MSDWild: Multi-modal Speaker Diarization Dataset in the Wild. | Tao Liu, Shuai Fan, Xu Xiang, Hongbo Song, Shaoxiong Lin, Jiaqi Sun, Tianyuan Han, Siyuan Chen, Binwei Yao, Sen Liu, Yifei Wu, Yanmin Qian, Kai Yu |
| 2022 | Interspeech | Attentive Feature Fusion for Robust Speaker Verification. | Bei Liu, Zhengyang Chen, Yanmin Qian |
| 2022 | Interspeech | Dual Path Embedding Learning for Speaker Verification with Triplet Attention. | Bei Liu, Zhengyang Chen, Yanmin Qian |
| 2022 | Interspeech | DF-ResNet: Boosting Speaker Verification Performance with Depth-First Design. | Bei Liu, Zhengyang Chen, Shuai Wang, Haoyu Wang, Bing Han, Yanmin Qian |
| 2022 | Interspeech | ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding. | Yen-Ju Lu, Xuankai Chang, Chenda Li, Wangyou Zhang, Samuele Cornell, Zhaoheng Ni, Yoshiki Masuyama, Brian Yan, Robin Scheibler, Zhong-Qiu Wang, Yu Tsao, Yanmin Qian, Shinji Watanabe |
| 2022 | Interspeech | Separating Long-Form Speech with Group-wise Permutation Invariant Training. | Wangyou Zhang, Zhuo Chen, Naoyuki Kanda, Shujie Liu, Jinyu Li, Sefik Emre Eskimez, Takuya Yoshioka, Xiong Xiao, Zhong Meng, Yanmin Qian, Furu Wei |
| 2022 | Interspeech | Enroll-Aware Attentive Statistics Pooling for Target Speaker Verification. | Leying Zhang, Zhengyang Chen, Yanmin Qian |
| 2021 | ICASSP | AISpeech-SJTU ASR System for the Accented English Speech Recognition Challenge. | Tian Tan, Yizhou Lu, Rao Ma, Sen Zhu, Jiaqi Guo, Yanmin Qian |
| 2021 | ICASSP | Convolutive Transfer Function Invariant SDR Training Criteria for Multi-Channel Reverberant Speech Separation. | Christoph Bddeker, Wangyou Zhang, Tomohiro Nakatani, Keisuke Kinoshita, Tsubasa Ochiai, Marc Delcroix, Naoyuki Kamo, Yanmin Qian, Reinhold Haeb-Umbach |
| 2021 | ICASSP | Self-Supervised Learning Based Domain Adaptation for Robust Speaker Verification. | Zhengyang Chen, Shuai Wang, Yanmin Qian |
| 2021 | ICASSP | SynAug: Synthesis-Based Data Augmentation for Text-Dependent Speaker Verification. | Chenpeng Du, Bing Han, Shuai Wang, Yanmin Qian, Kai Yu |
| 2021 | ICASSP | AISpeech-SJTU Accent Identification System for the Accented English Speech Recognition Challenge. | Houjun Huang, Xu Xiang, Yexin Yang, Rao Ma, Yanmin Qian |
| 2021 | ICASSP | Unit Selection Synthesis Based Data Augmentation for Fixed Phrase Speaker Verification. | Houjun Huang, Xu Xiang, Fei Zhao, Shuai Wang, Yanmin Qian |
| 2021 | ICASSP | Dual-Path Modeling for Long Recording Speech Separation in Meetings. | Chenda Li, Zhuo Chen, Yi Luo, Cong Han, Tianyan Zhou, Keisuke Kinoshita, Marc Delcroix, Shinji Watanabe, Yanmin Qian |
| 2021 | ICASSP | The Accented English Speech Recognition Challenge 2020: Open Datasets, Tracks, Baselines, Results and Methods. | Xian Shi, Fan Yu, Yizhou Lu, Yuhao Liang, Qiangze Feng, Daliang Wang, Yanmin Qian, Lei Xie |
| 2021 | ICASSP | Towards Data Selection on TTS Data for Children's Speech Recognition. | Wei Wang, Zhikai Zhou, Yizhou Lu, Hongji Wang, Chenpeng Du, Yanmin Qian |
| 2021 | ICASSP | End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend. | Wangyou Zhang, Christoph Bddeker, Shinji Watanabe, Tomohiro Nakatani, Marc Delcroix, Keisuke Kinoshita, Tsubasa Ochiai, Naoyuki Kamo, Reinhold Haeb-Umbach, Yanmin Qian |
| 2021 | Interspeech | Layer-Wise Fast Adaptation for End-to-End Multi-Accent Speech Recognition. | Xun Gong, Yizhou Lu, Zhikai Zhou, Yanmin Qian |
| 2021 | Interspeech | The SJTU System for Short-Duration Speaker Verification Challenge 2021. | Bing Han, Zhengyang Chen, Zhikai Zhou, Yanmin Qian |
| 2021 | Interspeech | Basis-MelGAN: Efficient Neural Vocoder Based on Audio Decomposition. | Zhengxi Liu, Yanmin Qian |
| 2021 | Interspeech | Audio-Visual Multi-Talker Speech Recognition in a Cocktail Party. | Yifei Wu, Chenda Li, Song Yang, Zhongqin Wu, Yanmin Qian |
| 2021 | Interspeech | Knowledge Distillation from Multi-Modality to Single-Modality for Person Verification. | Leying Zhang, Zhengyang Chen, Yanmin Qian |
| 2020 | ICASSP | End-To-End Multi-Speaker Speech Recognition With Transformer. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2020 | ICASSP | Channel Invariant Speaker Embedding Learning with Joint Multi-Task and Adversarial Training. | Zhengyang Chen, Shuai Wang, Yanmin Qian, Kai Yu |
| 2020 | ICASSP | Deep Audio-Visual Speech Separation with Attention Mechanism. | Chenda Li, Yanmin Qian |
| 2020 | ICASSP | Text Adaptation for Speaker Verification with Speaker-Text Factorized Embeddings. | Yexin Yang, Shuai Wang, Xun Gong, Yanmin Qian, Kai Yu |
| 2020 | Interspeech | Multi-Modality Matters: A Performance Leap on VoxCeleb. | Zhengyang Chen, Shuai Wang, Yanmin Qian |
| 2020 | Interspeech | Adversarial Domain Adaptation for Speaker Verification Using Partially Shared Network. | Zhengyang Chen, Shuai Wang, Yanmin Qian |
| 2020 | Interspeech | Listen, Watch and Understand at the Cocktail Party: Audio-Visual-Contextual Speech Separation. | Chenda Li, Yanmin Qian |
| 2020 | Interspeech | Bi-Encoder Transformer Network for Mandarin-English Code-Switching Speech Recognition Using Mixture of Experts. | Yizhou Lu, Mingkun Huang, Hao Li, Jiaqi Guo, Yanmin Qian |
| 2020 | Interspeech | Dual-Adversarial Domain Adaptation for Generalized Replay Attack Detection. | Hongji Wang, Heinrich Dinkel, Shuai Wang, Yanmin Qian, Kai Yu |
| 2020 | Interspeech | Learning Contextual Language Embeddings for Monaural Multi-Talker Speech Recognition. | Wangyou Zhang, Yanmin Qian |
| 2020 | Interspeech | End-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming. | Wangyou Zhang, Aswin Shanmugam Subramanian, Xuankai Chang, Shinji Watanabe, Yanmin Qian |
| 2019 | ASRU | MIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2019 | ASRU | Exploring Model Units and Training Strategies for End-to-End Speech Recognition. | Mingkun Huang, Yizhou Lu, Lan Wang, Yanmin Qian, Kai Yu |
| 2019 | ASRU | GANs for Children: A Generative Data Augmentation Strategy for Children Speech Recognition. | Peiyao Sheng, Zhuolin Yang, Yanmin Qian |
| 2019 | ASRU | End-to-End Overlapped Speech Detection and Speaker Counting with Raw Waveform. | Wangyou Zhang, Man Sun, Lan Wang, Yanmin Qian |
| 2019 | ICASSP | End-to-end Monaural Multi-speaker ASR System without Pretraining. | Xuankai Chang, Yanmin Qian, Kai Yu, Shinji Watanabe |
| 2019 | ICASSP | Knowledge Distillation for Small Foot-print Deep Speaker Embedding. | Shuai Wang, Yexin Yang, Tianzhe Wang, Yanmin Qian, Kai Yu |
| 2019 | Interspeech | Joint Decoding of CTC Based Systems for Speech Recognition. | Jiaqi Guo, Yongbin You, Yanmin Qian, Kai Yu |
| 2019 | Interspeech | Prosody Usage Optimization for Children Speech Recognition with Zero Resource Children Speech. | Chenda Li, Yanmin Qian |
| 2019 | Interspeech | Cross-Domain Replay Spoofing Attack Detection Using Domain Adversarial Training. | Hongji Wang, Heinrich Dinkel, Shuai Wang, Yanmin Qian, Kai Yu |
| 2019 | Interspeech | On the Usage of Phonetic Information for Text-Independent Speaker Embedding Extraction. | Shuai Wang, Johan Rohdin, Luks Burget, Oldrich Plchot, Yanmin Qian, Kai Yu, Jan Cernock |
| 2019 | Interspeech | Data Augmentation Using Variational Autoencoder for Embedding Based Speaker Verification. | Zhanghao Wu, Shuai Wang, Yanmin Qian, Kai Yu |
| 2019 | Interspeech | The SJTU Robust Anti-Spoofing System for the ASVspoof 2019 Challenge. | Yexin Yang, Hongji Wang, Heinrich Dinkel, Zhengyang Chen, Shuai Wang, Yanmin Qian, Kai Yu |
| 2019 | Interspeech | Knowledge Distillation for End-to-End Monaural Multi-Talker ASR System. | Wangyou Zhang, Xuankai Chang, Yanmin Qian |
| 2019 | Interspeech | Robust DOA Estimation Based on Convolutional Neural Network and Time-Frequency Masking. | Wangyou Zhang, Ying Zhou, Yanmin Qian |
| 2018 | ICASSP | Knowledge Transfer in Permutation Invariant Training for Single-Channel Multi-Talker Speech Recognition. | Tian Tan, Yanmin Qian, Dong Yu |
| 2018 | ICASSP | Adaptive Permutation Invariant Training with Auxiliary Information for Monaural Multi-Talker Speech Recognition. | Xuankai Chang, Yanmin Qian, Dong Yu |
| 2018 | ICASSP | Fast Adaptation on Deepmixture Generative Network Based Acoustic Modeling. | Wen Ding, Tian Tan, Yanmin Qian |
| 2018 | ICASSP | Generative Adversarial Networks Based Data Augmentation for Noise Robust Speech Recognition. | Hu Hu, Tian Tan, Yanmin Qian |
| 2018 | ICASSP | Joint I-Vector with End-to-End System for Short Duration Text-Independent Speaker Verification. | Zili Huang, Shuai Wang, Yanmin Qian |
| 2018 | ICASSP | Noise Robust Speech Recognition on Aurora4 by Humans and Machines. | Yanmin Qian, Tian Tan, Hu Hu, Qi Liu |
| 2018 | ICASSP | Focal Kl-Divergence Based Dilated Convolutional Neural Networks for Co-Channel Speaker Identification. | Shuai Wang, Yanmin Qian, Kai Yu |
| 2018 | ICASSP | Robust Mask Estimation By Integrating Neural Network-Based and Clustering-Based Approaches for Adaptive Acoustic Beamforming. | Ying Zhou, Yanmin Qian |
| 2018 | Interspeech | Monaural Multi-Talker Speech Recognition with Attention Mechanism and Gated Convolutional Networks. | Xuankai Chang, Yanmin Qian, Dong Yu |
| 2018 | Interspeech | Permutation Invariant Training of Generative Adversarial Network for Monaural Speech Separation. | Lianwu Chen, Meng Yu, Yanmin Qian, Dan Su, Dong Yu |
| 2018 | Interspeech | Knowledge Distillation for Sequence Model. | Mingkun Huang, Yongbin You, Zhehuai Chen, Yanmin Qian, Kai Yu |
| 2018 | Interspeech | Deep Extractor Network for Target Speaker Recovery from Single Channel Speech Mixtures. | Jun Wang, Jie Chen, Dan Su, Lianwu Chen, Meng Yu, Yanmin Qian, Dong Yu |
| 2017 | ASRU | Future vector enhanced LSTM language model for LVCSR. | Qi Liu, Yanmin Qian, Kai Yu |
| 2017 | ICASSP | End-to-end spoofing detection with raw waveform CLDNNS. | Heinrich Dinkel, Nanxin Chen, Yanmin Qian, Kai Yu |
| 2017 | IJCNN | Small-footprint convolutional neural network for spoofing detection. | Heinrich Dinkel, Yanmin Qian, Kai Yu |
| 2017 | Interspeech | What Does the Speaker Embedding Encode? | Shuai Wang, Yanmin Qian, Kai Yu |
| 2017 | Interspeech | Binary Deep Neural Networks for Speech Recognition. | Xu Xiang, Yanmin Qian, Kai Yu |
| 2017 | Interspeech | Recognizing Multi-Talker Speech with Permutation Invariant Training. | Dong Yu, Xuankai Chang, Yanmin Qian |
| 2016 | ICASSP | Joint acoustic factor learning for robust deep neural network based automatic speech recognition. | Souvik Kundu, Gautam Mantena, Yanmin Qian, Tian Tan, Marc Delcroix, Khe Chai Sim |
| 2016 | ICASSP | An investigation into using parallel data for far-field speech recognition. | Yanmin Qian, Tian Tan, Dong Yu |
| 2016 | ICASSP | Integrated adaptation with multi-factor joint-learning for far-field speech recognition. | Yanmin Qian, Tian Tan, Dong Yu, Yu Zhang |
| 2016 | ICASSP | Speaker-aware training of LSTM-RNNS for acoustic modelling. | Tian Tan, Yanmin Qian, Dong Yu, Souvik Kundu, Liang Lu, Khe Chai Sim, Xiong Xiao, Yu Zhang |
| 2016 | ICASSP | Improved DNN-based segmentation for multi-genre broadcast audio. | Linlin Wang, Chao Zhang, Philip C. Woodland, Mark J. F. Gales, Panagiota Karanasou, Pierre Lanchantin, Xunying Liu, Yanmin Qian |
| 2016 | Interspeech | Unrestricted Vocabulary Keyword Spotting Using LSTM-CTC. | Yimeng Zhuang, Xuankai Chang, Yanmin Qian, Kai Yu |
| 2015 | ASRU | Speaker diarisation and longitudinal linking in multi-genre broadcast data. | Penny Karanasou, Mark J. F. Gales, Pierre Lanchantin, Xunying Liu, Yanmin Qian, Linlin Wang, Philip C. Woodland, Chao Zhang |
| 2015 | ASRU | The development of the cambridge university alignment systems for the multi-genre broadcast challenge. | Pierre Lanchantin, Mark J. F. Gales, Penny Karanasou, Xunying Liu, Yanmin Qian, Linlin Wang, Philip C. Woodland, Chao Zhang |
| 2015 | ASRU | Multi-task joint-learning of deep neural networks for robust speech recognition. | Yanmin Qian, Maofan Yin, Yongbin You, Kai Yu |
| 2015 | ASRU | Cambridge university transcription systems for the multi-genre broadcast challenge. | Philip C. Woodland, Xunying Liu, Yanmin Qian, Chao Zhang, Mark J. F. Gales, Penny Karanasou, Pierre Lanchantin, Linlin Wang |
| 2015 | ICASSP | A novel static parameter calculation method for model compensation. | Suliang Bu, Yunxin Zhao, Yanmin Qian, Kai Yu |
| 2015 | ICASSP | Recurrent neural network language model with structured word embeddings for speech recognition. | Tianxing He, Xu Xiang, Yanmin Qian, Kai Yu |
| 2015 | ICASSP | Cluster adaptive training for deep neural network. | Tian Tan, Yanmin Qian, Maofan Yin, Yimeng Zhuang, Kai Yu |
| 2015 | IJCNN | Automatic model redundancy reduction for fast back-propagation for deep neural networks in speech recognition. | Yanmin Qian, Tianxing He, Wei Deng, Kai Yu |
| 2015 | Interspeech | Very deep convolutional neural networks for LVCSR. | Mengxiao Bi, Yanmin Qian, Kai Yu |
| 2015 | Interspeech | Robust deep feature for spoofing detection - the SJTU system for ASVspoof 2015 challenge. | Nanxin Chen, Yanmin Qian, Heinrich Dinkel, Bo Chen, Kai Yu |
| 2015 | Interspeech | Multi-task learning for text-dependent speaker verification. | Nanxin Chen, Yanmin Qian, Kai Yu |
| 2015 | Interspeech | Paragraph vector based topic model for language model adaptation. | Wengong Jin, Tianxing He, Yanmin Qian, Kai Yu |
| 2014 | ICASSP | Second order vector taylor series based robust speech recognition. | Suliang Bu, Yanmin Qian, Khe Chai Sim, Yongbin You, Kai Yu |
| 2014 | ICASSP | Stochastic data sweeping for fast DNN training. | Wei Deng, Yanmin Qian, Yuchen Fan, Tianfan Fu, Kai Yu |
| 2014 | ICASSP | Reshaping deep neural network for fast decoding by node-pruning. | Tianxing He, Yuchen Fan, Yanmin Qian, Tian Tan, Kai Yu |
| 2014 | IJCNN | Speaker verification with deep features. | Yuan Liu, Tianfan Fu, Yuchen Fan, Yanmin Qian, Kai Yu |
| 2014 | Interspeech | A novel dynamic parameters calculation approach for model compensation. | Suliang Bu, Yanmin Qian, Kai Yu |
| 2014 | Interspeech | Tandem deep features for text-dependent speaker verification. | Tianfan Fu, Yanmin Qian, Yuan Liu, Kai Yu |
| 2013 | ASRU | Combination of data borrowing strategies for low-resource LVCSR. | Yanmin Qian, Kai Yu, Jia Liu |
| 2013 | Interspeech | MLP-HMM two-stage unsupervised training for low-resource languages on conversational telephone speech recognition. | Yanmin Qian, Jia Liu |
| 2012 | ICASSP | Generating exact lattices in the WFST framework. | Daniel Povey, Mirko Hannemann, Gilles Boulianne, Luks Burget, Arnab Ghoshal, Milos Janda, Martin Karafit, Stefan Kombrink, Petr Motlcek, Yanmin Qian, Korbinian Riedhammer, Karel Vesel, Ngoc Thang Vu |
| 2012 | Interspeech | Cross-Lingual and Ensemble MLPs Strategies for Low-Resource Speech Recognition. | Yanmin Qian, Jia Liu |
| 2012 | Interspeech | Articulatory Feature based Multilingual MLPs for Low-Resource Speech Recognition. | Yanmin Qian, Jia Liu |
| 2011 | ASRU | Strategies for using MLP based features with limited target-language training data. | Yanmin Qian, Ji Xu, Daniel Povey, Jia Liu |
| 2011 | Interspeech | State-Level Data Borrowing for Low-Resource Speech Recognition Based on Subspace GMMs. | Yanmin Qian, Daniel Povey, Jia Liu |
| 2010 | ICASSP | Phone modeling and combining discriminative training for mandarinenglish bilingual speech recognition. | Yanmin Qian, Jia Liu |