| 2025 | ASRU | Pitch-Assistant Harmonic Recovery for Efficient Speech Enhancement. | Biao Liu, Zengqiang Shang, Haoyuan Xie, Mou Wang, Xin Liu, Pengyuan Zhang |
| 2025 | ICASSP | SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation. | Haitian Lu, Gaofeng Cheng, Liuping Luo, Leying Zhang, Yanmin Qian, Pengyuan Zhang |
| 2025 | ICASSP | Debiased Training For Semi-supervised Sound Event Detection. | Shengchang Xiao, Xueshuai Zhang, Pengyuan Zhang, Yonghong Yan |
| 2025 | Interspeech | Restoring Harmonics: Enhancing Speech Quality with Deep Mask and Harmonic Restoration Network. | Yu Zhao, Zengqiang Shang, Mou Wang, Xin Liu, Pengyuan Zhang |
| 2024 | ICANN | Make Audio Solely Drive Lip in Talking Face Video Synthesis. | Xing Bai, Jun Zhou, Pengyuan Zhang, Ruipeng Hao |
| 2024 | ICASSP | Snore Sound Features Based on Percussive Enhancing and Positional Encoding Combined with Multi-Task Learning for Osahs Detection. | Aolin Hu, Xueshuai Zhang, Shaoxing Zhang, Pengyuan Zhang, Yu Lu, Pengfei Ye, Qingwei Zhao, Yonghong Yan |
| 2024 | ICASSP | One-Class Knowledge Distillation for Spoofing Speech Detection. | Jingze Lu, Yuxiang Zhang, Wenchao Wang, Zengqiang Shang, Pengyuan Zhang |
| 2024 | ICASSP | One-Epoch Training with Single Test Sample in Test Time for Better Generalization of Cough-Based Covid-19 Detection Model. | Jiakun Shen, Xueshuai Zhang, Pengyuan Zhang, Yonghong Yan, Qingwei Zhao, Ta Li, Yanfen Tang, Shaoxing Zhang |
| 2024 | ICASSP | Improving Short Utterance Anti-Spoofing with Aasist2. | Yuxiang Zhang, Jingze Lu, Zengqiang Shang, Wenchao Wang, Pengyuan Zhang |
| 2024 | Interspeech | Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder. | Xuyuan Li, Zengqiang Shang, Peiyang Shi, Hua Hua, Ta Li, Pengyuan Zhang |
| 2024 | Interspeech | Improving Copy-Synthesis Anti-Spoofing Training Method with Rhythm and Speaker Perturbation. | Jingze Lu, Yuxiang Zhang, Zhuo Li, Zengqiang Shang, Wenchao Wang, Pengyuan Zhang |
| 2023 | ICASSP | Piecewise Position Encoding in Convolutional Neural Network for Cough-Based Covid-19 Detection. | Jiakun Shen, Xueshuai Zhang, Pengyuan Zhang, Yonghong Yan, Shaoxing Zhang, Zhihua Huang, Yanfen Tang, Yu Wang, Fujie Zhang, Aijun Sun |
| 2023 | ICASSP | Multi-Dimensional Frequency Dynamic Convolution with Confident Mean Teacher for Sound Event Detection. | Shengchang Xiao, Xueshuai Zhang, Pengyuan Zhang |
| 2023 | ICASSP | PCF: ECAPA-TDNN with Progressive Channel Fusion for Speaker Verification. | Zhenduo Zhao, Zhuo Li, Wenchao Wang, Pengyuan Zhang |
| 2022 | ICASSP | DPT-FSNet: Dual-Path Transformer Based Full-Band and Sub-Band Fusion Network for Speech Enhancement. | Feng Dang, Hangting Chen, Pengyuan Zhang |
| 2022 | ICASSP | Improving CTC-Based Speech Recognition Via Knowledge Transferring from Pre-Trained Language Models. | Keqi Deng, Songjun Cao, Yike Zhang, Long Ma, Gaofeng Cheng, Ji Xu, Pengyuan Zhang |
| 2022 | ICASSP | Improving Non-Autoregressive End-to-End Speech Recognition with Pre-Trained Acoustic and Language Models. | Keqi Deng, Zehui Yang, Shinji Watanabe, Yosuke Higuchi, Gaofeng Cheng, Pengyuan Zhang |
| 2022 | Interspeech | Interrelate Training and Searching: A Unified Online Clustering Framework for Speaker Diarization. | Yifan Chen, Yifan Guo, Qingxuan Li, Gaofeng Cheng, Pengyuan Zhang, Yonghong Yan |
| 2022 | Interspeech | Beam-Guided TasNet: An Iterative Speech Separation Framework with Multi-Channel Output. | Hangting Chen, Yi Yang, Feng Dang, Pengyuan Zhang |
| 2022 | Interspeech | CTA-RNN: Channel and Temporal-wise Attention RNN leveraging Pre-trained ASR Embeddings for Speech Emotion Recognition. | Chengxin Chen, Pengyuan Zhang |
| 2022 | Interspeech | NAS-SCAE: Searching Compact Attention-based Encoders For End-to-end Automatic Speech Recognition. | Yukun Liu, Ta Li, Pengyuan Zhang, Yonghong Yan |
| 2022 | Interspeech | Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset. | Zehui Yang, Yifan Chen, Lei Luo, Runyan Yang, Lingxuan Ye, Gaofeng Cheng, Ji Xu, Yaohui Jin, Qingqing Zhang, Pengyuan Zhang, Lei Xie, Yonghong Yan |
| 2022 | Interspeech | Improving Recognition of Out-of-vocabulary Words in E2E Code-switching ASR by Fusing Speech Generation Methods. | Lingxuan Ye, Gaofeng Cheng, Runyan Yang, Zehui Yang, Sanli Tian, Pengyuan Zhang, Yonghong Yan |
| 2022 | Interspeech | SASV Based on Pre-trained ASV System and Integrated Scoring Module. | Yuxiang Zhang, Zhuo Li, Wenchao Wang, Pengyuan Zhang |
| 2022 | Interspeech | Robust Cough Feature Extraction and Classification Method for COVID-19 Cough Detection Based on Vocalization Characteristics. | Xueshuai Zhang, Jiakun Shen, Jun Zhou, Pengyuan Zhang, Yonghong Yan, Zhihua Huang, Yanfen Tang, Yu Wang, Fujie Zhang, Shaoxing Zhang, Aijun Sun |
| 2022 | Interspeech | Wav2vec-S: Semi-Supervised Pre-Training for Low-Resource ASR. | Han Zhu, Li Wang, Gaofeng Cheng, Jindong Wang, Pengyuan Zhang, Yonghong Yan |
| 2022 | Interspeech | Decoupled Federated Learning for ASR with Non-IID Data. | Han Zhu, Jindong Wang, Gaofeng Cheng, Pengyuan Zhang, Yonghong Yan |
| 2022 | MMM | An IBC Reference Block Enhancement Model Based on GAN for Screen Content Video Coding. | Pengjian Yang, Jun Wang, Guangyu Zhong, Pengyuan Zhang, Lai Zhang, Fan Liang, Jianxin Yang |
| 2021 | ASRU | Far-Field Speech Recognition Based on Complex-Valued Neural Networks and Inter-Frame Similarity Difference Method. | Yifan Guo, Yifan Chen, Gaofeng Cheng, Pengyuan Zhang, Yonghong Yan |
| 2021 | ICASSP | History Utterance Embedding Transformer LM for Speech Recognition. | Keqi Deng, Gaofeng Cheng, Haoran Miao, Pengyuan Zhang, Yonghong Yan |
| 2021 | ICASSP | Pre-Training Transformer Decoder for End-to-End ASR Model with Unpaired Text Data. | Changfeng Gao, Gaofeng Cheng, Runyan Yang, Han Zhu, Pengyuan Zhang, Yonghong Yan |
| 2021 | ICASSP | RNN-T Based Open-Vocabulary Keyword Spotting in Mandarin with Multi-Level Detection. | Zuozhen Liu, Ta Li, Pengyuan Zhang |
| 2021 | ICASSP | The Thinkit System for Icassp2021 M2voc Challenge. | Zengqiang Shang, Haozhe Zhang, Ziyi Chen, Bolin Zhou, Pengyuan Zhang |
| 2021 | IJCNN | Power Pooling: An Adaptive Pooling Function for Weakly Labelled Sound Event Detection. | Yuzhuo Liu, Hangting Chen, Yun Wang, Pengyuan Zhang |
| 2021 | Interspeech | TVQVC: Transformer Based Vector Quantized Variational Autoencoder with CTC Loss for Voice Conversion. | Ziyi Chen, Pengyuan Zhang |
| 2021 | Interspeech | Improved Speech Enhancement Using a Complex-Domain GAN with Fused Time-Domain and Time-Frequency Domain Constraints. | Feng Dang, Pengyuan Zhang, Hangting Chen |
| 2021 | Interspeech | Incorporating Cross-Speaker Style Transfer for Multi-Language Text-to-Speech. | Zengqiang Shang, Zhihua Huang, Haozhe Zhang, Pengyuan Zhang, Yonghong Yan |
| 2021 | Interspeech | Adaptive Margin Circle Loss for Speaker Verification. | Runqiu Xiao, Xiaoxiao Miao, Wenchao Wang, Pengyuan Zhang, Bin Cai, Liuping Luo |
| 2021 | Interspeech | LinearSpeech: Parallel Text-to-Speech with Linear Complexity. | Haozhe Zhang, Zhihua Huang, Zengqiang Shang, Pengyuan Zhang, Yonghong Yan |
| 2021 | Interspeech | The Effect of Silence and Dual-Band Fusion in Anti-Spoofing System. | Yuxiang Zhang, Wenchao Wang, Pengyuan Zhang |
| 2020 | ICASSP | CN-Celeb: A Challenging Chinese Speaker Recognition Dataset. | Yue Fan, Jiawen Kang, Lantian Li, Kaicheng Li, Haolin Chen, Sitong Cheng, Pengyuan Zhang, Ziya Zhou, Yunqi Cai, Dong Wang |
| 2020 | ICASSP | Transformer-Based Online CTC/Attention End-To-End Speech Recognition Architecture. | Haoran Miao, Gaofeng Cheng, Changfeng Gao, Pengyuan Zhang, Yonghong Yan |
| 2020 | Interspeech | Improved Guided Source Separation Integrated with a Strong Back-End for the CHiME-6 Dinner Party Scenario. | Hangting Chen, Pengyuan Zhang, Qian Shi, Zuozhen Liu |
| 2020 | Interspeech | Speaker Diarization System Based on DPCA Algorithm for Fearless Steps Challenge Phase-2. | Xueshuai Zhang, Wenchao Wang, Pengyuan Zhang |
| 2020 | Interspeech | Domain Adaptation Using Class Similarity for Robust Speech Recognition. | Han Zhu, Jiangjiang Zhao, Yuling Ren, Li Wang, Pengyuan Zhang |
| 2019 | ICASSP | An Audio Scene Classification Framework with Embedded Filters and a DCT-based Temporal Module. | Hangting Chen, Pengyuan Zhang, Yonghong Yan |
| 2019 | ICASSP | Self-attention Based Prosodic Boundary Prediction for Chinese Speech Synthesis. | Chunhui Lu, Pengyuan Zhang, Yonghong Yan |
| 2019 | Interspeech | Character-Aware Sub-Word Level Language Modeling for Uyghur and Turkish ASR. | Chang Liu, Zhen Zhang, Pengyuan Zhang, Yonghong Yan |
| 2019 | Interspeech | Target Speaker Recovery and Recognition Network with Average x-Vector and Global Training. | Wenjie Li, Pengyuan Zhang, Yonghong Yan |
| 2019 | Interspeech | Online Hybrid CTC/Attention Architecture for End-to-End Speech Recognition. | Haoran Miao, Gaofeng Cheng, Pengyuan Zhang, Ta Li, Yonghong Yan |
| 2019 | Interspeech | Speaker-Invariant Feature-Mapping for Distant Speech Recognition via Adversarial Teacher-Student Learning. | Long Wu, Hangting Chen, Li Wang, Pengyuan Zhang, Yonghong Yan |
| 2019 | Interspeech | Multi-Accent Adaptation Based on Gate Mechanism. | Han Zhu, Li Wang, Pengyuan Zhang, Yonghong Yan |
| 2019 | IWCMC | Weighted Feature Fusion Based Emotional Recognition for Variable-length Speech using DNN. | Sifan Wu, Fei Li, Pengyuan Zhang |
| 2018 | ICASSP | Improving Multichannel Speech Recognition with Generalized Cross Correlation Inputs and Multitask Learning. | Yu Zhang, Wenjie Li, Pengyuan Zhang, Yonghong Yan |
| 2018 | Interspeech | Deep Convolutional Neural Network with Scalogram for Audio Scene Modeling. | Hangting Chen, Pengyuan Zhang, Haichuan Bai, Qingsheng Yuan, Xiuguo Bao, Yonghong Yan |
| 2018 | Interspeech | Investigation on the Combination of Batch Normalization and Dropout in BLSTM-based Acoustic Modeling for ASR. | Wenjie Li, Gaofeng Cheng, Fengpei Ge, Pengyuan Zhang, Yonghong Yan |
| 2018 | Interspeech | Improving Language Modeling with an Adversarial Critic for Automatic Speech Recognition. | Yike Zhang, Pengyuan Zhang, Yonghong Yan |
| 2017 | ICNC | Fast variable-frame-rate decoding of speech recognition based on deep neural networks. | Ge Zhang, Pengyuan Zhang, Jielin Pan, Yonghong Yan |
| 2017 | ICNC | An improved lexicon generation method for mandarin speech recognition. | Yike Zhang, Pengyuan Zhang, Qingwei Zhao, Yonghong Yan, Zhenjiang Dong, Xia Jia |
| 2017 | Interspeech | Attention-Based LSTM with Multi-Task Learning for Distant Speech Recognition. | Yu Zhang, Pengyuan Zhang, Yonghong Yan |
| 2015 | ICNC | An improvement of link prediction by combining local information and betweenness. | Qi Liu, Jianping Li, Zheng Xie, Pengyuan Zhang |
| 2015 | ICNC | A bi-scale method of link prediction. | Pengyuan Zhang, Jianping Li, Qi Liu, Zheng Xie |
| 2014 | ICASSP | Using neural network front-ends on far field multiple microphones based speech recognition. | Yulan Liu, Pengyuan Zhang, Thomas Hain |
| 2007 | HCI | A Spoken Dialogue System Based on Keyword Spotting Technology. | Pengyuan Zhang, Qingwei Zhao, Yonghong Yan |
| 2007 | ICNC | Real Context Model for Tone Recognition in Mandarin Conversational Telephone Speech. | Zhaojie Liu, Jian Shao, Pengyuan Zhang, Qingwei Zhao, Yonghong Yan, Ji Feng |
| 2007 | ICNC | Keyword Spotting Based on Syllable Confusion Network. | Pengyuan Zhang, Jian Shao, Qingwei Zhao, Yonghong Yan |
| 2007 | Interspeech | A fast fuzzy keyword spotting algorithm based on syllable confusion network. | Jian Shao, Qingwei Zhao, Pengyuan Zhang, Zhaojie Liu, Yonghong Yan |