| 2026 | AAAI | Human-Centric Video Generation via Collaborative Multi-Modal Conditioning. | Liyang Chen, Tianxiang Ma, Jiawei Liu, Bingchuan Li, Zhuowei Chen, Lijie Liu, Xu He, Gen Li, Qian He, Zhiyong Wu |
| 2026 | AAAI | DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models. | Yuanyuan Wang, Dongchao Yang, Yiwen Shao, Hangting Chen, Jiankun Zhao, Zhiyong Wu, Helen Meng, Xixin Wu |
| 2026 | ACL | Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies. | Xudong Shen, Li Yuan, Ye Chen, Xin Wu, Yi Cai, Zhiyong Wu |
| 2026 | ACL | OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows. | Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong |
| 2026 | ACL | UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment. | Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Steven Y. Guo, Helen M. Meng, Xixin Wu |
| 2026 | ICDE | VIREO: Human-in-the-Loop DBMS Fuzzing with Visualization and LLM Support. | Jie Liang, Zhiyong Wu, Jingzhou Fu, Chi Zhang, Runpei Miao, Zhuo Su, Yu Jiang, Shuai Ma |
| 2025 | AAAI | MagicMan: Generative Novel View Synthesis of Humans with 3D-Aware Diffusion and Iterative Refinement. | Xu He, Zhiyong Wu, Xiaoyu Li, Di Kang, Chaopeng Zhang, Jiangnan Ye, Liyang Chen, Xiangjun Gao, Han Zhang, Haolin Zhuang |
| 2025 | ACL | AgentStore: Scalable Integration of Heterogeneous Agents As Specialized Generalist Computer Assistant. | Chengyou Jia, Minnan Luo, Zhuohang Dang, Qiushi Sun, Fangzhi Xu, Junlin Hu, Tianbao Xie, Zhiyong Wu |
| 2025 | ACL | OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis. | Qiushi Sun, Kanzhi Cheng, Zichen Ding, Chuanyang Jin, Yian Wang, Fangzhi Xu, Zhenyu Wu, Chengyou Jia, Liheng Chen, Zhoumianze Liu, Ben Kao, Guohao Li, Junxian He, Yu Qiao, Zhiyong Wu |
| 2025 | ACL | φ-Decoding: Adaptive Foresight Sampling for Balanced Inference-Time Exploration and Exploitation. | Fangzhi Xu, Hang Yan, Chang Ma, Haiteng Zhao, Jun Liu, Qika Lin, Zhiyong Wu |
| 2025 | ACL | Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning. | Fangzhi Xu, Hang Yan, Chang Ma, Haiteng Zhao, Qiushi Sun, Kanzhi Cheng, Junxian He, Jun Liu, Zhiyong Wu |
| 2025 | ACL | Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models. | Fangzhi Xu, Qiushi Sun, Kanzhi Cheng, Jun Liu, Yu Qiao, Zhiyong Wu |
| 2025 | EuroSys | Understanding and Detecting SQL Function Bugs: Using Simple Boundary Arguments to Trigger Hundreds of DBMS Bugs. | Jingzhou Fu, Jie Liang, Zhiyong Wu, Yanyang Zhao, Shanshan Li, Yu Jiang |
| 2025 | ICASSP | Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis. | Zhiqi Huang, Dan Luo, Jun Wang, Huan Liao, Zhiheng Li, Zhiyong Wu |
| 2025 | ICASSP | Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features. | Wei Chen, Binzhu Sha, Jing Yang, Zhuo Wang, Fan Fan, Zhiyong Wu |
| 2025 | ICASSP | Black-Box Adversarial Defense Against Voice Conversion Using Latent Space Perturbation. | Jie Gao, Haiyun Li, Zhisheng Zhang, Zhiyong Wu |
| 2025 | ICASSP | Binary Representation Learning for Discriminative Acoustic Unit Discovery. | Rui Niu, Jie Chen, Long Ma, Changhe Song, Weihao Wu, Zhiyong Wu |
| 2025 | ICASSP | AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions. | Yuanyuan Wang, Hangting Chen, Dongchao Yang, Zhiyong Wu, Xixin Wu |
| 2025 | ICASSP | DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models. | Weihao Wu, Zhiwei Lin, Yixuan Zhou, Jingbei Li, Rui Niu, Qinghua Wu, Songjun Cao, Long Ma, Zhiyong Wu |
| 2025 | ICASSP | Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data. | Jingran Xie, Shun Lei, Yue Yu, Yang Xiang, Hui Wang, Xixin Wu, Zhiyong Wu |
| 2025 | ICASSP | Identity-Preserving Audio-Driven Holistic Human Motion Video Generation. | Haiwei Xue, Zhensong Zhang, Minglei Li, Zonghong Dai, Zhiyong Wu |
| 2025 | ICLR | OS-ATLAS: Foundation Action Model for Generalist GUI Agents. | Zhiyong Wu, Zhenyu Wu, Fangzhi Xu, Yian Wang, Qiushi Sun, Chengyou Jia, Kanzhi Cheng, Zichen Ding, Liheng Chen, Paul Pu Liang, Yu Qiao |
| 2025 | ICLR | RFWave: Multi-band Rectified Flow for Audio Waveform Reconstruction. | Peng Liu, Dongyang Dai, Zhiyong Wu |
| 2025 | ICLR | Implicit Search via Discrete Diffusion: A Study on Chess. | Jiacheng Ye, Zhenyu Wu, Jiahui Gao, Zhiyong Wu, Xin Jiang, Zhenguo Li, Lingpeng Kong |
| 2025 | IJCAI | VideoHumanMIB: Unlocking Appearance Decoupling for Video Human Motion In-betweening. | Haiwei Xue, Zhensong Zhang, Minglei Li, Zonghong Dai, Fei Yu, Fei Ma, Zhiyong Wu |
| 2025 | IJCNN | DB-STAGCN: A Dual-Branch Spatial-Temporal Attention Graph Convolutional Network for Traffic Flow Prediction. | Zhenyu Yang, Zhiyong Wu, Fengna Ji, Lei Du, Xiuwei Hu, Yunhui Zheng |
| 2025 | Interspeech | DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching. | Wei Chen, Binzhu Sha, Dan Luo, Jing Yang, Zhuo Wang, Fan Fan, Zhiyong Wu |
| 2025 | Interspeech | DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model. | Xueyuan Chen, Dongchao Yang, Wenxuan Wu, Minglin Wu, Jing Xu, Xixin Wu, Zhiyong Wu, Helen Meng |
| 2025 | Interspeech | In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion. | Jiawei Jin, Zhihan Yang, Yixuan Zhou, Zhiyong Wu |
| 2025 | Interspeech | Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding. | Zijian Lin, Yang Zhang, Yougen Yuan, Yuming Yan, Jinjiang Liu, Zhiyong Wu, Pengfei Hu, Qun Yu |
| 2025 | Interspeech | StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion. | Fengjin Li, Jie Wang, Yadong Niu, Yongqing Wang, Meng Meng, Jian Luan, Zhiyong Wu |
| 2025 | Interspeech | VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents. | Haiyun Li, Zhiyong Wu, Xiaofeng Xie, Jingran Xie, Yaoxun Xu, Hanyang Peng |
| 2025 | Interspeech | Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving. | Jingran Xie, Xiang Li, Hui Wang, Yue Yu, Yang Xiang, Xixin Wu, Zhiyong Wu |
| 2025 | Interspeech | WAKE: Watermarking Audio with Key Enrichment. | Yaoxun Xu, Jianwei Yu, Hangting Chen, Zhiyong Wu, Xixin Wu, Dong Yu, Rongzhi Gu, Yi Luo |
| 2025 | ICSE | PUPPY: Finding Performance Degradation Bugs in DBMSs via Limited-Optimization Plan Construction. | Zhiyong Wu, Jie Liang, Jingzhou Fu, Mingzhe Wang, Yu Jiang |
| 2025 | ICSE | Coni: Detecting Database Connector Bugs via State-Aware Test Case Generation. | Wenqian Deng, Jie Liang, Zhiyong Wu, Jingzhou Fu, Mingzhe Wang, Yu Jiang |
| 2025 | ICSE | Thanos: DBMS Bug Detection via Storage Engine Rotation Based Differential Testing. | Ying Fu, Zhiyong Wu, Yuanliang Zhang, Jie Liang, Jingzhou Fu, Yu Jiang, Shanshan Li, Xiangke Liao |
| 2025 | SiggraphA | Echo: Enhancing Conversational Behavior Generation via Hierarchical Semantic Comprehension with Large Language Models. | Haiwei Xue, Yanbo Fan, Xuan Wang, Zhiyong Wu |
| 2025 | USENIX | DDLumos: Understanding and Detecting Atomic DDL Bugs in DBMSs. | Zhiyong Wu, Jie Liang, Jingzhou Fu, Wenqian Deng, Yu Jiang |
| 2025 | SOSP | Fawkes: Finding Data Durability Bugs in DBMSs via Recovered Data State Verification. | Zhiyong Wu, Jie Liang, Jingzhou Fu, Wenqian Deng, Yu Jiang |
| 2024 | AAAI | SimCalib: Graph Neural Network Calibration Based on Similarity between Nodes. | Boshi Tang, Zhiyong Wu, Xixin Wu, Qiaochu Huang, Jun Chen, Shun Lei, Helen Meng |
| 2024 | AAAI | Explore 3D Dance Generation via Reward Model from Automatically-Ranked Demonstrations. | Zilin Wang, Haolin Zhuang, Lu Li, Yinmin Zhang, Junjie Zhong, Jun Chen, Yu Yang, Boshi Tang, Zhiyong Wu |
| 2024 | AAAI | SECap: Speech Emotion Captioning with Large Language Model. | Yaoxun Xu, Hangting Chen, Jianwei Yu, Qiaochu Huang, Zhiyong Wu, Shi-Xiong Zhang, Guangzhi Li, Yi Luo, Rongzhi Gu |
| 2024 | ACL | SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents. | Kanzhi Cheng, Qiushi Sun, Yougang Chu, Fangzhi Xu, Yantao Li, Jianbing Zhang, Zhiyong Wu |
| 2024 | ACL | LLM as Prompter: Low-resource Inductive Reasoning on Arbitrary Knowledge Graphs. | Kai Wang, Yuwei Xu, Zhiyong Wu, Siqiang Luo |
| 2024 | ACL | Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language Models. | Fangzhi Xu, Zhiyong Wu, Qiushi Sun, Siyu Ren, Fei Yuan, Shuai Yuan, Qika Lin, Yu Qiao, Jun Liu |
| 2024 | ACL | How Vocabulary Sharing Facilitates Multilingualism in LLaMA? | Fei Yuan, Shuai Yuan, Zhiyong Wu, Lei Li |
| 2024 | CVPR | Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model. | Xu He, Qiaochu Huang, Zhensong Zhang, Zhiwei Lin, Zhiyong Wu, Sicheng Yang, Minglei Li, Zhiyi Chen, Songcen Xu, Xiaofei Wu |
| 2024 | EMNLP | Automated Peer Reviewing in Paper SEA: Standardization, Evaluation, and Analysis. | Jianxiang Yu, Zichen Ding, Jiaqi Tan, Kangyang Luo, Zhenmin Weng, Chenghua Gong, Long Zeng, Renjing Cui, Chengcheng Han, Qiushi Sun, Zhiyong Wu, Yunshi Lan, Xiang Li |
| 2024 | EMNLP | A Survey on In-context Learning. | Qingxiu Dong, Lei Li, Damai Dai, Ce Zheng, Jingyuan Ma, Rui Li, Heming Xia, Jingjing Xu, Zhiyong Wu, Baobao Chang, Xu Sun, Lei Li, Zhifang Sui |
| 2024 | HCI | Collaboration of Digital Human Gestures and Teaching Materials for Enhanced Integration in MOOC Teaching Scenarios. | Yaxin Liu, Xiaomei Nie, Zhiyong Wu |
| 2024 | ICASSP | Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction. | Xueyuan Chen, Yuejiao Wang, Xixin Wu, Disong Wang, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2024 | ICASSP | Stylespeech: Self-Supervised Style Enhancing with VQ-VAE-Based Pre-Training for Expressive Audiobook Speech Synthesis. | Xueyuan Chen, Xi Wang, Shaofei Zhang, Lei He, Zhiyong Wu, Xixin Wu, Helen Meng |
| 2024 | ICASSP | Enhancing Expressiveness in Dance Generation Via Integrating Frequency and Music Style Information. | Qiaochu Huang, Xu He, Boshi Tang, Haolin Zhuang, Liyang Chen, Shuochen Gao, Zhiyong Wu, Haozhi Huang, Helen Meng |
| 2024 | ICASSP | Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts. | Shun Lei, Yixuan Zhou, Liyang Chen, Dan Luo, Zhiyong Wu, Xixin Wu, Shiyin Kang, Tao Jiang, Yahui Zhou, Yuxing Han, Helen Meng |
| 2024 | ICASSP | Multi-View Midivae: Fusing Track- and Bar-View Representations for Long Multi-Track Symbolic Music Generation. | Zhiwei Lin, Jun Chen, Boshi Tang, Binzhu Sha, Jing Yang, Yaolong Ju, Fan Fan, Shiyin Kang, Zhiyong Wu, Helen Meng |
| 2024 | ICASSP | Generating Stereophonic Music with Single-Stage Language Models. | Xingda Li, Fan Zhuo, Dan Luo, Jun Chen, Shiyin Kang, Zhiyong Wu, Tao Jiang, Yang Li, Han Fang, Yahui Zhou |
| 2024 | ICASSP | Unifying One-Shot Voice Conversion and Cloning with Disentangled Speech Representations. | Hui Lu, Xixin Wu, Haohan Guo, Songxiang Liu, Zhiyong Wu, Helen Meng |
| 2024 | ICASSP | Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion. | Binzhu Sha, Xu Li, Zhiyong Wu, Ying Shan, Helen Meng |
| 2024 | ICASSP | SCNet: Sparse Compression Network for Music Source Separation. | Weinan Tong, Jiaxu Zhu, Jun Chen, Shiyin Kang, Tao Jiang, Yang Li, Zhiyong Wu, Helen Meng |
| 2024 | ICASSP | Consistent and Relevant: Rethink the Query Embedding in General Sound Separation. | Yuanyuan Wang, Hangting Chen, Dongchao Yang, Jianwei Yu, Chao Weng, Zhiyong Wu, Helen Meng |
| 2024 | ICASSP | Conversational Co-Speech Gesture Generation via Modeling Dialog Intention, Emotion, and Context with Diffusion Models. | Haiwei Xue, Sicheng Yang, Zhensong Zhang, Zhiyong Wu, Minglei Li, Zonghong Dai, Helen Meng |
| 2024 | ICASSP | FreeTalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness. | Sicheng Yang, Zunnan Xu, Haiwei Xue, Yongkang Cheng, Shaoli Huang, Mingming Gong, Zhiyong Wu |
| 2024 | ICASSP | The THU-HCSI Multi-Speaker Multi-Lingual Few-Shot Voice Cloning System for LIMMITS'24 Challenge. | Yixuan Zhou, Shuoyi Zhou, Shun Lei, Zhiyong Wu, Menglin Wu |
| 2024 | ICLR | Emo: Earth Mover Distance Optimization for Auto-Regressive Language Modeling. | Siyu Ren, Zhiyong Wu, Kenny Q. Zhu |
| 2024 | IJCNN | NRAdapt: Noise-Robust Adaptive Text to Speech Using Untranscribed Data. | Ming Cheng, Shun Lei, Dongyang Dai, Zhiyong Wu, Dading Chong |
| 2024 | IJCNN | Representation Space Maintenance: Against Forgetting in Continual Learning. | Rui Niu, Zhiyong Wu, Changhe Song |
| 2024 | Interspeech | LoRA-MER: Low-Rank Adaptation of Pre-Trained Speech Models for Multimodal Emotion Recognition Using Mutual Information. | Yunrui Cai, Zhiyong Wu, Jia Jia, Helen Meng |
| 2024 | Interspeech | CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction. | Xueyuan Chen, Dongchao Yang, Dingdong Wang, Xixin Wu, Zhiyong Wu, Helen Meng |
| 2024 | Interspeech | An End-to-End Approach for Chord-Conditioned Song Generation. | Shuochen Gao, Shun Lei, Fan Zhuo, Hangyu Liu, Feng Liu, Boshi Tang, Qiaochu Huang, Shiyin Kang, Zhiyong Wu |
| 2024 | Interspeech | Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models. | Weiqin Li, Peiji Yang, Yicheng Zhong, Yixuan Zhou, Zhisheng Wang, Zhiyong Wu, Xixin Wu, Helen Meng |
| 2024 | Interspeech | Speaker Change Detection with Weighted-sum Knowledge Distillation based on Self-supervised Pre-trained Models. | Hang Su, Yuxiang Kong, Lichun Fan, Peng Gao, Yujun Wang, Zhiyong Wu |
| 2024 | Interspeech | Comparing Discrete and Continuous Space LLMs for Speech Recognition. | Yaoxun Xu, Shi-Xiong Zhang, Jianwei Yu, Zhiyong Wu, Dong Yu |
| 2024 | ICSE | Mozi: Discovering DBMS Bugs via Configuration-Based Equivalent Transformation. | Jie Liang, Zhiyong Wu, Jingzhou Fu, Mingzhe Wang, Chengnian Sun, Yu Jiang |
| 2024 | ICSE | Sedar: Obtaining High-Quality Seeds for DBMS Fuzzing via Cross-DBMS SQL Transfer. | Jingzhou Fu, Jie Liang, Zhiyong Wu, Yu Jiang |
| 2024 | USENIX | WingFuzz: Implementing Continuous Fuzzing for DBMSs. | Jie Liang, Zhiyong Wu, Jingzhou Fu, Yiyuan Bai, Qiang Zhang, Yu Jiang |
| 2023 | AAAI | Unsupervised Explanation Generation via Correct Instantiations. | Sijie Cheng, Zhiyong Wu, Jiangjie Chen, Zhixing Li, Yang Liu, Lingpeng Kong |
| 2023 | AAAI | What Does Your Face Sound Like? 3D Face Shape towards Voice. | Zhihan Yang, Zhiyong Wu, Ying Shan, Jia Jia |
| 2023 | ACL | Self-Adaptive In-Context Learning: An Information Compression Perspective for In-Context Example Selection and Ordering. | Zhiyong Wu, Yaoxiang Wang, Jiacheng Ye, Lingpeng Kong |
| 2023 | ACL | Explanation Regeneration via Information Bottleneck. | Qintong Li, Zhiyong Wu, Lingpeng Kong, Wei Bi |
| 2023 | ACL | OpenICL: An Open-Source Framework for In-context Learning. | Zhenyu Wu, Yaoxiang Wang, Jiacheng Ye, Zhiyong Wu, Jiangtao Feng, Jingjing Xu, Yu Qiao |
| 2023 | CVPR | QPGesture: Quantization-Based and Phase-Guided Motion Matching for Natural Speech-Driven Gesture Generation. | Sicheng Yang, Zhiyong Wu, Minglei Li, Zhensong Zhang, Lei Hao, Weihong Bao, Haolin Zhuang |
| 2023 | EMNLP | DiffuSeq-v2: Bridging Discrete and Continuous Text Spaces for Accelerated Seq2Seq Diffusion Models. | Shansan Gong, Mukai Li, Jiangtao Feng, Zhiyong Wu, Lingpeng Kong |
| 2023 | EMNLP | Can We Edit Factual Knowledge by In-Context Learning? | Ce Zheng, Lei Li, Qingxiu Dong, Yuxuan Fan, Zhiyong Wu, Jingjing Xu, Baobao Chang |
| 2023 | ICASSP | Wavsyncswap: End-To-End Portrait-Customized Audio-Driven Talking Face Generation. | Weihong Bao, Liyang Chen, Chaoyong Zhou, Sicheng Yang, Zhiyong Wu |
| 2023 | ICASSP | Inter-Subnet: Speech Enhancement with Subband Interaction. | Jun Chen, Wei Rao, Zilin Wang, Jiuxin Lin, Zhiyong Wu, Yannan Wang, Shidong Shang, Helen Meng |
| 2023 | ICASSP | Gesper: A Unified Framework for General Speech Restoration. | Jun Chen, Yupeng Shi, Wenzhe Liu, Wei Rao, Shulin He, Andong Li, Yannan Wang, Zhiyong Wu, Shidong Shang, Chengshi Zheng |
| 2023 | ICASSP | LightGrad: Lightweight Diffusion Probabilistic Model for Text-to-Speech. | Jie Chen, Xingchen Song, Zhendong Peng, Binbin Zhang, Fuping Pan, Zhiyong Wu |
| 2023 | ICASSP | Context-Aware Coherent Speaking Style Prediction with Hierarchical Transformers for Audiobook Speech Synthesis. | Shun Lei, Yixuan Zhou, Liyang Chen, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2023 | ICASSP | Av-Sepformer: Cross-Attention Sepformer for Audio-Visual Target Speaker Extraction. | Jiuxin Lin, Xinyu Cai, Heinrich Dinkel, Jun Chen, Zhiyong Yan, Yongqing Wang, Junbo Zhang, Zhiyong Wu, Yujun Wang, Helen Meng |
| 2023 | ICASSP | Lexicon-injected Semantic Parsing for Task-Oriented Dialog. | Xiaojun Meng, Wenlin Dai, Yasheng Wang, Baojun Wang, Zhiyong Wu, Xin Jiang, Qun Liu |
| 2023 | ICASSP | TrimTail: Low-Latency Streaming ASR with Simple But Effective Spectrogram-Level Length Penalty. | Xingchen Song, Di Wu, Zhiyong Wu, Binbin Zhang, Yuekai Zhang, Zhendong Peng, Wenpeng Li, Fuping Pan, Changbao Zhu |
| 2023 | ICASSP | TFCnet: Time-Frequency Domain Corrector for Speech Separation. | Weinan Tong, Jiaxu Zhu, Jun Chen, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2023 | ICASSP | A Synthetic Corpus Generation Method for Neural Vocoder Training. | Zilin Wang, Peng Liu, Jun Chen, Sipan Li, Jinfeng Bai, Gang He, Zhiyong Wu, Helen Meng |
| 2023 | ICASSP | DASA: Difficulty-Aware Semantic Augmentation for Speaker Verification. | Yuanyuan Wang, Yang Zhang, Zhiyong Wu, Zhihan Yang, Tao Wei, Kun Zou, Helen Meng |
| 2023 | ICASSP | CB-Conformer: Contextual Biasing Conformer for Biased Word Recognition. | Yaoxun Xu, Baiji Liu, Qiaochu Huang, Xingchen Song, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2023 | ICASSP | Keyword-Specific Acoustic Model Pruning for Open-Vocabulary Keyword Spotting. | Yujie Yang, Kun Zhang, Zhiyong Wu, Helen Meng |
| 2023 | ICASSP | Enhancing the Vocal Range of Single-Speaker Singing Voice Synthesis with Melody-Unsupervised Pre-Training. | Shaohuan Zhou, Xu Li, Zhiyong Wu, Ying Shan, Helen Meng |
| 2023 | ICASSP | GTN-Bailando: Genre Consistent long-Term 3D Dance Generation Based on Pre-Trained Genre Token Network. | Haolin Zhuang, Shun Lei, Long Xiao, Weiqin Li, Liyang Chen, Sicheng Yang, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2023 | ICDE | Sequence-Oriented DBMS Fuzzing. | Jie Liang, Yaoguang Chen, Zhiyong Wu, Jingzhou Fu, Mingzhe Wang, Yu Jiang, Xiangdong Huang, Ting Chen, Jiashui Wang, Jiajia Li |
| 2023 | ICLR | Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. | Jiahui Gao, Renjie Pi, Yong Lin, Hang Xu, Jiacheng Ye, Zhiyong Wu, Weizhong Zhang, Xiaodan Liang, Zhenguo Li, Lingpeng Kong |
| 2023 | ICLR | DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models. | Shansan Gong, Mukai Li, Jiangtao Feng, Zhiyong Wu, Lingpeng Kong |
| 2023 | ICMI | The DiffuseStyleGesture+ entry to the GENEA Challenge 2023. | Sicheng Yang, Haiwei Xue, Zhensong Zhang, Minglei Li, Zhiyong Wu, Xiaofei Wu, Songcen Xu, Zonghong Dai |
| 2023 | ICML | Compositional Exemplars for In-context Learning. | Jiacheng Ye, Zhiyong Wu, Jiangtao Feng, Tao Yu, Lingpeng Kong |
| 2023 | IJCAI | DiffuseStyleGesture: Stylized Audio-Driven Co-Speech Gesture Generation with Diffusion Models. | Sicheng Yang, Zhiyong Wu, Minglei Li, Zhensong Zhang, Lei Hao, Weihong Bao, Ming Cheng, Long Xiao |
| 2023 | Interspeech | MC-SpEx: Towards Effective Speaker Extraction with Multi-Scale Interfusion and Conditional Speaker Modulation. | Jun Chen, Wei Rao, Zilin Wang, Jiuxin Lin, Yukai Ju, Shulin He, Yannan Wang, Zhiyong Wu |
| 2023 | Interspeech | Diverse and Expressive Speech Prosody Prediction with Denoising Diffusion Probabilistic Model. | Xiang Li, Songxiang Liu, Max W. Y. Lam, Zhiyong Wu, Chao Weng, Helen Meng |
| 2023 | Interspeech | Towards Spontaneous Style Modeling with Semi-supervised Pre-training for Conversational Text-to-Speech Synthesis. | Weiqin Li, Shun Lei, Qiaochu Huang, Yixuan Zhou, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2023 | Interspeech | Focus on the Sound around You: Monaural Target Speaker Extraction via Distance and Speaker Information. | Jiuxin Lin, Peng Wang, Heinrich Dinkel, Jun Chen, Zhiyong Wu, Zhiyong Yan, Yongqing Wang, Junbo Zhang, Yujun Wang |
| 2023 | Interspeech | Gesper: A Restoration-Enhancement Framework for General Speech Reconstruction. | Wenzhe Liu, Yupeng Shi, Jun Chen, Wei Rao, Shulin He, Andong Li, Yannan Wang, Zhiyong Wu |
| 2023 | Interspeech | ZeroPrompt: Streaming Acoustic Encoders are Zero-Shot Masked LMs. | Xingchen Song, Di Wu, Binbin Zhang, Zhendong Peng, Bo Dang, Fuping Pan, Zhiyong Wu |
| 2023 | Interspeech | Prosody Modeling with 3D Visual Information for Expressive Video Dubbing. | Zhihan Yang, Shansong Liu, Xu Li, Haozhe Wu, Zhiyong Wu, Ying Shan, Jia Jia |
| 2023 | Interspeech | SememeASR: Boosting Performance of End-to-End Speech Recognition against Domain and Long-Tailed Data Shift with Sememe Semantic Knowledge. | Jiaxu Zhu, Changhe Song, Zhiyong Wu, Helen Meng |
| 2023 | Interspeech | Text-Only Domain Adaptation for End-to-End Speech Recognition through Down-Sampling Acoustic Representation. | Jiaxu Zhu, Weinan Tong, Yaoxun Xu, Changhe Song, Zhiyong Wu, Zhao You, Dan Su, Dong Yu, Helen Meng |
| 2022 | ACL | Lexical Knowledge Internalization for Neural Dialog Generation. | Zhiyong Wu, Wei Bi, Xiang Li, Lingpeng Kong, Ben Kao |
| 2022 | COLING | CoLo: A Contrastive Learning Based Re-ranking Framework for One-Stage Summarization. | Chenxin An, Ming Zhong, Zhiyong Wu, Qin Zhu, Xuanjing Huang, Xipeng Qiu |
| 2022 | COLING | Unsupervised Multi-scale Expressive Speaking Style Modeling with Hierarchical Context Information for Audiobook Speech Synthesis. | Xueyuan Chen, Shun Lei, Zhiyong Wu, Dong Xu, Weifeng Zhao, Helen Meng |
| 2022 | EMNLP | ProGen: Progressive Zero-shot Dataset Generation via In-context Feedback. | Jiacheng Ye, Jiahui Gao, Zhiyong Wu, Jiangtao Feng, Tao Yu, Lingpeng Kong |
| 2022 | EMNLP | ZeroGen: Efficient Zero-shot Learning via Dataset Generation. | Jiacheng Ye, Jiahui Gao, Qintong Li, Hang Xu, Jiangtao Feng, Zhiyong Wu, Tao Yu, Lingpeng Kong |
| 2022 | ICASSP | A Character-Level Span-Based Model for Mandarin Prosodic Structure Prediction. | Xueyuan Chen, Changhe Song, Yixuan Zhou, Zhiyong Wu, Changbin Chen, Zhongqin Wu, Helen Meng |
| 2022 | ICASSP | Transformer-S2A: Robust and Efficient Speech-to-Animation. | Liyang Chen, Zhiyong Wu, Jun Ling, Runnan Li, Xu Tan, Sheng Zhao |
| 2022 | ICASSP | FullSubNet+: Channel Attention Fullsubnet with Complex Spectrograms for Speech Enhancement. | Jun Chen, Zilin Wang, Deyi Tuo, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2022 | ICASSP | An End-to-End Chinese Text Normalization Model Based on Rule-Guided Flat-Lattice Transformer. | Wenlin Dai, Changhe Song, Xiang Li, Zhiyong Wu, Huashan Pan, Xiulin Li, Helen Meng |
| 2022 | ICASSP | Towards Expressive Speaking Style Modelling with Hierarchical Context Information for Mandarin Speech Synthesis. | Shun Lei, Yixuan Zhou, Liyang Chen, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2022 | ICASSP | Enhancing Speaking Styles in Conversational Text-to-Speech Synthesis with Graph-Based Multi-Modal Context Modeling. | Jingbei Li, Yi Meng, Chenyi Li, Zhiyong Wu, Helen Meng, Chao Weng, Dan Su |
| 2022 | ICASSP | Neufa: Neural Network Based End-to-End Forced Alignment with Bidirectional Attention Mechanism. | Jingbei Li, Yi Meng, Zhiyong Wu, Helen Meng, Qiao Tian, Yuping Wang, Yuxuan Wang |
| 2022 | ICASSP | Adversarial Sample Detection for Speaker Verification by Neural Vocoders. | Haibin Wu, Po-Chun Hsu, Ji Gao, Shanshan Zhang, Shen Huang, Jian Kang, Zhiyong Wu, Helen Meng, Hung-Yi Lee |
| 2022 | ICASSP | Neural Architecture Search for Speech Emotion Recognition. | Xixin Wu, Shoukang Hu, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2022 | ICASSP | An Approach to Mispronunciation Detection and Diagnosis with Acoustic, Phonetic and Linguistic (APL) Embeddings. | Wenxuan Ye, Shaoguang Mao, Frank K. Soong, Wenshan Wu, Yan Xia, Jonathan Tien, Zhiyong Wu |
| 2022 | ICASSP | Disentangling Content and Fine-Grained Prosody Information Via Hybrid ASR Bottleneck Features for Voice Conversion. | Xintao Zhao, Feng Liu, Changhe Song, Zhiyong Wu, Shiyin Kang, Deyi Tuo, Helen Meng |
| 2022 | ICIP | Learning from Designers: Fashion Compatibility Analysis Via Dataset Distillation. | Yulan Chen, Zhiyong Wu, Zheyan Shen, Jia Jia |
| 2022 | ICMI | The ReprGesture entry to the GENEA Challenge 2022. | Sicheng Yang, Zhiyong Wu, Minglei Li, Mengchen Zhao, Jiuxin Lin, Liyang Chen, Weihong Bao |
| 2022 | IJCNN | Speaker Characteristics Guided Speech Synthesis. | Zhihan Yang, Zhiyong Wu, Jia Jia |
| 2022 | Interspeech | Speech Enhancement with Fullband-Subband Cross-Attention Network. | Jun Chen, Wei Rao, Zilin Wang, Zhiyong Wu, Yannan Wang, Tao Yu, Shidong Shang, Helen Meng |
| 2022 | Interspeech | Improving Mandarin Prosodic Structure Prediction with Multi-level Contextual Information. | Jie Chen, Changhe Song, Deyi Tuo, Xixin Wu, Shiyin Kang, Zhiyong Wu, Helen Meng |
| 2022 | Interspeech | Towards Multi-Scale Speaking Style Modelling with Hierarchical Context Information for Mandarin Speech Synthesis. | Shun Lei, Yixuan Zhou, Liyang Chen, Jiankun Hu, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2022 | Interspeech | Towards Cross-speaker Reading Style Transfer on Audiobook Dataset. | Xiang Li, Changhe Song, Xianhao Wei, Zhiyong Wu, Jia Jia, Helen Meng |
| 2022 | Interspeech | CALM: Constrastive Cross-modal Speaking Style Modeling for Expressive Text-to-Speech Synthesis. | Yi Meng, Xiang Li, Zhiyong Wu, Tingtian Li, Zixun Sun, Xinyu Xiao, Chi Sun, Hui Zhan, Helen Meng |
| 2022 | Interspeech | Speech Representation Disentanglement with Adversarial Mutual Information Learning for One-shot Voice Conversion. | Sicheng Yang, Methawee Tantrawenith, Haolin Zhuang, Zhiyong Wu, Aolan Sun, Jianzong Wang, Ning Cheng, Huaizhen Tang, Xintao Zhao, Jie Wang, Helen Meng |
| 2022 | Interspeech | MFA-Conformer: Multi-scale Feature Aggregation Conformer for Automatic Speaker Verification. | Yang Zhang, Zhiqiang Lv, Haibin Wu, Shanshan Zhang, Pengfei Hu, Zhiyong Wu, Hung-yi Lee, Helen Meng |
| 2022 | Interspeech | Towards Improving the Expressiveness of Singing Voice Synthesis with BERT Derived Semantic Information. | Shaohuan Zhou, Shun Lei, Weiya You, Deyi Tuo, Yuren You, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2022 | Interspeech | Enhancing Word-Level Semantic Representation via Dependency Structure for Expressive Text-to-Speech Synthesis. | Yixuan Zhou, Changhe Song, Jingbei Li, Zhiyong Wu, Yanyao Bian, Dan Su, Helen Meng |
| 2022 | Interspeech | Content-Dependent Fine-Grained Speaker Embedding for Zero-Shot Speaker Adaptation in Text-to-Speech Synthesis. | Yixuan Zhou, Changhe Song, Xiang Li, Luwen Zhang, Zhiyong Wu, Yanyao Bian, Dan Su, Helen Meng |
| 2022 | ISSTA | Unicorn: detect runtime errors in time-series databases with hybrid input synthesis. | Zhiyong Wu, Jie Liang, Mingzhe Wang, Chijin Zhou, Yu Jiang |
| 2022 | PLDI | Odin: on-demand instrumentation with on-the-fly recompilation. | Mingzhe Wang, Jie Liang, Chijin Zhou, Zhiyong Wu, Xinyi Xu, Yu Jiang |
| 2022 | SP | PATA: Fuzzing with Path Aware Taint Analysis. | Jie Liang, Mingzhe Wang, Chijin Zhou, Zhiyong Wu, Yu Jiang, Jianzhong Liu, Zhe Liu, Jiaguang Sun |
| 2021 | AAAI | Inferring Emotion from Large-scale Internet Voice Data: A Semi-supervised Curriculum Augmentation based Deep Learning Approach. | Suping Zhou, Jia Jia, Zhiyong Wu, Zhihan Yang, Yanfeng Wang, Wei Chen, Fanbo Meng, Shuo Huang, Jialie Shen, Xiaochuan Wang |
| 2021 | ACL | Good for Misconceived Reasons: An Empirical Revisiting on the Need for Visual Context in Multimodal Machine Translation. | Zhiyong Wu, Lingpeng Kong, Wei Bi, Xiang Li, Ben Kao |
| 2021 | ACL | Cascaded Head-colliding Attention. | Lin Zheng, Zhiyong Wu, Lingpeng Kong |
| 2021 | ASRU | Reconstructing Dual Learning for Neural Voice Conversion Using Relatively Few Samples. | Aolan Sun, Jianzong Wang, Ning Cheng, Methawee Tantrawenith, Zhiyong Wu, Helen Meng, Edward Xiao, Jing Xiao |
| 2021 | CHI | PTeacher: a Computer-Aided Personalized Pronunciation Training System with Exaggerated Audio-Visual Corrective Feedback. | Yaohua Bu, Tianyi Ma, Weijun Li, Hang Zhou, Jia Jia, Shengqi Chen, Kaiyuan Xu, Dachuan Shi, Haozhe Wu, Zhihan Yang, Kun Li, Zhiyong Wu, Yuanchun Shi, Xiaobo Lu, Ziwei Liu |
| 2021 | EMNLP | Learning from Multiple Noisy Augmented Data Sets for Better Cross-Lingual Spoken Language Understanding. | Yingmei Guo, Linjun Shou, Jian Pei, Ming Gong, Mingxing Xu, Zhiyong Wu, Daxin Jiang |
| 2021 | ICASSP | Emotion Controllable Speech Synthesis Using Emotion-Unlabeled Dataset with the Assistance of Cross-Domain Speech Emotion Recognition. | Xiong Cai, Dongyang Dai, Zhiyong Wu, Xiang Li, Jingbei Li, Helen Meng |
| 2021 | ICASSP | Non-Autoregressive Transformer ASR with CTC-Enhanced Decoder Input. | Xingchen Song, Zhiyong Wu, Yiheng Huang, Chao Weng, Dan Su, Helen M. Meng |
| 2021 | ICASSP | Syntactic Representation Learning For Neural Network Based TTS with Syntactic Parse Tree Traversal. | Changhe Song, Jingbei Li, Yixuan Zhou, Zhiyong Wu, Helen M. Meng |
| 2021 | ICASSP | Improving Pronunciation Assessment Via Ordinal Regression with Anchored Reference Samples. | Bin Su, Shaoguang Mao, Frank K. Soong, Yan Xia, Jonathan Tien, Zhiyong Wu |
| 2021 | ICASSP | The Huya Multi-Speaker and Multi-Style Speech Synthesis System for M2voc Challenge 2020. | Jie Wang, Yuren You, Feng Liu, Deyi Tuo, Shiyin Kang, Zhiyong Wu, Helen Meng |
| 2021 | ICASSP | Adversarial Defense for Automatic Speaker Verification by Cascaded Self-Supervised Learning Models. | Haibin Wu, Xu Li, Andy T. Liu, Zhiyong Wu, Helen Meng, Hung-yi Lee |
| 2021 | ICASSP | The Multi-Speaker Multi-Style Voice Cloning Challenge 2021. | Qicong Xie, Xiaohai Tian, Guanghou Liu, Kun Song, Lei Xie, Zhiyong Wu, Hai Li, Song Shi, Haizhou Li, Fen Hong, Hui Bu, Xin Xu |
| 2021 | ICIP | Semantic Preserving Generative Adversarial Network For Cross-Modal Hashing. | Fei Wu, Xiaokai Luo, Qinghua Huang, Pengfei Wei, Ying Sun, Xiwei Dong, Zhiyong Wu |
| 2021 | Interspeech | Towards Multi-Scale Style Control for Expressive Speech Synthesis. | Xiang Li, Changhe Song, Jingbei Li, Zhiyong Wu, Jia Jia, Helen Meng |
| 2021 | Interspeech | VAENAR-TTS: Variational Auto-Encoder Based Non-AutoRegressive Text-to-Speech Synthesis. | Hui Lu, Zhiyong Wu, Xixin Wu, Xu Li, Shiyin Kang, Xunying Liu, Helen Meng |
| 2021 | Interspeech | Adversarially Learning Disentangled Speech Representations for Robust Multi-Factor Voice Conversion. | Jie Wang, Jingbei Li, Xintao Zhao, Zhiyong Wu, Shiyin Kang, Helen Meng |
| 2021 | Interspeech | Voting for the Right Answer: Adversarial Defense for Speaker Verification. | Haibin Wu, Yang Zhang, Zhiyong Wu, Dong Wang, Hung-yi Lee |
| 2021 | ICSE | Industry Practice of Coverage-Guided Enterprise-Level DBMS Fuzzing. | Mingzhe Wang, Zhiyong Wu, Xinyi Xu, Jie Liang, Chijin Zhou, Huafeng Zhang, Yu Jiang |
| 2021 | ICST | Industrial Oriented Evaluation of Fuzzing Techniques. | Mingzhe Wang, Jie Liang, Chijin Zhou, Yuanliang Chen, Zhiyong Wu, Yu Jiang |
| 2021 | SERVICES | Abstraction Refinement Approach for Web Service Selection using Skyline Computations. | Zhiyong Wu, Ke Meng, Xiukun Yan, Dayin Shi, Benjia Hu |
| 2020 | ACL | Perturbed Masking: Parameter-free Probing for Analyzing and Interpreting BERT. | Zhiyong Wu, Yun Chen, Ben Kao, Qun Liu |
| 2020 | EUSPN | A Partial Pre-composing Method for Composition of Web Services. | Jing Li, Zhiyong Wu, Panjing Li, Ming Zhu, Yifei Wang |
| 2020 | ICASSP | Code-Switched Speech Synthesis Using Bilingual Phonetic Posteriorgram with Only Monolingual Corpora. | Yuewen Cao, Songxiang Liu, Xixin Wu, Shiyin Kang, Peng Liu, Zhiyong Wu, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2020 | ICASSP | End-To-End Accent Conversion Without Using Native Utterances. | Songxiang Liu, Disong Wang, Yuewen Cao, Lifa Sun, Xixin Wu, Shiyin Kang, Zhiyong Wu, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2020 | ICPR | Channel-Wise Dense Connection Graph Convolutional Network for Skeleton-Based Action Recognition. | Michael Lao BanTeng, Zhiyong Wu |
| 2020 | IJCNLP | FERNet: Fine-grained Extraction and Reasoning Network for Emotion Recognition in Dialogues. | Yingmei Guo, Zhiyong Wu, Mingxing Xu |
| 2020 | Interspeech | Enhancing Monotonicity for Robust Autoregressive Transformer TTS. | Xiangyu Liang, Zhiyong Wu, Runnan Li, Yanqing Liu, Sheng Zhao, Helen Meng |
| 2020 | Interspeech | SpecSwap: A Simple Data Augmentation Method for End-to-End Speech Recognition. | Xingcheng Song, Zhiyong Wu, Yiheng Huang, Dan Su, Helen Meng |
| 2020 | Interspeech | Speech-XLNet: Unsupervised Acoustic Model Pretraining for Self-Attention Networks. | Xingchen Song, Guangsen Wang, Yiheng Huang, Zhiyong Wu, Dan Su, Helen Meng |
| 2020 | Interspeech | Re-Weighted Interval Loss for Handling Data Imbalance Problem of End-to-End Keyword Spotting. | Kun Zhang, Zhiyong Wu, Daode Yuan, Jian Luan, Jia Jia, Helen Meng, Binheng Song |
| 2020 | WISE | MULCE: Multi-level Canonicalization with Embeddings of Open Knowledge Bases. | Tien-Hsuan Wu, Ben Kao, Zhiyong Wu, Xiyang Feng, Qianli Song, Cheng Chen |
| 2020 | WSDM | PERQ: Predicting, Explaining, and Rectifying Failed Questions in KB-QA Systems. | Zhiyong Wu, Ben Kao, Tien-Hsuan Wu, Pengcheng Yin, Qun Liu |
| 2019 | ACII | Multi-Scale Convolutional Recurrent Neural Network with Ensemble Method for Weakly Labeled Sound Event Detection. | Yingmei Guo, Mingxing Xu, Zhiyong Wu, Jianming Wu, Bin Su |
| 2019 | ICASSP | End-to-end Code-switched TTS with Mix of Monolingual Recordings. | Yuewen Cao, Xixin Wu, Songxiang Liu, Jianwei Yu, Xu Li, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2019 | ICASSP | Learning Discriminative Features from Spectrograms Using Center Loss for Speech Emotion Recognition. | Dongyang Dai, Zhiyong Wu, Runnan Li, Xixin Wu, Jia Jia, Helen Meng |
| 2019 | ICASSP | Dilated Residual Network with Multi-head Self-attention for Speech Emotion Recognition. | Runnan Li, Zhiyong Wu, Jia Jia, Sheng Zhao, Helen Meng |
| 2019 | ICASSP | A Compact Framework for Voice Conversion Using Wavenet Conditioned on Phonetic Posteriorgrams. | Hui Lu, Zhiyong Wu, Runnan Li, Shiyin Kang, Jia Jia, Helen Meng |
| 2019 | ICASSP | NN-based Ordinal Regression for Assessing Fluency of ESL Speech. | Shaoguang Mao, Zhiyong Wu, Jingshuai Jiang, Peiyun Liu, Frank K. Soong |
| 2019 | ICASSP | Quasi-fully Convolutional Neural Network with Variational Inference for Speech Synthesis. | Mu Wang, Xixin Wu, Zhiyong Wu, Shiyin Kang, Deyi Tuo, Guangzhi Li, Dan Su, Dong Yu, Helen Meng |
| 2019 | ICASSP | Speech Emotion Recognition Using Capsule Networks. | Xixin Wu, Songxiang Liu, Yuewen Cao, Xu Li, Jianwei Yu, Dongyang Dai, Xi Ma, Shoukang Hu, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2019 | ICDE | Walking with Perception: Efficient Random Walk Sampling via Common Neighbor Awareness. | Yongkun Li, Zhiyong Wu, Shuai Lin, Hong Xie, Min Lv, Yinlong Xu, John C. S. Lui |
| 2019 | ICMI | Modeling Emotion Influence Using Attention-based Graph Convolutional Recurrent Network. | Yulan Chen, Jia Jia, Zhiyong Wu |
| 2019 | IJCAI | Towards Discriminative Representation Learning for Speech Emotion Recognition. | Runnan Li, Zhiyong Wu, Jia Jia, Yaohua Bu, Sheng Zhao, Helen Meng |
| 2019 | Interspeech | Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-Trained BERT. | Dongyang Dai, Zhiyong Wu, Shiyin Kang, Xixin Wu, Jia Jia, Dan Su, Dong Yu, Helen Meng |
| 2019 | Interspeech | Knowledge-Based Linguistic Encoding for End-to-End Mandarin Text-to-Speech Synthesis. | Jingbei Li, Zhiyong Wu, Runnan Li, Pengpeng Zhi, Song Yang, Helen Meng |
| 2019 | Interspeech | One-Shot Voice Conversion with Global Speaker Embeddings. | Hui Lu, Zhiyong Wu, Dongyang Dai, Runnan Li, Shiyin Kang, Jia Jia, Helen Meng |
| 2018 | CIKM | Towards Practical Open Knowledge Base Canonicalization. | Tien-Hsuan Wu, Zhiyong Wu, Ben Kao, Pengcheng Yin |
| 2018 | ICASSP | Emphatic Speech Generation with Conditioned Input Layer and Bidirectional LSTMS for Expressive Speech Synthesis. | Runnan Li, Zhiyong Wu, Yuchen Huang, Jia Jia, Helen Meng, Lianhong Cai |
| 2018 | ICASSP | Unsupervised Discovery of an Extended Phoneme Set in L2 English Speech for Mispronunciation Detection and Diagnosis. | Shaoguang Mao, Xu Li, Kun Li, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2018 | ICASSP | Applying Multitask Learning to Acoustic-Phonemic Model for Mispronunciation Detection and Diagnosis in L2 English Speech. | Shaoguang Mao, Zhiyong Wu, Runnan Li, Xu Li, Helen Meng, Lianhong Cai |
| 2018 | ICASSP | Feature Based Adaptation for Speaking Style Synthesis. | Xixin Wu, Lifa Sun, Shiyin Kang, Songxiang Liu, Zhiyong Wu, Xunying Liu, Helen Meng |
| 2018 | Interspeech | Emotion Recognition from Variable-Length Speech Segments Using Deep Learning on Spectrograms. | Xi Ma, Zhiyong Wu, Jia Jia, Mingxing Xu, Helen Meng, Lianhong Cai |
| 2018 | Interspeech | Rapid Style Adaptation Using Residual Error Embedding for Expressive Speech Synthesis. | Xixin Wu, Yuewen Cao, Mu Wang, Songxiang Liu, Shiyin Kang, Zhiyong Wu, Xunying Liu, Dan Su, Dong Yu, Helen Meng |
| 2018 | Interspeech | Detection of Glottal Closure Instants from Speech Signals: A Convolutional Neural Network Based Method. | Shuai Yang, Zhiyong Wu, Binbin Shen, Helen Meng |
| 2018 | Interspeech | Siamese Recurrent Auto-Encoder Representation for Query-by-Example Spoken Term Detection. | Ziwei Zhu, Zhiyong Wu, Runnan Li, Helen Meng, Lianhong Cai |
| 2017 | AAAI | Multi-Task Deep Learning for User Intention Understanding in Speech Interaction Systems. | Yishuang Ning, Jia Jia, Zhiyong Wu, Runnan Li, Yongsheng An, Yanfeng Wang, Helen M. Meng |
| 2017 | DASFAA | Measuring and Maximizing Influence via Random Walk in Social Activity Networks. | Pengpeng Zhao, Yongkun Li, Hong Xie, Zhiyong Wu, Yinlong Xu, John C. S. Lui |
| 2017 | ICASSP | Multi-task learning of structured output layer bidirectional LSTMS for speech synthesis. | Runnan Li, Zhiyong Wu, Xunying Liu, Helen M. Meng, Lianhong Cai |
| 2017 | ICASSP | Learning cross-lingual knowledge with multilingual BLSTM for emphasis detection with limited training data. | Yishuang Ning, Zhiyong Wu, Runnan Li, Jia Jia, Mingxing Xu, Helen M. Meng, Lianhong Cai |
| 2017 | Interspeech | Multi-Task Learning for Prosodic Structure Generation Using BLSTM RNN with Structured Output Layer. | Yuchen Huang, Zhiyong Wu, Runnan Li, Helen Meng, Lianhong Cai |
| 2017 | Interspeech | Spectro-Temporal Modelling with Time-Frequency LSTM and Structured Output Layer for Voice Conversion. | Runnan Li, Zhiyong Wu, Yishuang Ning, Lifa Sun, Helen Meng, Lianhong Cai |
| 2017 | Interspeech | Speech Emotion Recognition with Emotion-Pair Based Framework Considering Emotion Distribution Information in Dimensional Emotion Space. | Xi Ma, Zhiyong Wu, Jia Jia, Mingxing Xu, Helen Meng, Lianhong Cai |
| 2017 | MMM | Movie Recommendation via BLSTM. | Song Tang, Zhiyong Wu, Kang Chen |
| 2016 | ICASSP | Low level descriptors based DBLSTM bottleneck feature for speech driven talking avatar. | Xinyu Lan, Xu Li, Yishuang Ning, Zhiyong Wu, Helen Meng, Jia Jia, Lianhong Cai |
| 2016 | ICASSP | Question detection from acoustic features using recurrent neural network with gated recurrent unit. | Yaodong Tang, Yuchen Huang, Zhiyong Wu, Helen Meng, Mingxing Xu, Lianhong Cai |
| 2016 | ICASSP | Learning cross-lingual information with multilingual BLSTM for speech synthesis of low-resource languages. | Quanjie Yu, Peng Liu, Zhiyong Wu, Shiyin Kang, Helen Meng, Lianhong Cai |
| 2016 | Interspeech | Phoneme Embedding and its Application to Speech Driven Talking Avatar Synthesis. | Xu Li, Zhiyong Wu, Helen M. Meng, Jia Jia, Xiaoyan Lou, Lianhong Cai |
| 2016 | Interspeech | Expressive Speech Driven Talking Avatar Synthesis with DBLSTM Using Limited Amount of Emotional Bimodal Data. | Xu Li, Zhiyong Wu, Helen M. Meng, Jia Jia, Xiaoyan Lou, Lianhong Cai |
| 2016 | Interspeech | Combining CNN and BLSTM to Extract Textual and Acoustic Features for Recognizing Stances in Mandarin Ideological Debate Competition. | Linchuan Li, Zhiyong Wu, Mingxing Xu, Helen M. Meng, Lianhong Cai |
| 2016 | Interspeech | Analysis on Gated Recurrent Unit Based Question Detection Approach. | Yaodong Tang, Zhiyong Wu, Helen M. Meng, Mingxing Xu, Lianhong Cai |
| 2015 | ACII | Understanding speaking styles of internet speech data with LSTM and low-resource training. | Xixin Wu, Zhiyong Wu, Yishuang Ning, Jia Jia, Lianhong Cai, Helen M. Meng |
| 2015 | ICASSP | A deep recurrent approach for acoustic-to-articulatory inversion. | Peng Liu, Quanjie Yu, Zhiyong Wu, Shiyin Kang, Helen M. Meng, Lianhong Cai |
| 2015 | ICASSP | HMM-based emphatic speech synthesis for corrective feedback in computer-aided pronunciation training. | Yishuang Ning, Zhiyong Wu, Jia Jia, Fanbo Meng, Helen M. Meng, Lianhong Cai |
| 2015 | IJCAI | Modelling High-Dimensional Sequences with LSTM-RTRBM: Application to Polyphonic Music Generation. | Qi Lyu, Zhiyong Wu, Jun Zhu, Helen Meng |
| 2015 | Interspeech | Using tilt for automatic emphasis detection with Bayesian networks. | Yishuang Ning, Zhiyong Wu, Xiaoyan Lou, Helen M. Meng, Jia Jia, Lianhong Cai |
| 2014 | ICASSP | Learning dynamic features with neural networks for phoneme recognition. | Xin Zheng, Zhiyong Wu, Helen Meng, Lianhong Cai |
| 2014 | ICASSP | Contrastive auto-encoder for phoneme recognition. | Xin Zheng, Zhiyong Wu, Helen Meng, Lianhong Cai |
| 2014 | Interspeech | Using conditional random fields to predict focus word pair in spontaneous spoken English. | Xiao Zang, Zhiyong Wu, Helen M. Meng, Jia Jia, Lianhong Cai |
| 2014 | Interspeech | Multi-channel speech enhancement using sparse coding on local time-frequency structures. | Zhiyuan Zhou, Zhaogui Ding, Weifeng Li, Zhiyong Wu, Longbiao Wang, Qingmin Liao |
| 2013 | ICASSP | Investigation of tandem deep belief network approach for phoneme recognition. | Xin Zheng, Zhiyong Wu, Binbin Shen, Helen M. Meng, Lianhong Cai |
| 2012 | Interspeech | Hierarchical English Emphatic Speech Synthesis Based on HMM with Limited Training Data. | Fanbo Meng, Zhiyong Wu, Helen M. Meng, Jia Jia, Lianhong Cai |
| 2011 | Interspeech | Combining Active and Semi-Supervised Learning for Homograph Disambiguation in Mandarin Text-to-Speech Synthesis. | Binbin Shen, Zhiyong Wu, Yongxin Wang, Lianhong Cai |
| 2010 | ICPR | Comparison of Syllable/Phone HMM Based Mandarin TTS. | Quansheng Duan, Shiyin Kang, Zhiyong Wu, Lianhong Cai, Zhiwei Shuang, Yong Qin |
| 2007 | ACII | Facial Expression Synthesis Using PAD Emotional Parameters for a Chinese Expressive Avatar. | Shen Zhang, Zhiyong Wu, Helen M. Meng, Lianhong Cai |
| 2007 | ICASSP | Head Movement Synthesis Based on Semantic and Prosodic Features for a Chinese Expressive Avatar. | Shen Zhang, Zhiyong Wu, Helen M. Meng, Lianhong Cai |
| 2006 | Interspeech | Real-time synthesis of Chinese visual speech and facial expressions using MPEG-4 FAP features in a three-dimensional avatar. | Zhiyong Wu, Shen Zhang, Lianhong Cai, Helen M. Meng |
| 2000 | Interspeech | Research on dynamic characters of Chinese pitch contours. | Zhiyong Wu, Lianhong Cai, Tongchun Zhou |