| 2025 | ASRU | Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion. | Yu Zhang, Baotong Tian, Zhiyao Duan |
| 2025 | ICASSP | Twenty-Five Years of MIR Research: Achievements, Practices, Evaluations, and Future Challenges. | Geoffroy Peeters, Zafar Rafii, Magdalena Fuentes, Zhiyao Duan, Emmanouil Benetos, Juhan Nam, Yuki Mitsufuji |
| 2025 | ICIP | Audio Visual Segmentation through Text Embeddings. | Kyungbok Lee, You Zhang, Zhiyao Duan |
| 2025 | Interspeech | PartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing. | You Zhang, Baotong Tian, Lin Zhang, Zhiyao Duan |
| 2024 | ICASSP | SingFake: Singing Voice Deepfake Detection. | Yongyi Zang, You Zhang, Mojtaba Heydari, Zhiyao Duan |
| 2024 | ICASSP | SynthTab: Leveraging Synthesized Data for Guitar Tablature Transcription. | Yongyi Zang, Yi Zhong, Frank Cwitkowitz, Zhiyao Duan |
| 2024 | ICASSP | Learning Arousal-Valence Representation from Categorical Emotion Labels of Speech. | Enting Zhou, You Zhang, Zhiyao Duan |
| 2024 | Interspeech | GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis. | Zehua Kcriss Li, Meiying Melissa Chen, Yi Zhong, Pinxin Liu, Zhiyao Duan |
| 2024 | Interspeech | CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection. | Yongyi Zang, Jiatong Shi, You Zhang, Ryuichi Yamamoto, Jionghao Han, Yuxun Tang, Shengyuan Xu, Wenxiao Zhao, Jing Guo, Tomoki Toda, Zhiyao Duan |
| 2024 | MMSP | A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection. | Kyungbok Lee, You Zhang, Zhiyao Duan |
| 2023 | ICASSP | SAMO: Speaker Attractor Multi-Center One-Class Learning For Voice Anti-Spoofing. | Siwen Ding, You Zhang, Zhiyao Duan |
| 2023 | ICASSP | SingNet: a real-time Singing Voice beat and Downbeat Tracking System. | Mojtaba Heydari, Ju-Chiang Wang, Zhiyao Duan |
| 2023 | ICASSP | HRTF Field: Unifying Measured HRTF Magnitude Representation with Neural Fields. | You Zhang, Yuxiang Wang, Zhiyao Duan |
| 2023 | ICASSP | Transcription Free Filler Word Detection with Neural Semi-CRFs. | Ge Zhu, Yujia Yan, Juan Pablo Cceres, Zhiyao Duan |
| 2023 | Interspeech | ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed. | Meiying Chen, Zhiyao Duan |
| 2023 | Interspeech | Phase perturbation improves channel robustness for speech spoofing countermeasures. | Yongyi Zang, You Zhang, Zhiyao Duan |
| 2022 | ICASSP | A Novel 1D State Space for Efficient Music Rhythmic Analysis. | Mojtaba Heydari, Matthew C. McCallum, Andreas F. Ehmann, Zhiyao Duan |
| 2022 | ICASSP | Progressive Teacher-Student Training Framework for Music Tagging. | Rui Lu, Baigong Zheng, Jiarui Hai, Fei Tao, Zhiyao Duan, Ji Liu |
| 2022 | ICASSP | A Study of The Robustness of Raw Waveform Based Speaker Embeddings Under Mismatched Conditions. | Ge Zhu, Frank Cwitkowitz, Zhiyao Duan |
| 2022 | MMSP | DyViSE: Dynamic Vision-Guided Speaker Embedding for Audio-Visual Speaker Diarization. | Abudukelimu Wuerkaixi, Kunda Yan, You Zhang, Zhiyao Duan, Changshui Zhang |
| 2021 | ICASSP | Don't Look Back: An Online Beat Tracking Method Using RNN and Enhanced Particle Filtering. | Mojtaba Heydari, Zhiyao Duan |
| 2021 | Interspeech | An Empirical Study on Channel Effects for Synthetic Voice Spoofing Countermeasure Systems. | You Zhang, Ge Zhu, Fei Jiang, Zhiyao Duan |
| 2021 | Interspeech | Y-Vector: Multiscale Waveform Encoder for Speaker Embedding. | Ge Zhu, Fei Jiang, Zhiyao Duan |
| 2020 | AAAI | RL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement Learning. | Nan Jiang, Sheng Jin, Zhiyao Duan, Changshui Zhang |
| 2020 | CHIIR | Vroom!: A Search Engine for Sounds by Vocal Imitation Queries. | Yichi Zhang, Junbo Hu, Yiting Zhang, Bryan Pardo, Zhiyao Duan |
| 2020 | ICASSP | End-To-End Generation of Talking Faces from Noisy Speech. | Sefik Emre Eskimez, Ross K. Maddox, Chenliang Xu, Zhiyao Duan |
| 2019 | CVPR | Hierarchical Cross-Modal Talking Face Generation With Dynamic Pixel-Wise Loss. | Lele Chen, Ross K. Maddox, Zhiyao Duan, Chenliang Xu |
| 2019 | CVPR | Sound to Visual: Hierarchical Cross-Modal Talking Face Generation. | Lele Chen, Haitian Zheng, Ross K. Maddox, Zhiyao Duan, Chenliang Xu |
| 2019 | CVPR | Audio-Visual Event Localization in the Wild. | Yapeng Tian, Jing Shi, Bochen Li, Zhiyao Duan, Chenliang Xu |
| 2018 | ECCV | Lip Movements Generation at a Glance. | Lele Chen, Zhiheng Li, Ross K. Maddox, Zhiyao Duan, Chenliang Xu |
| 2018 | ECCV | Audio-Visual Event Localization in Unconstrained Videos. | Yapeng Tian, Jing Shi, Bochen Li, Zhiyao Duan, Chenliang Xu |
| 2018 | ICASSP | Unsupervised Learning Approach to Feature Analysis for Automatic Speech Emotion Recognition. | Sefik Emre Eskimez, Zhiyao Duan, Wendi B. Heinzelman |
| 2018 | ICASSP | Multi-Scale Recurrent Neural Network for Sound Event Detection. | Rui Lu, Zhiyao Duan, Changshui Zhang |
| 2018 | ICASSP | Score-Aligned Polyphonic Microtiming Estimation. | Xueyang Wang, Ryan Stables, Bochen Li, Zhiyao Duan |
| 2018 | ICASSP | Visualization and Interpretation of Siamese Style Convolutional Neural Networks for Sound Search by Vocal Imitation. | Yichi Zhang, Zhiyao Duan |
| 2018 | ICASSP | Joint Speaker Diarization and Recognition Using Convolutional and Recurrent Neural Networks. | Zhihan Zhou, Yichi Zhang, Zhiyao Duan |
| 2017 | ICASSP | Visually informed multi-pitch analysis of string ensembles. | Karthik Dinesh, Bochen Li, Xinzhao Liu, Zhiyao Duan, Gaurav Sharma |
| 2017 | ICASSP | See and listen: Score-informed association of sound tracks to players in chamber music performance videos. | Bochen Li, Karthik Dinesh, Zhiyao Duan, Gaurav Sharma |
| 2017 | ICASSP | Deep ranking: Triplet MatchNet for music metric learning. | Rui Lu, Kailun Wu, Zhiyao Duan, Changshui Zhang |
| 2016 | ICASSP | Emotion classification: How does an automated system compare to Naive human coders? | Sefik Emre Eskimez, Kenneth Imade, Na Yang, Melissa Sturge-Apple, Zhiyao Duan, Wendi B. Heinzelman |
| 2016 | ICASSP | IMISOUND: An unsupervised system for sound query by vocal imitation. | Yichi Zhang, Zhiyao Duan |
| 2016 | IJCAI | WISE: Web-based Interactive Speech Emotion Classification. | Sefik Emre Eskimez, Melissa Sturge-Apple, Zhiyao Duan, Wendi B. Heinzelman |
| 2015 | ICASSP | Piano music transcription modeling note temporal evolution. | Andrea Cogliati, Zhiyao Duan |
| 2014 | ICASSP | A novel cepstral representation for timbre modeling of sound sources in polyphonic mixtures. | Zhiyao Duan, Bryan Pardo, Laurent Daudet |
| 2012 | Interspeech | Speech Enhancement by Online Non-negative Spectrogram Decomposition in Non-stationary Noise Environments. | Zhiyao Duan, Gautham J. Mysore, Paris Smaragdis |
| 2011 | ICASSP | A state space model for online polyphonic audio-score alignment. | Zhiyao Duan, Bryan Pardo |
| 2010 | ICASSP | Song-level multi-pitch tracking by heavily constrained clustering. | Zhiyao Duan, Jinyu Han, Bryan Pardo |