Skip to content

Zhiyao Duan

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

47

Venues

10

Active years

2010–2025

Best venue rank

A*

Where they publish

Papers

47 indexed papers, newest first.

YearVenueTitleAuthors
2025ASRUConan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion.Yu Zhang, Baotong Tian, Zhiyao Duan
2025ICASSPTwenty-Five Years of MIR Research: Achievements, Practices, Evaluations, and Future Challenges.Geoffroy Peeters, Zafar Rafii, Magdalena Fuentes, Zhiyao Duan, Emmanouil Benetos, Juhan Nam, Yuki Mitsufuji
2025ICIPAudio Visual Segmentation through Text Embeddings.Kyungbok Lee, You Zhang, Zhiyao Duan
2025InterspeechPartialEdit: Identifying Partial Deepfakes in the Era of Neural Speech Editing.You Zhang, Baotong Tian, Lin Zhang, Zhiyao Duan
2024ICASSPSingFake: Singing Voice Deepfake Detection.Yongyi Zang, You Zhang, Mojtaba Heydari, Zhiyao Duan
2024ICASSPSynthTab: Leveraging Synthesized Data for Guitar Tablature Transcription.Yongyi Zang, Yi Zhong, Frank Cwitkowitz, Zhiyao Duan
2024ICASSPLearning Arousal-Valence Representation from Categorical Emotion Labels of Speech.Enting Zhou, You Zhang, Zhiyao Duan
2024InterspeechGTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis.Zehua Kcriss Li, Meiying Melissa Chen, Yi Zhong, Pinxin Liu, Zhiyao Duan
2024InterspeechCtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection.Yongyi Zang, Jiatong Shi, You Zhang, Ryuichi Yamamoto, Jionghao Han, Yuxun Tang, Shengyuan Xu, Wenxiao Zhao, Jing Guo, Tomoki Toda, Zhiyao Duan
2024MMSPA Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection.Kyungbok Lee, You Zhang, Zhiyao Duan
2023ICASSPSAMO: Speaker Attractor Multi-Center One-Class Learning For Voice Anti-Spoofing.Siwen Ding, You Zhang, Zhiyao Duan
2023ICASSPSingNet: a real-time Singing Voice beat and Downbeat Tracking System.Mojtaba Heydari, Ju-Chiang Wang, Zhiyao Duan
2023ICASSPHRTF Field: Unifying Measured HRTF Magnitude Representation with Neural Fields.You Zhang, Yuxiang Wang, Zhiyao Duan
2023ICASSPTranscription Free Filler Word Detection with Neural Semi-CRFs.Ge Zhu, Yujia Yan, Juan Pablo Cceres, Zhiyao Duan
2023InterspeechControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed.Meiying Chen, Zhiyao Duan
2023InterspeechPhase perturbation improves channel robustness for speech spoofing countermeasures.Yongyi Zang, You Zhang, Zhiyao Duan
2022ICASSPA Novel 1D State Space for Efficient Music Rhythmic Analysis.Mojtaba Heydari, Matthew C. McCallum, Andreas F. Ehmann, Zhiyao Duan
2022ICASSPProgressive Teacher-Student Training Framework for Music Tagging.Rui Lu, Baigong Zheng, Jiarui Hai, Fei Tao, Zhiyao Duan, Ji Liu
2022ICASSPA Study of The Robustness of Raw Waveform Based Speaker Embeddings Under Mismatched Conditions.Ge Zhu, Frank Cwitkowitz, Zhiyao Duan
2022MMSPDyViSE: Dynamic Vision-Guided Speaker Embedding for Audio-Visual Speaker Diarization.Abudukelimu Wuerkaixi, Kunda Yan, You Zhang, Zhiyao Duan, Changshui Zhang
2021ICASSPDon't Look Back: An Online Beat Tracking Method Using RNN and Enhanced Particle Filtering.Mojtaba Heydari, Zhiyao Duan
2021InterspeechAn Empirical Study on Channel Effects for Synthetic Voice Spoofing Countermeasure Systems.You Zhang, Ge Zhu, Fei Jiang, Zhiyao Duan
2021InterspeechY-Vector: Multiscale Waveform Encoder for Speaker Embedding.Ge Zhu, Fei Jiang, Zhiyao Duan
2020AAAIRL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement Learning.Nan Jiang, Sheng Jin, Zhiyao Duan, Changshui Zhang
2020CHIIRVroom!: A Search Engine for Sounds by Vocal Imitation Queries.Yichi Zhang, Junbo Hu, Yiting Zhang, Bryan Pardo, Zhiyao Duan
2020ICASSPEnd-To-End Generation of Talking Faces from Noisy Speech.Sefik Emre Eskimez, Ross K. Maddox, Chenliang Xu, Zhiyao Duan
2019CVPRHierarchical Cross-Modal Talking Face Generation With Dynamic Pixel-Wise Loss.Lele Chen, Ross K. Maddox, Zhiyao Duan, Chenliang Xu
2019CVPRSound to Visual: Hierarchical Cross-Modal Talking Face Generation.Lele Chen, Haitian Zheng, Ross K. Maddox, Zhiyao Duan, Chenliang Xu
2019CVPRAudio-Visual Event Localization in the Wild.Yapeng Tian, Jing Shi, Bochen Li, Zhiyao Duan, Chenliang Xu
2018ECCVLip Movements Generation at a Glance.Lele Chen, Zhiheng Li, Ross K. Maddox, Zhiyao Duan, Chenliang Xu
2018ECCVAudio-Visual Event Localization in Unconstrained Videos.Yapeng Tian, Jing Shi, Bochen Li, Zhiyao Duan, Chenliang Xu
2018ICASSPUnsupervised Learning Approach to Feature Analysis for Automatic Speech Emotion Recognition.Sefik Emre Eskimez, Zhiyao Duan, Wendi B. Heinzelman
2018ICASSPMulti-Scale Recurrent Neural Network for Sound Event Detection.Rui Lu, Zhiyao Duan, Changshui Zhang
2018ICASSPScore-Aligned Polyphonic Microtiming Estimation.Xueyang Wang, Ryan Stables, Bochen Li, Zhiyao Duan
2018ICASSPVisualization and Interpretation of Siamese Style Convolutional Neural Networks for Sound Search by Vocal Imitation.Yichi Zhang, Zhiyao Duan
2018ICASSPJoint Speaker Diarization and Recognition Using Convolutional and Recurrent Neural Networks.Zhihan Zhou, Yichi Zhang, Zhiyao Duan
2017ICASSPVisually informed multi-pitch analysis of string ensembles.Karthik Dinesh, Bochen Li, Xinzhao Liu, Zhiyao Duan, Gaurav Sharma
2017ICASSPSee and listen: Score-informed association of sound tracks to players in chamber music performance videos.Bochen Li, Karthik Dinesh, Zhiyao Duan, Gaurav Sharma
2017ICASSPDeep ranking: Triplet MatchNet for music metric learning.Rui Lu, Kailun Wu, Zhiyao Duan, Changshui Zhang
2016ICASSPEmotion classification: How does an automated system compare to Naive human coders?Sefik Emre Eskimez, Kenneth Imade, Na Yang, Melissa Sturge-Apple, Zhiyao Duan, Wendi B. Heinzelman
2016ICASSPIMISOUND: An unsupervised system for sound query by vocal imitation.Yichi Zhang, Zhiyao Duan
2016IJCAIWISE: Web-based Interactive Speech Emotion Classification.Sefik Emre Eskimez, Melissa Sturge-Apple, Zhiyao Duan, Wendi B. Heinzelman
2015ICASSPPiano music transcription modeling note temporal evolution.Andrea Cogliati, Zhiyao Duan
2014ICASSPA novel cepstral representation for timbre modeling of sound sources in polyphonic mixtures.Zhiyao Duan, Bryan Pardo, Laurent Daudet
2012InterspeechSpeech Enhancement by Online Non-negative Spectrogram Decomposition in Non-stationary Noise Environments.Zhiyao Duan, Gautham J. Mysore, Paris Smaragdis
2011ICASSPA state space model for online polyphonic audio-score alignment.Zhiyao Duan, Bryan Pardo
2010ICASSPSong-level multi-pitch tracking by heavily constrained clustering.Zhiyao Duan, Jinyu Han, Bryan Pardo