| 2025 | ICASSP | Effective Techniques for Scaling Audio Encoder Pretraining. | Byeonggeun Kim, Andrew Bydlon, Qingming Tang, Huy Phan, Chieh-Chi Kao, Tao Zhang, Chao Wang |
| 2025 | ICASSP | LHGNN: Local-Higher Order Graph Neural Networks For Audio Classification and Tagging. | Shubhr Singh, Emmanouil Benetos, Huy Phan, Dan Stowell |
| 2025 | ICML | IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling. | Kuan-Po Huang, Shu-Wen Yang, Huy Phan, Bo-Ru Lu, Byeonggeun Kim, Sashank Macha, Qingming Tang, Shalini Ghosh, Hung-yi Lee, Chieh-Chi Kao, Chao Wang |
| 2025 | ICML | Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction. | Shu-Wen Yang, Byeonggeun Kim, Kuan-Po Huang, Qingming Tang, Huy Phan, Bo-Ru Lu, Harshavardhan Sundar, Shalini Ghosh, Hung-yi Lee, Chieh-Chi Kao, Chao Wang |
| 2025 | WACV | Latent Diffusion Shield - Mitigating Malicious Use of Diffusion Models Through Latent Space Adversarial Perturbations. | Huy Phan, Boshi Huang, Ayush Jaiswal, Ekraam Sabir, Prateek Singhal, Bo Yuan |
| 2024 | CVPR | Improving the Robustness of 3D Human Pose Estimation: A Benchmark Dataset and Learning from Noisy Input. | Trung-Hieu Hoang, Mona Zehni, Huy Phan, Duc Minh Vo, Minh N. Do |
| 2024 | ECCV | Clean and Compact: Efficient Data-Free Backdoor Defense with Model Compactness. | Huy Phan, Jinqi Xiao, Yang Sui, Tianfang Zhang, Zijie Tang, Cong Shi, Yan Wang, Yingying Chen, Bo Yuan |
| 2024 | ICASSP | Learning from Taxonomy: Multi-Label Few-Shot Classification for Everyday Sound Recognition. | Jinhua Liang, Huy Phan, Emmanouil Benetos |
| 2024 | ICASSP | Cross-Triggering Issue in Audio Event Detection and Mitigation. | Huy Phan, Byeonggeun Kim, Vu Nguyen, Andrew Bydlon, Qingming Tang, Chieh-Chi Kao, Chao Wang |
| 2024 | INISTA | Hierarchical Tree-structured Knowledge Graph For Academic Insight Survey. | Jinghong Li, Huy Phan, Wen Gu, Koichi Ota, Shinobu Hasegawa |
| 2024 | MOBICOM | Inaudible Backdoor Attack via Stealthy Frequency Trigger Injection in Audio Spectrogram. | Tianfang Zhang, Huy Phan, Zijie Tang, Cong Shi, Yan Wang, Bo Yuan, Yingying Chen |
| 2024 | SMC | Fish-Bone Diagram of Research Issue: Gain a Bird's-Eye View on a Specific Research Topic. | Jinghong Li, Huy Phan, Wen Gu, Koichi Ota, Shinobu Hasegawa |
| 2023 | AAAI | CSTAR: Towards Compact and Structured Deep Neural Networks with Adversarial Robustness. | Huy Phan, Miao Yin, Yang Sui, Bo Yuan, Saman A. Zonouz |
| 2023 | ACII | Mutual Cross-Attention in Dyadic Fusion Networks for Audio-Video Emotion Recognition. | Jiachen Luo, Huy Phan, Lin Wang, Joshua D. Reiss |
| 2023 | ICASSP | Modelling Black-Box Audio Effects with Time-Varying Feature Modulation. | Marco Comunit, Christian J. Steinmetz, Huy Phan, Joshua D. Reiss |
| 2023 | ICASSP | Cross-Modal Fusion Techniques for Utterance-Level Emotion Recognition from Text and Speech. | Jiachen Luo, Huy Phan, Joshua D. Reiss |
| 2023 | ICASSP | Improving Automatic Sleep Staging Via Temporal Smoothness Regularization. | Huy Phan, Elisabeth R. M. Heremans, Oliver Y. Chn, Philipp Koch, Alfred Mertins, Maarten De Vos |
| 2023 | ICCCN | Stealthy Backdoor Attack on RF Signal Classification. | Tianming Zhao, Zijie Tang, Tianfang Zhang, Huy Phan, Yan Wang, Cong Shi, Bo Yuan, Yingying Chen |
| 2023 | Interspeech | Adapting Language-Audio Models as Few-Shot Audio Learners. | Jinhua Liang, Xubo Liu, Haohe Liu, Huy Phan, Emmanouil Benetos, Mark D. Plumbley, Wenwu Wang |
| 2023 | Interspeech | Fine-tuned RoBERTa Model with a CNN-LSTM Network for Conversational Emotion Recognition. | Jiachen Luo, Huy Phan, Joshua D. Reiss |
| 2023 | MMSP | An Inception-Residual-Based Architecture with Multi-Objective Loss for Detecting Respiratory Anomalies. | Dat Ngo, Lam Pham, Huy Phan, Minh Tran, Delaram Jarchi, Sefki Kolozali |
| 2023 | MMSys | Security-Preserving Live 3D Video Surveillance. | Zhongze Tang, Huy Phan, Xianglong Feng, Bo Yuan, Yao Liu, Sheng Wei |
| 2022 | AAAI | BATUDE: Budget-Aware Neural Network Compression Based on Tucker Decomposition. | Miao Yin, Huy Phan, Xiao Zang, Siyu Liao, Bo Yuan |
| 2022 | ECCV | RIBAC: Towards Robust and Imperceptible Backdoor Attack against Compact DNN. | Huy Phan, Cong Shi, Yi Xie, Tianfang Zhang, Zhuohang Li, Tianming Zhao, Jian Liu, Yan Wang, Yingying Chen, Bo Yuan |
| 2022 | ICASSP | SALSA-Lite: A Fast and Effective Feature for Polyphonic Sound Event Localization and Detection with Microphone Arrays. | Thi Ngoc Tho Nguyen, Douglas L. Jones, Karn N. Watcharasupat, Huy Phan, Woon-Seng Gan |
| 2022 | ICASSP | Polyphonic Audio Event Detection: Multi-Label or Multi-Class Multi-Task Classification Problem? | Huy Phan, Thi Ngoc Tho Nguyen, Philipp Koch, Alfred Mertins |
| 2022 | ICASSP | Invisible and Efficient Backdoor Attacks for Compressed Deep Neural Networks. | Huy Phan, Yi Xie, Jian Liu, Yingying Chen, Bo Yuan |
| 2022 | MMSys | Visual privacy protection in mobile image recognition using protective perturbation. | Mengmei Ye, Zhongze Tang, Huy Phan, Yi Xie, Bo Yuan, Sheng Wei |
| 2022 | MOBICOM | Audio-domain position-independent backdoor attack via unnoticeable triggers. | Cong Shi, Tianfang Zhang, Zhuohang Li, Huy Phan, Tianming Zhao, Yan Wang, Jian Liu, Bo Yuan, Yingying Chen |
| 2021 | ICASSP | A General Network Architecture for Sound Event Localization and Detection Using Transfer Learning and Recurrent Neural Network. | Thi Ngoc Tho Nguyen, Ngoc Khanh Nguyen, Huy Phan, Lam Pham, Kenneth Ooi, Douglas L. Jones, Woon-Seng Gan |
| 2021 | ICASSP | Self-Attention Generative Adversarial Network for Speech Enhancement. | Huy Phan, Huy Le Nguyen, Oliver Y. Chn, Philipp Koch, Ngoc Q. K. Duong, Ian McLoughlin, Alfred Mertins |
| 2021 | ICASSP | Multi-View Audio And Music Classification. | Huy Phan, Huy Le Nguyen, Oliver Y. Chn, Lam Dang Pham, Philipp Koch, Ian McLoughlin, Alfred Mertins |
| 2020 | AAAI | CAG: A Real-Time Low-Cost Enhanced-Robustness High-Transferability Content-Aware Adversarial Attack Generator. | Huy Phan, Yi Xie, Siyu Liao, Jie Chen, Bo Yuan |
| 2020 | IJCNN | Deep Feature Embedding and Hierarchical Classification for Audio Scene Classification. | Lam Dang Pham, Ian McLoughlin, Huy Phan, Ramaswamy Palaniappan, Alfred Mertins |
| 2019 | ICASSP | Forked Recurrent Neural Network for Hand Gesture Classification Using Inertial Measurement Data. | Philipp Koch, Nele Sophie Brgge, Huy Phan, Marco Maa, Alfred Mertins |
| 2019 | ICASSP | Unifying Isolated and Overlapping Audio Event Detection with Multi-label Multi-task Convolutional Recurrent Neural Networks. | Huy Phan, Oliver Y. Chn, Philipp Koch, Lam Dang Pham, Ian McLoughlin, Alfred Mertins, Maarten De Vos |
| 2019 | Interspeech | A Robust Framework for Acoustic Scene Classification. | Lam Dang Pham, Ian McLoughlin, Huy Phan, Ramaswamy Palaniappan |
| 2019 | Interspeech | Spatio-Temporal Attention Pooling for Audio Scene Classification. | Huy Phan, Oliver Y. Chn, Lam Dang Pham, Philipp Koch, Maarten De Vos, Ian McLoughlin, Alfred Mertins |
| 2018 | ICASSP | Weighted and Multi-Task Loss for Rare Audio Event Detection. | Huy Phan, Martin Krawczyk-Becker, Timo Gerkmann, Alfred Mertins |
| 2018 | ICASSP | Enabling Early Audio Event Detection with Neural Networks. | Huy Phan, Philipp Koch, Ian McLoughlin, Alfred Mertins |
| 2018 | IJCAI | Visualising convolutional neural network decisions in automated sleep scoring. | Fernando Andreotti, Huy Phan, Maarten De Vos |
| 2018 | Interspeech | Early Detection of Continuous and Partial Audio Events Using CNN. | Ian McLoughlin, Yan Song, Lam Dang Pham, Ramaswamy Palaniappan, Huy Phan, Yue Lang |
| 2017 | ICASSP | CNN-LTE: A class of 1-X pooling convolutional neural networks on label tree embeddings for audio scene classification. | Huy Phan, Philipp Koch, Lars Hertel, Marco Maa, Radoslaw Mazur, Alfred Mertins |
| 2017 | Interspeech | Audio Scene Classification with Deep Recurrent Neural Networks. | Huy Phan, Philipp Koch, Fabrice Katzberg, Marco Maa, Radoslaw Mazur, Alfred Mertins |
| 2016 | ICASSP | Learning compact structural representations for audio events using regressor banks. | Huy Phan, Marco Maa, Lars Hertel, Radoslaw Mazur, Ian McLoughlin, Alfred Mertins |
| 2016 | IJCNN | Comparing time and frequency domain for audio event recognition using deep learning. | Lars Hertel, Huy Phan, Alfred Mertins |
| 2016 | Interspeech | Robust Audio Event Recognition with 1-Max Pooling Convolutional Neural Networks. | Huy Phan, Lars Hertel, Marco Maa, Alfred Mertins |
| 2015 | ACIVS | Cosine-Sine Modulated Filter Banks for Motion Estimation and Correction. | Marco Maa, Huy Phan, Anita Mller, Alfred Mertins |
| 2015 | Interspeech | Representing nonspeech audio signals through speech classification models. | Huy Phan, Lars Hertel, Marco Maa, Radoslaw Mazur, Alfred Mertins |
| 2014 | Interspeech | Acoustic event detection and localization with regression forests. | Huy Phan, Marco Maa, Radoslaw Mazur, Alfred Mertins |
| 1995 | ICIP | Computationally efficient 3-D statistical reconstruction from digitized radiographs. | Huy Phan, Ken D. Sauer |