| 2026 | ACL | LLM-Codec: Neural Audio Codec Meets Language Model Objectives. | Ho-Lam Chung, Yiming Chen, Hung-Yi Lee |
| 2026 | ACL | CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks. | Hongchao Jiang, Yiming Chen, Yushi Cao, Hung-Yi Lee, Robby T. Tan |
| 2026 | ACL | Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner. | Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-Yi Lee |
| 2025 | ASRU | A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data. | Cheng-Kang Chou, Chan-Jan Hsu, Ho-Lam Chung, Liang-Hsuan Tseng, Hsi-Chun Cheng, Yu-Kuan Fu, Kuan-Po Huang, Hung-Yi Lee |
| 2025 | ASRU | A correlation-permutation approach for speech-music encoders model merging. | Fabian Ritter Gutierrez, Yi-Cheng Lin, Jeremy H. M. Wong, Hung-Yi Lee, Eng Siong Chng, Nancy F. Chen |
| 2025 | ASRU | ASTAR-NTU solution to AudioMOS Challenge 2025 Track1. | Fabian Ritter Gutierrez, Yi-Cheng Lin, Jui-Chiang Wei, Jeremy H. M. Wong, Nancy F. Chen, Hung-Yi Lee |
| 2025 | ASRU | SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition. | Ming-Hao Hsu, Hung-Yi Lee |
| 2025 | ASRU | Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding. | Tzu-Wen Hsu, Ke-Han Lu, Cheng-Han Chiang, Hung-Yi Lee |
| 2025 | ASRU | SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR. | Wei-Ping Huang, Guan-Ting Lin, Hung-Yi Lee |
| 2025 | ASRU | MMMOS: Multi-domain Multi-axis Audio Quality Assessment. | Yi-Cheng Lin, Jia-Hung Chen, Hung-Yi Lee |
| 2025 | ASRU | EMO-Debias: Benchmarking Gender Debiasing Techniques in Multi-Label Speech Emotion Recognition. | Yi-Cheng Lin, Huang-Cheng Chou, Yu-Hsuan Li Liang, Hung-Yi Lee |
| 2025 | ASRU | Full-Duplex-Bench: A Benchmark to Evaluate Full-Duplex Spoken Dialogue Models on Turn-taking Capabilities. | Guan-Ting Lin, Jiachen Lian, Tingle Li, Qirui Wang, Gopala Anumanchipalli, Alexander H. Liu, Hung-Yi Lee |
| 2025 | ASRU | Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers. | Tzu-Quan Lin, Tsung-Huan Yang, Chun-Yao Chang, Kuang-Ming Chen, Tzu-hsun Feng, Hung-Yi Lee, Hao Tang |
| 2025 | ASRU | HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment. | Wenze Ren, Yi-Cheng Lin, Wen-Chin Huang, Ryandhimas E. Zezario, Szu-Wei Fu, Sung-Feng Huang, Erica Cooper, Haibin Wu, Hung-Yu Wei, Hsin-Min Wang, Hung-Yi Lee, Yu Tsao |
| 2025 | ASRU | CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition. | Yun-Shao Tsai, Yi-Cheng Lin, Huang-Cheng Chou, Hung-Yi Lee |
| 2025 | ASRU | Multi-Distillation from Speech and Music Representation Models. | Jui-Chiang Wei, Yi-Cheng Lin, Fabian Ritter-Gutierrez, Hung-Yi Lee |
| 2025 | ASRU | AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models. | Chih-Kai Yang, Neo Ho, Yi-Jyun Lee, Hung-Yi Lee |
| 2025 | ICASSP | Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling. | Shao-Syuan Huang, Kuan-Po Huang, Andy T. Liu, Hung-Yi Lee |
| 2025 | ICASSP | SpeechCaps: Advancing Instruction-Based Universal Speech Models with Multi-Talker Speaking Style Captioning. | Chien-Yu Huang, Min-Han Shih, Ke-Han Lu, Chi-Yuan Hsiao, Hung-Yi Lee |
| 2025 | ICASSP | Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning. | Chun-Yi Kuan, Hung-Yi Lee |
| 2025 | ICASSP | Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data. | Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-Yi Lee |
| 2024 | ICASSP | Multimodal Transformer Distillation for Audio-Visual Synchronization. | Xuanjun Chen, Haibin Wu, Chung-Che Wang, Hung-Yi Lee, Jyh-Shing Roger Jang |
| 2024 | ICASSP | Towards ASR Robust Spoken Language Understanding Through in-Context Learning with Word Confusion Networks. | Kevin Everson, Yile Gu, Chao-Han Huck Yang, Prashanth Gurunath Shivakumar, Guan-Ting Lin, Jari Kolehmainen, Ivan Bulyko, Ankur Gandhe, Shalini Ghosh, Wael Hamza, Hung-Yi Lee, Ariya Rastrow, Andreas Stolcke |
| 2024 | ICASSP | Integrating Self-Supervised Speech Model with Pseudo Word-Level Targets from Visually-Grounded Speech Model. | Hung-Chieh Fang, Nai-Xuan Ye, Yi-Jen Shih, Puyuan Peng, Hsuan-Fu Wang, Layne Berry, Hung-Yi Lee, David Harwath |
| 2024 | ICASSP | Noise Robust Distillation of Self-Supervised Speech Models via Correlation Metrics. | Fabian Ritter Gutierrez, Kuan-Po Huang, Dianwen Ng, Jeremy H. M. Wong, Hung-Yi Lee, Eng Siong Chng, Nancy F. Chen |
| 2024 | ICASSP | Dynamic-Superb: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark For Speech. | Chien-Yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao, Chun-Yi Kuan, Haibin Wu, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan S. Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-Yi Lee |
| 2024 | ICASSP | Zero Resource Code-Switched Speech Benchmark Using Speech Utterance Pairs for Multiple Spoken Languages. | Kuan-Po Huang, Chih-Kai Yang, Yu-Kuan Fu, Ewan Dunbar, Hung-Yi Lee |
| 2024 | ICASSP | SpeechDPR: End-To-End Spoken Passage Retrieval For Open-Domain Spoken Question Answering. | Chyi-Jiunn Lin, Guan-Ting Lin, Yung-Sung Chuang, Wei-Lun Wu, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Lin-Shan Lee |
| 2024 | ICASSP | Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue. | Guan-Ting Lin, Prashanth Gurunath Shivakumar, Ankur Gandhe, Chao-Han Huck Yang, Yile Gu, Shalini Ghosh, Andreas Stolcke, Hung-Yi Lee, Ivan Bulyko |
| 2024 | ICASSP | PEFT for Speech: Unveiling Optimal Placement, Merging Strategies, and Ensemble Techniques. | Tzu-Han Lin, How-Shing Wang, Hao-Yung Weng, Kuang-Chen Peng, Zih-Ching Chen, Hung-Yi Lee |
| 2024 | ICASSP | AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models. | Yuan Tseng, Layne Berry, Yiting Chen, I-Hsiang Chiu, Hsuan-Hao Lin, Max Liu, Puyuan Peng, Yi-Jen Shih, Hung-Yu Wang, Haibin Wu, Poyao Huang, Chun-Mao Lai, Shang-Wen Li, David Harwath, Yu Tsao, Abdelrahman Mohamed, Chi-Luen Feng, Hung-Yi Lee |
| 2024 | ICASSP | SpeechCLIP+: Self-Supervised Multi-Task Representation Learning for Speech Via Clip and Speech-Image Data. | Hsuan-Fu Wang, Yi-Jen Shih, Heng-Jui Chang, Layne Berry, Puyuan Peng, Hung-Yi Lee, Hsin-Min Wang, David Harwath |
| 2024 | ICASSP | Scalable Ensemble-Based Detection Method Against Adversarial Attacks For Speaker Verification. | Haibin Wu, Heng-Cheng Kuo, Yu Tsao, Hung-Yi Lee |
| 2024 | ICASSP | Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR And Speech-to-Text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision. | Chih-Kai Yang, Kuan-Po Huang, Ke-Han Lu, Chun-Yi Kuan, Chi-Yuan Hsiao, Hung-Yi Lee |
| 2023 | ASRU | Prompting and Adapter Tuning For Self-Supervised Encoder-Decoder Speech Model. | Kai-Wei Chang, Ming-Hsin Chen, Yun-Ping Lin, Jing Neng Hsu, Paul Kuo-Ming Huang, Chien-Yu Huang, Shang-Wen Li, Hung-Yi Lee |
| 2023 | ASRU | Maximizing Data Efficiency for Cross-Lingual TTS Adaptation by Self-Supervised Representation Mixing and Embedding Initialization. | Wei-Ping Huang, Sung-Feng Huang, Hung-Yi Lee |
| 2023 | ASRU | Towards General-Purpose Text-Instruction-Guided Voice Conversion. | Chun-Yi Kuan, Chen-An Li, Tsu-Yuan Hsu, Tse-Yang Lin, Ho-Lam Chung, Kai-Wei Chang, Shuo-Yiin Chang, Hung-Yi Lee |
| 2023 | ASRU | MelHuBERT: A Simplified Hubert on Mel Spectrograms. | Tzu-Quan Lin, Hung-Yi Lee, Hao Tang |
| 2023 | ASRU | Findings of the 2023 ML-Superb Challenge: Pre-Training And Evaluation Over More Languages And Beyond. | Jiatong Shi, William Chen, Dan Berrebbi, Hsiu-Hsuan Wang, Wei-Ping Huang, En-Pei Hu, Ho-Lam Chuang, Xuankai Chang, Yuxun Tang, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Shinji Watanabe |
| 2023 | ASRU | Minisuperb: Lightweight Benchmark for Self-Supervised Speech Models. | Yu-Hsiang Wang, Huang-Yu Chen, Kai-Wei Chang, Winston H. Hsu, Hung-Yi Lee |
| 2023 | ASRU | Zero-Shot Singing Voice Synthesis from Musical Score. | Jun-You Wang, Hung-Yi Lee, Jyh-Shing Roger Jang, Li Su |
| 2023 | ICASSP | M-SpeechCLIP: Leveraging Large-Scale, Pre-Trained Models for Multilingual Speech to Image Retrieval. | Layne Berry, Yi-Jen Shih, Hsuan-Fu Wang, Heng-Jui Chang, Hung-Yi Lee, David Harwath |
| 2023 | ICASSP | Chapter: Exploiting Convolutional Neural Network Adapters for Self-Supervised Speech Models. | Zih-Ching Chen, Yu-Shun Sung, Hung-Yi Lee |
| 2023 | ICASSP | Euro: Espnet Unsupervised ASR Open-Source Toolkit. | Dongji Gao, Jiatong Shi, Shun-Po Chuang, Leibny Paola Garca, Hung-Yi Lee, Shinji Watanabe, Sanjeev Khudanpur |
| 2023 | ICASSP | T5lephone: Bridging Speech and Text Self-Supervised Models for Spoken Language Understanding Via Phoneme Level T5. | Chan-Jan Hsu, Ho-Lam Chung, Hung-Yi Lee, Yu Tsao |
| 2023 | ICASSP | Personalized Lightweight Text-to-Speech: Voice Cloning with Adaptive Structured Pruning. | Sung-Feng Huang, Chia-Ping Chen, Zhi-Sheng Chen, Yu-Pao Tsai, Hung-Yi Lee |
| 2023 | ICASSP | Ensemble Knowledge Distillation of Self-Supervised Speech Models. | Kuan-Po Huang, Tzu-hsun Feng, Yu-Kuan Fu, Tsu-Yuan Hsu, Po-Chieh Yen, Wei-Cheng Tseng, Kai-Wei Chang, Hung-Yi Lee |
| 2023 | ICASSP | Bridging Speech and Textual Pre-Trained Models With Unsupervised ASR. | Jiatong Shi, Chan-Jan Hsu, Ho-Lam Chung, Dongji Gao, Paola Garca, Shinji Watanabe, Ann Lee, Hung-Yi Lee |
| 2023 | ICASSP | Cascading and Direct Approaches to Unsupervised Constituency Parsing on Spoken Sentences. | Yuan Tseng, Cheng-I Jeff Lai, Hung-Yi Lee |
| 2023 | ICML | Hierarchical Programmatic Reinforcement Learning via Learning to Compose Programs. | Guan-Ting Liu, En-Pei Hu, Pu-Jen Cheng, Hung-Yi Lee, Shao-Hua Sun |
| 2022 | AAAI | On the Transferability of Pre-trained Language Models: A Study from Artificial Datasets. | David Cheng-Han Chiang, Hung-Yi Lee |
| 2022 | ICASSP | Toward Degradation-Robust Voice Conversion. | Chien-yu Huang, Kai-Wei Chang, Hung-Yi Lee |
| 2022 | ICASSP | S3PRL-VC: Open-Source Voice Conversion Framework with Self-Supervised Speech Representations. | Wen-Chin Huang, Shu-Wen Yang, Tomoki Hayashi, Hung-Yi Lee, Shinji Watanabe, Tomoki Toda |
| 2022 | ICASSP | Analyzing The Robustness of Unsupervised Speech Recognition. | Guan-Ting Lin, Chan-Jan Hsu, Da-Rong Liu, Hung-Yi Lee, Yu Tsao |
| 2022 | ICASSP | Adversarial Sample Detection for Speaker Verification by Neural Vocoders. | Haibin Wu, Po-Chun Hsu, Ji Gao, Shanshan Zhang, Shen Huang, Jian Kang, Zhiyong Wu, Helen Meng, Hung-Yi Lee |
| 2022 | ICASSP | Partially Fake Audio Detection by Self-Attention-Based Fake Span Discovery. | Haibin Wu, Heng-Cheng Kuo, Naijun Zheng, Kuo-Hsuan Hung, Hung-Yi Lee, Yu Tsao, Hsin-Min Wang, Helen Meng |
| 2022 | ICASSP | Characterizing the Adversarial Vulnerability of Speech self-Supervised Learning. | Haibin Wu, Bo Zheng, Xu Li, Xixin Wu, Hung-Yi Lee, Helen Meng |
| 2021 | ICASSP | Semi-Supervised Spoken Language Understanding via Self-Supervised Speech and Language Model Pretraining. | Cheng-I Lai, Yung-Sung Chuang, Hung-Yi Lee, Shang-Wen Li, James R. Glass |
| 2020 | ICASSP | Self-Supervised Deep Learning for Fisheye Image Rectification. | Chun-Hao Chao, Pin-Lun Hsu, Hung-Yi Lee, Yu-Chiang Frank Wang |
| 2020 | ICASSP | One-Shot Voice Conversion by Vector Quantization. | Da-Yi Wu, Hung-Yi Lee |
| 2020 | ICLR | LAMOL: LAnguage MOdeling for Lifelong Language Learning. | Fan-Keng Sun, Cheng-Hao Ho, Hung-Yi Lee |