| 2026 | ACL | ReMedi: Reasoner for Medical Clinical Prediction. | Yushi Cao, Yiming Chen, Hongchao Jiang, Hung-yi Lee, Robby T. Tan |
| 2026 | ACL | Shanks: Simultaneous Hearing and Thinking for Spoken Language Models. | Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang |
| 2026 | ACL | On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation. | Chan-Jan Hsu, Liang-Hsuan Tseng, Yi-Cheng Lin, Yen-Chun Kuo, Ju-Chieh Chou, Kai-Wei Chang, Hung-yi Lee, Carlos Busso |
| 2026 | ACL | Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models. | Yu-Xiang Lin, Cheng-Han Chiang, Hung-yi Lee |
| 2026 | ACL | An Exploration of Mamba for Speech Self-Supervised Models. | Tzu-Quan Lin, Heng-Cheng Kuo, Tzu-Chieh Wei, Hsi-Chun Cheng, Chun Wei Chen, Hsien-Fu Hsiao, Yu Tsao, Hung-yi Lee |
| 2026 | ACL | Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition. | Yi-Cheng Lin, Yu-Hsuan Li Liang, Hsuan Su, Tzu-Quan Lin, Shang-Tse Chen, Yun-Nung Chen, Hung-yi Lee |
| 2026 | EACL | BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation. | Tsung-Min Pai, Jui-I Wang, Li-Chun Lu, Shao-Hua Sun, Hung-yi Lee, Kai-Wei Chang |
| 2025 | ACL | TRACT: Regression-Aware Fine-tuning Meets Chain-of-Thought Reasoning for LLM-as-a-Judge. | Cheng-Han Chiang, Hung-yi Lee, Michal Lukasik |
| 2025 | ACL | Transferring Textual Preferences to Vision-Language Understanding through Model Merging. | Chen-An Li, Tzu-Han Lin, Yun-Nung Chen, Hung-yi Lee |
| 2025 | ACL | Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback. | Guan-Ting Lin, Prashanth Gurunath Shivakumar, Aditya Gourav, Yile Gu, Ankur Gandhe, Hung-yi Lee, Ivan Bulyko |
| 2025 | ASRU | Towards Generalized Source Tracing for Codec-Based Deepfake Speech. | I-Ming Lin, Xuanjun Chen, Lin Zhang, Haibin Wu, Hung-yi Lee, Jyh-Shing Roger Jang |
| 2025 | EMNLP | Audio-Aware Large Language Models as Judges for Speaking Styles. | Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang |
| 2025 | EMNLP | Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Merging. | Hua Farn, Hsuan Su, Shachi H. Kumar, Saurav Sahay, Shang-Tse Chen, Hung-yi Lee |
| 2025 | EMNLP | Creativity in LLM-based Multi-Agent Systems: A Survey. | Yi-Cheng Lin, Kang-Chieh Chen, Zhe-Yan Li, Tzu-Heng Wu, Tzu-Hsuan Wu, Kuan-Yu Chen, Hung-yi Lee, Yun-Nung Chen |
| 2025 | EMNLP | Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey. | Chih-Kai Yang, Neo S. Ho, Hung-yi Lee |
| 2025 | ICASSP | Spectral-Aware Low-Rank Adaptation for Speaker Verification. | Zhe Li, Man-Wai Mak, Mert Pilanci, Hung-yi Lee, Helen Meng |
| 2025 | ICASSP | Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection. | Hsi-Che Lin, Yi-Cheng Lin, Huang-Cheng Chou, Hung-yi Lee |
| 2025 | ICML | IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling. | Kuan-Po Huang, Shu-Wen Yang, Huy Phan, Bo-Ru Lu, Byeonggeun Kim, Sashank Macha, Qingming Tang, Shalini Ghosh, Hung-yi Lee, Chieh-Chi Kao, Chao Wang |
| 2025 | ICML | Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction. | Shu-Wen Yang, Byeonggeun Kim, Kuan-Po Huang, Qingming Tang, Huy Phan, Bo-Ru Lu, Harshavardhan Sundar, Shalini Ghosh, Hung-yi Lee, Chieh-Chi Kao, Chao Wang |
| 2025 | Interspeech | Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy. | Xuanjun Chen, I-Ming Lin, Lin Zhang, Jiawei Du, Haibin Wu, Hung-yi Lee, Jyh-Shing Roger Jang |
| 2025 | Interspeech | The ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties. | William Chen, Chutong Meng, Jiatong Shi, Martijn Bartelds, Shih-Heng Wang, Hsiu-Hsuan Wang, Rafael Mosquera, Sara Hincapie, Dan Jurafsky, Antonis Anastasopoulos, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2025 | Interspeech | Meta-PerSER: Few-Shot Listener Personalized Speech Emotion Recognition via Meta-learning. | Shi-Xin Fang, Liang-Yeh Shen, Yi-Cheng Lin, Huang-Cheng Chou, Hung-yi Lee |
| 2025 | Interspeech | Distilling a speech and music encoder with task arithmetic. | Fabian Ritter Gutierrez, Yi-Cheng Lin, Jui-Chiang Wei, Jeremy H. M. Wong, Eng Siong Chng, Nancy F. Chen, Hung-yi Lee |
| 2025 | Interspeech | Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models. | Chi-Yuan Hsiao, Ke-Han Lu, Kai-Wei Chang, Chih-Kai Yang, Wei-Chih Chen, Hung-yi Lee |
| 2025 | Interspeech | VoiceNoNG: Robust High-Quality Speech Editing Model without Hallucinations. | Sung-Feng Huang, Heng-Cheng Kuo, Zhehuai Chen, Xuesong Yang, Pin-Jui Ku, Ante Jukic, Huck Yang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee, Szu-Wei Fu |
| 2025 | Interspeech | Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples. | Chun-Yi Kuan, Hung-yi Lee |
| 2025 | Interspeech | Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach. | Yi-Cheng Lin, Huang-Cheng Chou, Hung-yi Lee |
| 2025 | Interspeech | Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models. | Ke-Han Lu, Chun-Yi Kuan, Hung-yi Lee |
| 2025 | Interspeech | ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality. | Yu-Xiang Luo, Yi-Cheng Lin, Ming-To Chuang, Jia-Hung Chen, I-Ning Tsai, Pei Xing Kiew, Yueh-Hsuan Huang, Chien-Feng Liu, Yu-Chen Chen, Bo-Han Feng, Wenze Ren, Hung-yi Lee |
| 2025 | Interspeech | SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information. | Chih-Kai Yang, Neo Ho, Yen-Ting Piao, Hung-yi Lee |
| 2025 | NAACL | Gender Bias in Instruction-Guided Speech Synthesis Models. | Chun-Yi Kuan, Hung-yi Lee |
| 2025 | NAACL | Hierarchical Speculative Decoding with Dynamic Window. | Shensian Syu, Hung-yi Lee |
| 2024 | ACL | On the Evaluation of Speech Foundation Models for Spoken Language Understanding. | Siddhant Arora, Ankita Pasad, Chung-Ming Chien, Jionghao Han, Roshan S. Sharma, Jee-weon Jung, Hira Dhamyal, William Chen, Suwon Shon, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2024 | ACL | Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form Generations. | Cheng-Han Chiang, Hung-yi Lee |
| 2024 | ACL | Chat Vector: A Simple Approach to Equip LLMs with Instruction Following and Model Alignment in New Languages. | Shih-Cheng Huang, Pin-Zu Li, Yu-Chi Hsu, Kuang-Ming Chen, Yu-Tung Lin, Shih-Kai Hsiao, Richard Tzong-Han Tsai, Hung-yi Lee |
| 2024 | ACL | Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations. | Guan-Ting Lin, Cheng-Han Chiang, Hung-yi Lee |
| 2024 | ACL | Codec-SUPERB: An In-Depth Analysis of Sound Codec Models. | Haibin Wu, Ho-Lam Chung, Yi-Cheng Lin, Yuan-Kuei Wu, Xuanjun Chen, Yu-Chi Pai, Hsiu-Hsuan Wang, Kai-Wei Chang, Alexander H. Liu, Hung-yi Lee |
| 2024 | EACL | Over-Reasoning and Redundant Calculation of Large Language Models. | Cheng-Han Chiang, Hung-yi Lee |
| 2024 | EMNLP | Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student Course. | Cheng-Han Chiang, Wei-Chih Chen, Chun-Yi Kuan, Chienchou Yang, Hung-yi Lee |
| 2024 | EMNLP | Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech. | Guan-Ting Lin, Wei Huang, Hung-yi Lee |
| 2024 | EMNLP | Can LLMs Understand the Implication of Emphasized Sentences in Dialogue? | Guan-Ting Lin, Hung-yi Lee |
| 2024 | EMNLP | DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging. | Tzu-Han Lin, Chen-An Li, Hung-yi Lee, Yun-Nung Chen |
| 2024 | EMNLP | Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition. | Hsuan Su, Hua Farn, Fan-Yun Sun, Shang-Tse Chen, Hung-yi Lee |
| 2024 | EMNLP | Unveiling Narrative Reasoning Limits of Large Language Models with Trope in Movie Synopses. | Hung-Ting Su, Ya-Ching Hsu, Xudong Lin, Xiang Qian Shi, Yulei Niu, Han-Yuan Hsu, Hung-yi Lee, Winston H. Hsu |
| 2024 | EMNLP | Let Me Speak Freely? A Study On The Impact Of Format Restrictions On Large Language Model Performance. | Zhi Rui Tam, Cheng-Kuang Wu, Yi-Lin Tsai, Chieh-Yen Lin, Hung-yi Lee, Yun-Nung Chen |
| 2024 | EMNLP | I Need Help! Evaluating LLM's Ability to Ask for Users' Support: A Case Study on Text-to-SQL Generation. | Cheng-Kuang Wu, Zhi Rui Tam, Chao-Chung Wu, Chieh-Yen Lin, Hung-yi Lee, Yun-Nung Chen |
| 2024 | Interspeech | Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks. | Kai-Wei Chang, Ming-Hao Hsu, Shang-Wen Li, Hung-yi Lee |
| 2024 | Interspeech | Neural Codec-based Adversarial Sample Detection for Speaker Verification. | Xuanjun Chen, Jiawei Du, Haibin Wu, Jyh-Shing Roger Jang, Hung-yi Lee |
| 2024 | Interspeech | Singing Voice Graph Modeling for SingFake Detection. | Xuanjun Chen, Haibin Wu, Roger Jang, Hung-yi Lee |
| 2024 | Interspeech | Dataset-Distillation Generative Model for Speech Emotion Recognition. | Fabian Ritter Gutierrez, Kuan-Po Huang, Jeremy H. M. Wong, Dianwen Ng, Hung-yi Lee, Nancy F. Chen, Eng Siong Chng |
| 2024 | Interspeech | Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models. | Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee |
| 2024 | Interspeech | Parameter-efficient Fine-tuning of Speaker-Aware Dynamic Prompts for Speaker Verification. | Zhe Li, Man-Wai Mak, Hung-yi Lee, Helen Meng |
| 2024 | Interspeech | DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models. | Tzu-Quan Lin, Hung-yi Lee, Hao Tang |
| 2024 | Interspeech | On the social bias of speech self-supervised models. | Yi-Cheng Lin, Tzu-Quan Lin, Hsi-Che Lin, Andy T. Liu, Hung-yi Lee |
| 2024 | Interspeech | Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition. | Yi-Cheng Lin, Haibin Wu, Huang-Cheng Chou, Chi-Chun Lee, Hung-yi Lee |
| 2024 | Interspeech | DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment. | Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, He Huang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee |
| 2024 | Interspeech | GSQA: An End-to-End Model for Generative Spoken Question Answering. | Min-Han Shih, Ho-Lam Chung, Yu-Chi Pai, Ming-Hao Hsu, Guan-Ting Lin, Shang-Wen Li, Hung-yi Lee |
| 2024 | Interspeech | ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets. | Jiatong Shi, Shih-Heng Wang, William Chen, Martijn Bartelds, Vanya Bannihatti Kumar, Jinchuan Tian, Xuankai Chang, Dan Jurafsky, Karen Livescu, Hung-yi Lee, Shinji Watanabe |
| 2024 | Interspeech | CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems. | Haibin Wu, Yuan Tseng, Hung-yi Lee |
| 2024 | NAACL | Systematic Analysis for Pretrained Language Model Priming for Parameter-Efficient Fine-tuning. | Shih-Cheng Huang, Shih-Heng Wang, Min-Han Shih, Saurav Sahay, Hung-yi Lee |
| 2023 | ACL | Can Large Language Models Be an Alternative to Human Evaluations? | David Cheng-Han Chiang, Hung-yi Lee |
| 2023 | ACL | Are Synonym Substitution Attacks Really Synonym Substitution Attacks? | David Cheng-Han Chiang, Hung-yi Lee |
| 2023 | ACL | SLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding Tasks. | Suwon Shon, Siddhant Arora, Chyi-Jiunn Lin, Ankita Pasad, Felix Wu, Roshan S. Sharma, Wei-Lun Wu, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2023 | ACL | Introducing Semantics into Speech Encoders. | Derek Xu, Shuyan Dong, Changhan Wang, Suyoun Kim, Zhaojiang Lin, Bing Liu, Akshat Shrivastava, Shang-Wen Li, Liang-Hsuan Tseng, Guan-Ting Lin, Alexei Baevski, Hung-yi Lee, Yizhou Sun, Wei Wang |
| 2023 | EMNLP | A Closer Look into Using Large Language Models for Automatic Evaluation. | David Cheng-Han Chiang, Hung-yi Lee |
| 2023 | ICASSP | Once-for-All Sequence Compression for Self-Supervised Speech Models. | Hsuan-Jui Chen, Yen Meng, Hung-yi Lee |
| 2023 | Interspeech | How to Estimate Model Transferability of Pre-Trained Speech Models? | Zih-Ching Chen, Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Shuo-Yiin Chang, Rohit Prabhavalkar, Hung-yi Lee, Tara N. Sainath |
| 2023 | Interspeech | Why We Should Report the Details in Subjective Evaluation of TTS More Rigorously. | Cheng-Han Chiang, Wei-Ping Huang, Hung-yi Lee |
| 2023 | Interspeech | ML-SUPERB: Multilingual Speech Universal PERformance Benchmark. | Jiatong Shi, Dan Berrebbi, William Chen, En-Pei Hu, Wei-Ping Huang, Ho-Lam Chung, Xuankai Chang, Shang-Wen Li, Abdelrahman Mohamed, Hung-yi Lee, Shinji Watanabe |
| 2023 | Interspeech | Improving Textless Spoken Language Understanding with Discrete Units as Intermediate Target. | Guan-Wei Wu, Guan-Ting Lin, Shang-Wen Li, Hung-yi Lee |
| 2022 | ACL | XDBERT: Distilling Visual Information to BERT from Cross-Modal Systems to Improve Language Understanding. | Chan-Jan Hsu, Hung-yi Lee, Yu Tsao |
| 2022 | ACL | SUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities. | Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang, Zili Huang, Kushal Lakhotia, Shu-Wen Yang, Shuyan Dong, Andy T. Liu, Cheng-I Lai, Jiatong Shi, Xuankai Chang, Phil Hall, Hsuan-Jui Chen, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee |
| 2022 | ICASSP | Distilhubert: Speech Representation Learning by Layer-Wise Distillation of Hidden-Unit Bert. | Heng-Jui Chang, Shu-Wen Yang, Hung-yi Lee |
| 2022 | ICASSP | Don't Speak Too Fast: The Impact of Data Bias on Self-Supervised Speech Models. | Yen Meng, Yi-Hui Chou, Andy T. Liu, Hung-yi Lee |
| 2022 | Interspeech | Exploring Continuous Integrate-and-Fire for Adaptive Simultaneous Speech Translation. | Chih-Chiang Chang, Hung-yi Lee |
| 2022 | Interspeech | An Exploration of Prompt Tuning on Generative Spoken Language Model for Speech Processing Tasks. | Kai-Wei Chang, Wei-Cheng Tseng, Shang-Wen Li, Hung-yi Lee |
| 2022 | Interspeech | Few Shot Cross-Lingual TTS Using Transferable Phoneme Embedding. | Wei-Ping Huang, Po-Chun Chen, Sung-Feng Huang, Hung-yi Lee |
| 2022 | Interspeech | Improving Distortion Robustness of Self-supervised Speech Processing Tasks with Domain Adaptation. | Kuan-Po Huang, Yu-Kuan Fu, Yu Zhang, Hung-yi Lee |
| 2022 | Interspeech | Listen, Adapt, Better WER: Source-free Single-utterance Test-time Adaptation for Automatic Speech Recognition. | Guan-Ting Lin, Shang-Wen Li, Hung-yi Lee |
| 2022 | Interspeech | DUAL: Discrete Spoken Unit Adaptive Learning for Textless Spoken Question Answering. | Guan-Ting Lin, Yung-Sung Chuang, Ho-Lam Chung, Shu-Wen Yang, Hsuan-Jui Chen, Shuyan Annie Dong, Shang-Wen Li, Abdelrahman Mohamed, Hung-yi Lee, Lin-Shan Lee |
| 2022 | Interspeech | DDOS: A MOS Prediction Framework utilizing Domain Adaptive Pre-training and Distribution of Opinion Scores. | Wei-Cheng Tseng, Wei-Tsung Kao, Hung-yi Lee |
| 2022 | Interspeech | Membership Inference Attacks Against Self-supervised Speech Models. | Wei-Cheng Tseng, Wei-Tsung Kao, Hung-yi Lee |
| 2022 | Interspeech | Spoofing-Aware Speaker Verification by Multi-Level Fusion. | Haibin Wu, Lingwei Meng, Jiawen Kang, Jinchao Li, Xu Li, Xixin Wu, Hung-yi Lee, Helen Meng |
| 2022 | Interspeech | MFA-Conformer: Multi-scale Feature Aggregation Conformer for Automatic Speaker Verification. | Yang Zhang, Zhiqiang Lv, Haibin Wu, Shanshan Zhang, Pengfei Hu, Zhiyong Wu, Hung-yi Lee, Helen Meng |
| 2022 | NAACL | AdapterBias: Parameter-efficient Token-dependent Representation Shift for Adapters in NLP Tasks. | Chin-Lun Fu, Zih-Ching Chen, Yun-Ru Lee, Hung-yi Lee |
| 2022 | NAACL | Meta Learning for Natural Language Processing: A Survey. | Hung-yi Lee, Shang-Wen Li, Thang Vu |
| 2021 | AAAI | Multi-modal User Intent Classification Under the Scenario of Smart Factory (Student Abstract). | Yu-Ching Chiu, Bo-Hao Chang, Tzu-Yu Chen, Cheng-Fu Yang, Nanyi Bi, Richard Tzong-Han Tsai, Hung-yi Lee, Jane Yung-jen Hsu |
| 2021 | ACL | Investigating the Reordering Capability in CTC-based Non-Autoregressive End-to-End Speech Translation. | Shun-Po Chuang, Yung-Sung Chuang, Chih-Chiang Chang, Hung-yi Lee |
| 2021 | ASRU | An Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition. | Xuankai Chang, Takashi Maekaku, Pengcheng Guo, Jing Shi, Yen-Ju Lu, Aswin Shanmugam Subramanian, Tianzi Wang, Shu-Wen Yang, Yu Tsao, Hung-yi Lee, Shinji Watanabe |
| 2021 | ASRU | Non-Autoregressive Mandarin-English Code-Switching Speech Recognition. | Shun-Po Chuang, Heng-Jui Chang, Sung-Feng Huang, Hung-yi Lee |
| 2021 | EMNLP | Is BERT a Cross-Disciplinary Knowledge Learner? A Surprising Finding of Pre-trained Models' Transferability. | Wei-Tsung Kao, Hung-yi Lee |
| 2021 | ICASSP | Again-VC: A One-Shot Voice Conversion Using Activation Guidance and Adaptive Instance Normalization. | Yen-Hao Chen, Da-Yi Wu, Tsung-Han Wu, Hung-yi Lee |
| 2021 | ICASSP | Investigating on Incorporating Pretrained and Learnable Speaker Representations for Multi-Speaker Multi-Style Text-to-Speech. | Chung-Ming Chien, Jheng-Hao Lin, Chien-yu Huang, Po-Chun Hsu, Hung-yi Lee |
| 2021 | ICASSP | Fragmentvc: Any-To-Any Voice Conversion by End-To-End Extracting and Fusing Fine-Grained Voice Fragments with Attention. | Yist Y. Lin, Chung-Ming Chien, Jheng-Hao Lin, Hung-yi Lee, Lin-Shan Lee |
| 2021 | ICASSP | One Shot Learning for Speech Separation. | Yuan-Kuei Wu, Kuan-Po Huang, Yu Tsao, Hung-yi Lee |
| 2021 | ICASSP | Adversarial Defense for Automatic Speaker Verification by Cascaded Self-Supervised Learning Models. | Haibin Wu, Xu Li, Andy T. Liu, Zhiyong Wu, Helen Meng, Hung-yi Lee |
| 2021 | Interspeech | Towards Lifelong Learning of End-to-End ASR. | Heng-Jui Chang, Hung-yi Lee, Lin-Shan Lee |
| 2021 | Interspeech | Stabilizing Label Assignment for Speech Separation by Self-Supervised Pre-Training. | Sung-Feng Huang, Shun-Po Chuang, Da-Rong Liu, Yi-Chen Chen, Gene-Ping Yang, Hung-yi Lee |
| 2021 | Interspeech | S2VC: A Framework for Any-to-Any Voice Conversion with Self-Supervised Pretrained Representations. | Jheng-Hao Lin, Yist Y. Lin, Chung-Ming Chien, Hung-yi Lee |
| 2021 | Interspeech | Utilizing Self-Supervised Representations for MOS Prediction. | Wei-Cheng Tseng, Chien-yu Huang, Wei-Tsung Kao, Yist Y. Lin, Hung-yi Lee |
| 2021 | Interspeech | Auto-KWS 2021 Challenge: Task, Datasets, and Baselines. | Jingsong Wang, Yuxuan He, Chunyu Zhao, Qijie Shao, Wei-Wei Tu, Tom Ko, Hung-yi Lee, Lei Xie |
| 2021 | Interspeech | Voting for the Right Answer: Adversarial Defense for Speaker Verification. | Haibin Wu, Yang Zhang, Zhiyong Wu, Dong Wang, Hung-yi Lee |
| 2021 | Interspeech | SUPERB: Speech Processing Universal PERformance Benchmark. | Shu-Wen Yang, Po-Han Chi, Yung-Sung Chuang, Cheng-I Jeff Lai, Kushal Lakhotia, Yist Y. Lin, Andy T. Liu, Jiatong Shi, Xuankai Chang, Guan-Ting Lin, Tzu-Hsien Huang, Wei-Cheng Tseng, Ko-tik Lee, Da-Rong Liu, Zili Huang, Shuyan Dong, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee |
| 2021 | NAACL | Put Chatbot into Its Interlocutor's Shoes: New Framework to Learn Chatbot Responding with Intention. | Hsuan Su, Jiun-Hao Jhan, Fan-Yun Sun, Saurav Sahay, Hung-yi Lee |
| 2020 | AAAI | Order-Free Learning Alleviating Exposure Bias in Multi-Label Classification. | Che-Ping Tsai, Hung-yi Lee |
| 2020 | ACL | Worse WER, but Better BLEU? Leveraging Word Embedding as Intermediate in Multitask End-to-End Speech Translation. | Shun-Po Chuang, Tzu-Wei Sung, Alexander H. Liu, Hung-yi Lee |
| 2020 | EMNLP | Pretrained Language Model Embryology: The Birth of ALBERT. | David Cheng-Han Chiang, Sung-Feng Huang, Hung-yi Lee |
| 2020 | ICASSP | Training Code-Switching Language Model with Monolingual Data. | Shun-Po Chuang, Tzu-Wei Sung, Hung-yi Lee |
| 2020 | ICASSP | Meta Learning for End-To-End Low-Resource Speech Recognition. | Jui-Yang Hsu, Yuan-Jui Chen, Hung-yi Lee |
| 2020 | ICASSP | Sequence-to-Sequence Automatic Speech Recognition with Word Embedding Regularization and Fused Decoding. | Alexander H. Liu, Tzu-Wei Sung, Shun-Po Chuang, Hung-yi Lee, Lin-Shan Lee |
| 2020 | ICASSP | Towards Unsupervised Speech Recognition and Synthesis with Quantized Speech Representation Learning. | Alexander H. Liu, Tao Tu, Hung-yi Lee, Lin-Shan Lee |
| 2020 | ICASSP | Mockingjay: Unsupervised Speech Representation Learning with Deep Bidirectional Transformer Encoders. | Andy T. Liu, Shu-Wen Yang, Po-Han Chi, Po-Chun Hsu, Hung-yi Lee |
| 2020 | ICASSP | What Does a Network Layer Hear? Analyzing Hidden Representations of End-to-End ASR Through Speech Synthesis. | Chung-Yi Li, Pei-Chieh Yuan, Hung-yi Lee |
| 2020 | ICASSP | Defense Against Adversarial Attacks on Spoofing Countermeasures of ASV. | Haibin Wu, Songxiang Liu, Helen Meng, Hung-yi Lee |
| 2020 | ICASSP | Interrupted and Cascaded Permutation Invariant Training for Speech Separation. | Gene-Ping Yang, Szu-Lin Wu, Yao-Wen Mao, Hung-yi Lee, Lin-Shan Lee |
| 2020 | Interspeech | DARTS-ASR: Differentiable Architecture Search for Multilingual Speech Recognition and Adaptation. | Yi-Chen Chen, Jui-Yang Hsu, Cheng-Kuang Lee, Hung-yi Lee |
| 2020 | Interspeech | SpeechBERT: An Audio-and-Text Jointly Learned Language Model for End-to-End Spoken Question Answering. | Yung-Sung Chuang, Chi-Liang Liu, Hung-yi Lee, Lin-Shan Lee |
| 2020 | Interspeech | WG-WaveNet: Real-Time High-Fidelity Speech Synthesis Without GPU. | Po-Chun Hsu, Hung-yi Lee |
| 2020 | Interspeech | Semi-Supervised Learning for Multi-Speaker Text-to-Speech Synthesis Using Discrete Speech Representation. | Tao Tu, Yuan-Jui Chen, Alexander H. Liu, Hung-yi Lee |
| 2020 | Interspeech | VQVC+: One-Shot Voice Conversion by Vector Quantization and U-Net Architecture. | Da-Yi Wu, Yen-Hao Chen, Hung-yi Lee |
| 2020 | Interspeech | Defense for Black-Box Attacks on Anti-Spoofing Models by Self-Supervised Learning. | Haibin Wu, Andy T. Liu, Hung-yi Lee |
| 2020 | Interspeech | Understanding Self-Attention of Self-Supervised Audio Transformers. | Shu-Wen Yang, Andy T. Liu, Hung-yi Lee |
| 2019 | ASRU | Adversarial Attacks on Spoofing Countermeasures of Automatic Speaker Verification. | Songxiang Liu, Haibin Wu, Hung-yi Lee, Helen Meng |
| 2019 | EMNLP | Zero-shot Reading Comprehension by Cross-lingual Transfer Learning with Multi-lingual Language Representation Model. | Tsung-Yuan Hsu, Chi-Liang Liu, Hung-yi Lee |
| 2019 | EMNLP | Polly Want a Cracker: Analyzing Performance of Parroting on Paraphrase Generation Datasets. | Hongren Mao, Hung-yi Lee |
| 2019 | EMNLP | DyKgChat: Benchmarking Dialogue Generation Grounding on Dynamic Knowledge Graphs. | Yi-Lin Tuan, Yun-Nung Chen, Hung-yi Lee |
| 2019 | EMNLP | Tree Transformer: Integrating Tree Structures into Self-Attention. | Yau-Shian Wang, Hung-yi Lee, Yun-Nung Chen |
| 2019 | ICASSP | Mitigating the Impact of Speech Recognition Errors on Spoken Question Answering by Adversarial Domain Adaptation. | Chia-Hsuan Lee, Yun-Nung Chen, Hung-yi Lee |
| 2019 | ICASSP | Adversarial Training of End-to-end Speech Recognition Using a Criticizing Language Model. | Alexander H. Liu, Hung-yi Lee, Lin-Shan Lee |
| 2019 | ICASSP | Towards End-to-end Speech-to-text Translation with Two-pass Decoding. | Tzu-Wei Sung, Jun-You Liu, Hung-yi Lee, Lin-Shan Lee |
| 2019 | ICASSP | Using Deep-Q Network to Select Candidates from N-best Speech Recognition Hypotheses for Enhancing Dialogue State Tracking. | Richard Tzong-Han Tsai, Chia-Hao Chen, Chun-Kai Wu, Yu-Cheng Hsiao, Hung-yi Lee |
| 2019 | ICASSP | Adversarial Learning of Label Dependency: A Novel Framework for Multi-class Classification. | Che-Ping Tsai, Hung-yi Lee |
| 2019 | ICASSP | Towards Audio to Scene Image Synthesis Using Generative Adversarial Network. | Chia-Hung Wan, Shun-Po Chuang, Hung-yi Lee |
| 2019 | Interspeech | Code-Switching Sentence Generation by Generative Adversarial Networks and its Application to Data Augmentation. | Ching-Ting Chang, Shun-Po Chuang, Hung-yi Lee |
| 2019 | Interspeech | Generative Adversarial Networks for Unpaired Voice Transformation on Impaired Speech. | Li-Wei Chen, Hung-yi Lee, Yu Tsao |
| 2019 | Interspeech | Completely Unsupervised Phoneme Recognition by a Generative Adversarial Network Harmonized with Iteratively Refined Hidden Markov Models. | Kuan-Yu Chen, Che-Ping Tsai, Da-Rong Liu, Hung-yi Lee, Lin-Shan Lee |
| 2019 | Interspeech | End-to-End Text-to-Speech for Low-Resource Languages by Cross-Lingual Transfer Learning. | Yuan-Jui Chen, Tao Tu, Cheng-chieh Yeh, Hung-yi Lee |
| 2019 | Interspeech | One-Shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization. | Ju-Chieh Chou, Hung-yi Lee |
| 2019 | Interspeech | Noise Adaptive Speech Enhancement Using Domain Adversarial Training. | Chien-Feng Liao, Yu Tsao, Hung-yi Lee, Hsin-Min Wang |
| 2019 | Interspeech | Unsupervised End-to-End Learning of Discrete Linguistic Units for Voice Conversion. | Andy T. Liu, Po-Chun Hsu, Hung-yi Lee |
| 2019 | Interspeech | Personalized Dialogue Response Generation Learned from Monologues. | Feng-Guang Su, Aliyah R. Hsu, Yi-Lin Tuan, Hung-yi Lee |
| 2019 | Interspeech | Improved Speech Separation with Time-and-Frequency Cross-Domain Joint Embedding and Clustering. | Gene-Ping Yang, Chao-I Tuan, Hung-yi Lee, Lin-Shan Lee |
| 2018 | EMNLP | Learning to Encode Text as Human-Readable Summaries using Generative Adversarial Networks. | Yau-Shian Wang, Hung-yi Lee |
| 2018 | ICASSP | Query-by-Example Spoken Term Detection Using Attention-Based Multi-Hop Networks. | Chia-Wei Ao, Hung-yi Lee |
| 2018 | ICASSP | Scalable Sentiment for Sequence-to-Sequence Chatbot Response with Performance Analysis. | Chih-Wei Lee, Yau-Shian Wang, Tsung-Yuan Hsu, Kuan-Yu Chen, Hung-yi Lee, Lin-Shan Lee |
| 2018 | ICASSP | Domain Independent Key Term Extraction from Spoken Content Based on Context and Term Location Information in the Utterances. | Hsien-Chin Lin, Chi-Yu Yang, Hung-yi Lee, Lin-Shan Lee |
| 2018 | ICASSP | Language Transfer of Audio Word2Vec: Learning Audio Segment Representations Without Target Language Data. | Chia-Hao Shen, Janet Y. Sung, Hung-yi Lee |
| 2018 | ICASSP | Segmental Audio Word2Vec: Representing Utterances as Sequences of Vectors with Applications in Spoken Term Detection. | Yu-Hsuan Wang, Hung-yi Lee, Lin-Shan Lee |
| 2018 | Interspeech | Multi-target Voice Conversion without Parallel Data by Adversarially Learning Disentangled Audio Representations. | Ju-Chieh Chou, Cheng-chieh Yeh, Hung-yi Lee, Lin-Shan Lee |
| 2018 | Interspeech | Joint Learning of Interactive Spoken Content Retrieval and Trainable User Simulator. | Pei-Hung Chung, Kuan Tung, Ching-Lun Tai, Hung-yi Lee |
| 2018 | Interspeech | Spoken SQuAD: A Study of Mitigating the Impact of Speech Recognition Errors on Listening Comprehension. | Chia-Hsuan Li, Szu-Lin Wu, Chi-Liang Liu, Hung-yi Lee |
| 2018 | Interspeech | Completely Unsupervised Phoneme Recognition by Adversarially Learning Mapping Relationships from Audio Embeddings. | Da-Rong Liu, Kuan-Yu Chen, Hung-yi Lee, Lin-Shan Lee |
| 2018 | NAACL | Supervised and Unsupervised Transfer Learning for Question Answering. | Yu-An Chung, Hung-yi Lee, James R. Glass |
| 2017 | ASRU | Mitigating the impact of speech recognition errors on chatbot using sequence-to-sequence model. | Pin-Jung Chen, I-Hung Hsu, Yi Yao Huang, Hung-yi Lee |
| 2017 | ASRU | Seeing and hearing too: Audio representation for video captioning. | Shun-Po Chuang, Chia-Hung Wan, Pang-Chi Huang, Chi-Yu Yang, Hung-yi Lee |
| 2017 | ASRU | Personalized word representations carrying personalized semantics learned from social network posts. | Zih-Wei Lin, Tzu-Wei Sung, Hung-yi Lee, Lin-Shan Lee |
| 2017 | EMNLP | Learning Chinese Word Representations From Glyphs Of Characters. | Tzu-Ray Su, Hung-yi Lee |
| 2017 | ICASSP | Recurrent Neural Network based language modeling with controllable external Memory. | Wei-Jen Ko, Bo-Hsiang Tseng, Hung-yi Lee |
| 2017 | ICASSP | Personalized acoustic modeling by weakly supervised multi-task deep learning using acoustic tokens discovered from unlabeled data. | Cheng-Kuang Wei, Cheng-Tao Chung, Hung-yi Lee, Lin-Shan Lee |
| 2017 | Interspeech | Order-Preserving Abstractive Summarization for Spoken Content Based on Connectionist Temporal Classification. | Bo-Ru Lu, Frank Shyu, Yun-Nung Chen, Hung-yi Lee, Lin-Shan Lee |
| 2017 | Interspeech | Gate Activation Signal Analysis for Gated Recurrent Neural Networks and its Correlation with Phoneme Boundaries. | Yu-Hsuan Wang, Cheng-Tao Chung, Hung-yi Lee |
| 2016 | Interspeech | Audio Word2Vec: Unsupervised Learning of Audio Segment Representations Using Sequence-to-Sequence Autoencoder. | Yu-An Chung, Chao-Chung Wu, Chia-Hao Shen, Hung-yi Lee, Lin-Shan Lee |
| 2016 | Interspeech | Neural Attention Models for Sequence Classification: Analysis and Application to Key Term Extraction and Dialogue Act Detection. | Sheng-syun Shen, Hung-yi Lee |
| 2016 | Interspeech | Towards Machine Comprehension of Spoken Content: Initial TOEFL Listening Comprehension Test by Machine. | Bo-Hsiang Tseng, Sheng-syun Shen, Hung-yi Lee, Lin-Shan Lee |
| 2016 | Interspeech | Interactive Spoken Content Retrieval by Deep Reinforcement Learning. | Yen-Chen Wu, Tzu-Hsiang Lin, Yang-De Chen, Hung-yi Lee, Lin-Shan Lee |
| 2015 | ASRU | An iterative deep learning framework for unsupervised discovery of speech features and linguistic units with applications on spoken term detection. | Cheng-Tao Chung, Cheng-Yu Tsai, Hsiang-Hung Lu, Chia-Hsiang Liu, Hung-yi Lee, Lin-Shan Lee |
| 2015 | ASRU | Towards structured deep neural network for automatic speech recognition. | Yi-Hsiu Liao, Hung-yi Lee, Lin-Shan Lee |
| 2015 | ASRU | Personalizing universal recurrent neural network language model with user characteristic features by social network crowdsourcing. | Bo-Hsiang Tseng, Hung-yi Lee, Lin-Shan Lee |
| 2015 | Interspeech | Semantic retrieval of personal photos using a deep autoencoder fusing visual features with speech annotations represented as word/paragraph vectors. | Hung-tsung Lu, Yuan-ming Liou, Hung-yi Lee, Lin-Shan Lee |
| 2015 | Interspeech | Structuring lectures in massive open online courses (MOOCs) for efficient learning by linking similar sections and predicting prerequisites. | Sheng-syun Shen, Hung-yi Lee, Shang-wen Li, Victor Zue, Lin-Shan Lee |
| 2015 | Interspeech | Personalized speech recognizer with keyword-based personalized lexicon and language model using word vector representations. | Ching-feng Yeh, Yuan-ming Liou, Hung-yi Lee, Lin-Shan Lee |
| 2014 | Interspeech | Graph-based re-ranking using acoustic feature similarity between search results for spoken term detection on low-resource languages. | Hung-yi Lee, Yu Zhang, Ekapol Chuangsuwanich, James R. Glass |
| 2014 | Interspeech | Semantic retrieval of personal photos using matrix factorization and two-layer random walk fusing sparse speech annotations with visual features. | Yuan-ming Liou, Yi-Sheng Fu, Hung-yi Lee, Lin-Shan Lee |
| 2014 | Interspeech | Alignment of spoken utterances with slide content for easier learning with recorded lectures using structured support vector machine (SVM). | Han Lu, Sheng-syun Shen, Sz-Rung Shiang, Hung-yi Lee, Lin-Shan Lee |
| 2014 | Interspeech | Spoken question answering using tree-structured conditional random fields and two-layer random walk. | Sz-Rung Shiang, Hung-yi Lee, Lin-Shan Lee |
| 2013 | ASRU | Towards unsupervised semantic retrieval of spoken content with query expansion based on automatically discovered acoustic patterns. | Yun-Chiao Li, Hung-yi Lee, Cheng-Tao Chung, Chun-an Chan, Lin-Shan Lee |
| 2013 | ICASSP | Unsupervised domain adaptation for spoken document summarization with structured support vector machine. | Hung-yi Lee, Yu-Yu Chou, Yow-Bang Wang, Lin-Shan Lee |
| 2013 | ICASSP | Enhancing query expansion for semantic retrieval of spoken content with automatically discovered acoustic patterns. | Hung-yi Lee, Yun-Chiao Li, Cheng-Tao Chung, Lin-Shan Lee |
| 2013 | ICASSP | Interactive spoken content retrieval by extended query model and continuous state space Markov Decision Process. | Tsung-Hsien Wen, Hung-yi Lee, Pei-hao Su, Lin-Shan Lee |
| 2013 | Interspeech | Ensemble of machine learning and acoustic segment model techniques for speech emotion and autism spectrum disorders recognition. | Hung-yi Lee, Ting-Yao Hu, How Jing, Yun-Fan Chang, Yu Tsao, Yu-Cheng Kao, Tsang-Long Pao |
| 2013 | Interspeech | Supervised spoken document summarization based on structured support vector machine with utterance clusters as hidden variables. | Sz-Rung Shiang, Hung-yi Lee, Lin-Shan Lee |
| 2013 | Interspeech | Recurrent neural network based language model personalization by social network crowdsourcing. | Tsung-Hsien Wen, Aaron Heidel, Hung-yi Lee, Yu Tsao, Lin-Shan Lee |
| 2013 | Interspeech | Speaking rate normalization with lattice-based context-dependent phoneme duration modeling for personalized speech recognizers on mobile devices. | Ching-feng Yeh, Hung-yi Lee, Lin-Shan Lee |
| 2012 | ICASSP | Unsupervised two-stage keyword extraction from spoken documents by topic coherence and support vector machine. | Yun-Nung Chen, Yu Huang, Hung-yi Lee, Lin-Shan Lee |
| 2012 | ICASSP | Utterance-level latent topic transition modeling for spoken documents and its application in automatic summarization. | Hung-yi Lee, Yun-Nung Chen, Lin-Shan Lee |
| 2012 | ICASSP | Semantic query expansion and context-based discriminative term modeling for spoken document retrieval. | Tsung-wei Tu, Hung-yi Lee, Yu-Yu Chou, Lin-Shan Lee |
| 2012 | ICASSP | Recognition of highly imbalanced code-mixed bilingual speech with frame-level language detection based on blurred posteriorgram. | Ching-feng Yeh, Aaron Heidel, Hung-yi Lee, Lin-Shan Lee |
| 2012 | Interspeech | Open-Vocabulary Retrieval of Spoken Content with Shorter/Longer Queries Considering Word/Subword-based Acoustic Feature Similarity. | Hung-yi Lee, Po-wei Chou, Lin-Shan Lee |
| 2012 | Interspeech | Supervised Spoken Document Summarization jointly Considering Utterance Importance and Redundancy by Structured Support Vector Machine. | Hung-yi Lee, Yu-Yu Chou, Yow-Bang Wang, Lin-Shan Lee |
| 2012 | Interspeech | Interactive Spoken Content Retrieval with Different Types of Actions Optimized By a Markov Decision Process. | Tsung-Hsien Wen, Hung-yi Lee, Lin-Shan Lee |
| 2011 | ASRU | Improved spoken term detection using support vector machines with acoustic and context features from pseudo-relevance feedback. | Tsung-wei Tu, Hung-yi Lee, Lin-Shan Lee |
| 2011 | ICASSP | Improved spoken term detection with graph-based re-ranking in feature space. | Yun-Nung Chen, Chia-Ping Chen, Hung-yi Lee, Chun-an Chan, Lin-Shan Lee |
| 2011 | ICASSP | Improved spoken term detection using support vector machines based on lattice context consistency. | Hung-yi Lee, Tsung-wei Tu, Chia-Ping Chen, Chao-Yu Huang, Lin-Shan Lee |
| 2010 | ICASSP | An initial attempt to improve spoken term detection by learning optimal weights for different indexing features. | Yu-Hui Chen, Chia-Chen Chou, Hung-yi Lee, Lin-Shan Lee |
| 2010 | ICASSP | Integrating recognition and retrieval with user feedback: A new framework for spoken term detection. | Hung-yi Lee, Lin-Shan Lee |
| 2010 | Interspeech | Improved spoken term detection by feature space pseudo-relevance feedback. | Chia-Ping Chen, Hung-yi Lee, Ching-feng Yeh, Lin-Shan Lee |
| 2010 | Interspeech | Improved spoken term detection by discriminative training of acoustic models based on user relevance feedback. | Hung-yi Lee, Chia-Ping Chen, Ching-feng Yeh, Lin-Shan Lee |
| 2009 | ASRU | Spoken term detection from bilingual spontaneous speech using code-switched lattice-based structures for words and subword units. | Hung-yi Lee, Yueh-Lien Tang, Hao Tang, Lin-Shan Lee |
| 2009 | ICASSP | Improved lattice-based spoken document retrieval by directly learning from the evaluation measures. | Chao-Hong Meng, Hung-yi Lee, Lin-Shan Lee |