| 2025 | ICLR | ComLoRA: A Competitive Learning Approach for Enhancing LoRA. | Qiushi Huang, Tom Ko, Lilian Tang, Yu Zhang |
| 2025 | ICLR | HiRA: Parameter-Efficient Hadamard High-Rank Adaptation for Large Language Models. | Qiushi Huang, Tom Ko, Zhan Zhuang, Lilian Tang, Yu Zhang |
| 2024 | ACL | Selective Prompting Tuning for Personalized Conversations with LLMs. | Qiushi Huang, Xubo Liu, Tom Ko, Bo Wu, Wenwu Wang, Yu Zhang, Lilian Tang |
| 2024 | ACL | RepCodec: A Speech Representation Codec for Speech Tokenization. | Zhichao Huang, Chutong Meng, Tom Ko |
| 2024 | COLING | Parameter-Efficient Transfer Learning for End-to-end Speech Translation. | Yunlong Zhao, Kexin Wang, Qianqian Dong, Tom Ko |
| 2024 | ICLR | PolyVoice: Language Models for Speech to Speech Translation. | Qianqian Dong, Zhiying Huang, Qi Tian, Chen Xu, Tom Ko, Yunlong Zhao, Siyuan Feng, Tang Li, Kexin Wang, Xuxin Cheng, Fengpeng Yue, Ye Bai, Xi Chen, Lu Lu, Zejun Ma, Yuping Wang, Mingxuan Wang, Yuxuan Wang |
| 2023 | AAAI | Personalized Dialogue Generation with Persona-Adaptive Attention. | Qiushi Huang, Yu Zhang, Tom Ko, Xubo Liu, Bo Wu, Wenwu Wang, H. Lilian Tang |
| 2023 | ACL | CTC-based Non-autoregressive Speech Translation. | Chen Xu, Xiaoqian Liu, Xiaowen Liu, Qingxuan Sun, Yuhao Zhang, Murun Yang, Qianqian Dong, Tom Ko, Mingxuan Wang, Tong Xiao, Anxiang Ma, Jingbo Zhu |
| 2023 | ACL | MOSPC: MOS Prediction Based on Pairwise Comparison. | Kexin Wang, Yunlong Zhao, Qianqian Dong, Tom Ko, Mingxuan Wang |
| 2023 | ACL | DUB: Discrete Unit Back-translation for Speech Translation. | Dong Zhang, Rong Ye, Tom Ko, Mingxuan Wang, Yaqian Zhou |
| 2023 | CVPR | Leveraging per Image-Token Consistency for Vision-Language Pre-training. | Yunhao Gou, Tom Ko, Hansi Yang, James T. Kwok, Yu Zhang, Mingxuan Wang |
| 2023 | EMNLP | Learning Retrieval Augmentation for Personalized Dialogue Generation. | Qiushi Huang, Shuai Fu, Xubo Liu, Wenwu Wang, Tom Ko, Yu Zhang, Lilian Tang |
| 2023 | ICASSP | M | Xuxin Cheng, Qianqian Dong, Fengpeng Yue, Tom Ko, Mingxuan Wang, Yuexian Zou |
| 2023 | IJCAI | Recent Advances in Direct Speech-to-text Translation. | Chen Xu, Rong Ye, Qianqian Dong, Chengqi Zhao, Tom Ko, Mingxuan Wang, Tong Xiao, Jingbo Zhu |
| 2023 | Interspeech | Visually-Aware Audio Captioning With Adaptive Audio-Visual Attention. | Xubo Liu, Qiushi Huang, Xinhao Mei, Haohe Liu, Qiuqiang Kong, Jianyuan Sun, Shengchen Li, Tom Ko, Yu Zhang, H. Lilian Tang, Mark D. Plumbley, Volkan Kili, Wenwu Wang |
| 2023 | Interspeech | CoBERT: Self-Supervised Speech Representation Learning Through Code Representation Learning. | Chutong Meng, Junyi Ao, Tom Ko, Mingxuan Wang, Haizhou Li |
| 2023 | Interspeech | GigaST: A 10, 000-hour Pseudo Speech Translation Corpus. | Rong Ye, Chengqi Zhao, Tom Ko, Chutong Meng, Tao Wang, Mingxuan Wang, Jun Cao |
| 2022 | ACL | SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing. | Junyi Ao, Rui Wang, Long Zhou, Chengyi Wang, Shuo Ren, Yu Wu, Shujie Liu, Tom Ko, Qing Li, Yu Zhang, Zhihua Wei, Yao Qian, Jinyu Li, Furu Wei |
| 2022 | ICASSP | Multi-View Self-Attention Based Transformer for Speaker Recognition. | Rui Wang, Junyi Ao, Long Zhou, Shujie Liu, Zhihua Wei, Tom Ko, Qing Li, Yu Zhang |
| 2022 | ICASSP | Exploring Machine Speech Chain For Domain Adaptation. | Fengpeng Yue, Yan Deng, Lei He, Tom Ko, Yu Zhang |
| 2022 | Interspeech | Pre-Training Transformer Decoder for End-to-End ASR Model with Unpaired Speech Data. | Junyi Ao, Ziqiang Zhang, Long Zhou, Shujie Liu, Haizhou Li, Tom Ko, Lirong Dai, Jinyu Li, Yao Qian, Furu Wei |
| 2022 | Interspeech | A Study of Modeling Rising Intonation in Cantonese Neural Speech Synthesis. | Qibing Bai, Tom Ko, Yu Zhang |
| 2022 | Interspeech | Leveraging Pseudo-labeled Data to Improve Direct Speech-to-Speech Translation. | Qianqian Dong, Fengpeng Yue, Tom Ko, Mingxuan Wang, Qibing Bai, Yu Zhang |
| 2022 | Interspeech | LightHuBERT: Lightweight and Configurable Speech Representation Learning with Once-for-All Hidden-Unit BERT. | Rui Wang, Qibing Bai, Junyi Ao, Long Zhou, Zhixiang Xiong, Zhihua Wei, Yu Zhang, Tom Ko, Haizhou Li |
| 2021 | Interspeech | A Meta-Learning Approach for User-Defined Spoken Term Classification with Varying Classes and Examples. | Yangbin Chen, Tom Ko, Jianping Wang |
| 2021 | Interspeech | Token-Level Supervised Contrastive Learning for Punctuation Restoration. | Qiushi Huang, Tom Ko, H. Lilian Tang, Xubo Liu, Bo Wu |
| 2021 | Interspeech | Auto-KWS 2021 Challenge: Task, Datasets, and Baselines. | Jingsong Wang, Yuxuan He, Chunyu Zhao, Qijie Shao, Wei-Wei Tu, Tom Ko, Hung-yi Lee, Lei Xie |
| 2020 | ICASSP | Prototypical Networks for Small Footprint Text-Independent Speaker Verification. | Tom Ko, Yangbin Chen, Qing Li |
| 2020 | ICPR | MetaMix: Improved Meta-Learning with Interpolation-based Consistency Regularization. | Yangbin Chen, Yun Ma, Tom Ko, Jianping Wang, Qing Li |
| 2020 | Interspeech | An Investigation of Few-Shot Learning in Spoken Term Classification. | Yangbin Chen, Tom Ko, Lifeng Shang, Xiao Chen, Xin Jiang, Qing Li |
| 2020 | Interspeech | AutoSpeech 2020: The Second Automated Machine Learning Challenge for Speech Classification. | Jingsong Wang, Tom Ko, Zhen Xu, Xiawei Guo, Souxiang Liu, Wei-Wei Tu, Lei Xie |
| 2019 | Interspeech | Mixup Learning Strategies for Text-Independent Speaker Verification. | Yingke Zhu, Tom Ko, Brian Mak |
| 2018 | Interspeech | Long Distance Voice Channel Diagnosis Using Deep Neural Networks. | Zhen Qin, Tom Ko, Guangjian Tian |
| 2018 | Interspeech | Self-Attentive Speaker Embeddings for Text-Independent Speaker Verification. | Yingke Zhu, Tom Ko, David Snyder, Brian Mak, Daniel Povey |
| 2017 | ICASSP | A study on data augmentation of reverberant speech for robust speech recognition. | Tom Ko, Vijayaditya Peddinti, Daniel Povey, Michael L. Seltzer, Sanjeev Khudanpur |
| 2016 | ICASSP | An empirical exploration of CTC acoustic models. | Yajie Miao, Mohammad Gowayyed, Xingyu Na, Tom Ko, Florian Metze, Alexander Waibel |
| 2015 | ASRU | JHU ASpIRE system: Robust LVCSR with TDNNS, iVector adaptation and RNN-LMS. | Vijayaditya Peddinti, Guoguo Chen, Vimal Manohar, Tom Ko, Daniel Povey, Sanjeev Khudanpur |
| 2015 | Interspeech | Audio augmentation for speech recognition. | Tom Ko, Vijayaditya Peddinti, Daniel Povey, Sanjeev Khudanpur |
| 2014 | ICASSP | Subspace Gaussian mixture model with state-dependent subspace dimensions. | Tom Ko, Brian Mak, Cheung-Chi Leung |
| 2012 | ICASSP | Derivation of eigentriphones by weighted principal component analysis. | Tom Ko, Brian Mak |
| 2011 | ICASSP | Eigentriphones: A basis for context-dependent acoustic modeling. | Tom Ko, Brian Mak |
| 2011 | Interspeech | A Fully Automated Derivation of State-Based Eigentriphones for Triphone Modeling with No Tied States Using Regularization. | Tom Ko, Brian Mak |
| 2010 | ICASSP | Improving speech recognition by explicit modeling of phone deletions. | Tom Ko, Brian Mak |
| 2009 | Interspeech | Automatic estimation of decoding parameters using large-margin iterative linear programming. | Brian Mak, Tom Ko |
| 2008 | Interspeech | Min-max discriminative training of decoding parameters using iterative linear programming. | Brian Mak, Tom Ko |