| 2025 | EMNLP | End-to-End Optimization for Multimodal Retrieval-Augmented Generation via Reward Backpropagation. | Zhiyuan Fan, Longfei Yun, Ming Yan, Yumeng Wang, Dadi Guo, Brian Mak, James T. Kwok, Yi R. Fung |
| 2025 | ICML | Residual Matrix Transformers: Scaling the Size of the Residual Stream. | Brian Mak, Jeffrey Flanigan |
| 2024 | COLING | A Hong Kong Sign Language Corpus Collected from Sign-interpreted TV News. | Zhe Niu, Ronglai Zuo, Brian Mak, Fangyun Wei |
| 2024 | ECCV | A Simple Baseline for Spoken Language to Sign Language Translation with 3D Avatars. | Ronglai Zuo, Fangyun Wei, Zenggui Chen, Brian Mak, Jiaolong Yang, Xin Tong |
| 2024 | EMNLP | Towards Online Continuous Sign Language Recognition and Translation. | Ronglai Zuo, Fangyun Wei, Brian Mak |
| 2023 | CVPR | Natural Language-Assisted Sign Language Recognition. | Ronglai Zuo, Fangyun Wei, Brian Mak |
| 2023 | ICCV | On the Audio-visual Synchronization for Lip-to-Speech Synthesis. | Zhe Niu, Brian Mak |
| 2023 | Interspeech | wav2vec 2.0 ASR for Cantonese-Speaking Older Adults in a Clinical Setting. | Ranzo Huang, Brian Mak |
| 2023 | Interspeech | Integrated and Enhanced Pipeline System to Support Spoken Language Analytics for Screening Neurocognitive Disorders. | Helen Meng, Brian Mak, Man-Wai Mak, Helene H. Fung, Xianmin Gong, Timothy C. Y. Kwok, Xunying Liu, Vincent C. T. Mok, Patrick C. M. Wong, Jean Woo, Xixin Wu, Ka Ho Wong, Sean Shensheng Xu, Naijun Zheng, Ranzo Huang, Jiawen Kang, Xiaoquan Ke, Junan Li, Jinchao Li, Yi Wang |
| 2022 | ASSETS | Access on Demand: Real-time, Multi-modal Accessibility for the Deaf and Hard-of-Hearing based on Augmented Reality. | Roshan Mathew, Brian Mak, Wendy Dannels |
| 2022 | CVPR | C | Ronglai Zuo, Brian Mak |
| 2022 | Interspeech | Synthesizing Near Native-accented Speech for a Non-native Speaker by Imitating the Pronunciation and Prosody of a Native Speaker. | Raymond Chung, Brian Mak |
| 2022 | Interspeech | Local Context-aware Self-attention for Continuous Sign Language Recognition. | Ronglai Zuo, Brian Mak |
| 2021 | ASRU | On-The-Fly Data Augmentation for Text-to-Speech Style Transfer. | Raymond Chung, Brian Mak |
| 2021 | ICASSP | A Comparative Study of Acoustic and Linguistic Features Classification for Alzheimer's Disease Detection. | Jinchao Li, Jianwei Yu, Zi Ye, Simon Wong, Man-Wai Mak, Brian Mak, Xunying Liu, Helen Meng |
| 2021 | ICASSP | Non-Parallel Many-To-Many Voice Conversion by Knowledge Transfer from a Text-To-Speech Model. | Xinyuan Yu, Brian Mak |
| 2020 | ECCV | Stochastic Fine-Grained Labeling of Multi-state Sign Glosses for Continuous Sign Language Recognition. | Zhe Niu, Brian Mak |
| 2020 | ICASSP | Orthogonal Training for Text-Independent Speaker Verification. | Yingke Zhu, Brian Mak |
| 2020 | Interspeech | Multi-Lingual Multi-Speaker Text-to-Speech Synthesis for Voice Cloning with Online Speaker Enrollment. | Zhaoyu Liu, Brian Mak |
| 2019 | AAAI | Recurrent Poisson Process Unit for Speech Recognition. | Hengguan Huang, Hao Wang, Brian Mak |
| 2019 | Interspeech | Mixup Learning Strategies for Text-Independent Speaker Verification. | Yingke Zhu, Tom Ko, Brian Mak |
| 2018 | ICASSP | End-To-End Low-Resource Lip-Reading with Maxout Cnn and Lstm. | Ivan Fung, Brian Mak |
| 2018 | ICASSP | learning Effective Factorized Hidden Layer Bases Using Student-Teacher Training for LSTM Acoustic Model Adaptation. | Lahiru Samarakoon, Brian Mak, Khe Chai Sim |
| 2018 | Interspeech | Fast Derivation of Cross-lingual Document Vectors from Self-attentive Neural Machine Translation Model. | Wei Li, Brian Mak |
| 2018 | Interspeech | Self-Attentive Speaker Embeddings for Text-Independent Speaker Verification. | Yingke Zhu, Tom Ko, David Snyder, Brian Mak, Daniel Povey |
| 2017 | ASRU | Unsupervised adaptation of student DNNS learned from teacher RNNS for improved ASR performance. | Lahiru Samarakoon, Brian Mak |
| 2017 | EACL | Derivation of Document Vectors from Adaptation of LSTM Language Model. | Wei Li, Brian Mak |
| 2017 | ICASSP | An investigation into learning effective speaker subspaces for robust unsupervised DNN adaptation. | Lahiru Samarakoon, Khe Chai Sim, Brian Mak |
| 2017 | ICASSP | Speeding up softmax computations in DNN-based large vocabulary speech recognition by senone weight vector selection. | Yingke Zhu, Brian Mak |
| 2017 | Interspeech | To Improve the Robustness of LSTM-RNN Acoustic Models Using Higher-Order Feedback from Multiple Histories. | Hengguan Huang, Brian Mak |
| 2017 | Interspeech | Learning Factorized Transforms for Unsupervised Adaptation of LSTM-RNN Acoustic Models. | Lahiru Samarakoon, Brian Mak, Khe Chai Sim |
| 2015 | Interspeech | Distinct triphone acoustic modeling using deep neural networks. | Dongpeng Chen, Brian Mak |
| 2014 | ICASSP | Joint acoustic modeling of triphones and trigraphemes by multi-task learning deep neural networks for low-resource speech recognition. | Dongpeng Chen, Brian Mak, Cheung-Chi Leung, Sunil Sivadas |
| 2014 | ICASSP | Subspace Gaussian mixture model with state-dependent subspace dimensions. | Tom Ko, Brian Mak, Cheung-Chi Leung |
| 2014 | Interspeech | Joint sequence training of phone and grapheme acoustic model based on multi-task learning deep neural networks. | Dongpeng Chen, Brian Mak, Sunil Sivadas |
| 2013 | ICASSP | Distinct triphone modeling by reference model weighting. | Dongpeng Chen, Brian Mak |
| 2012 | ICASSP | Derivation of eigentriphones by weighted principal component analysis. | Tom Ko, Brian Mak |
| 2012 | ICASSP | Transition probabilities are more important than we once thought. | Guoli Ye, Dongpeng Chen, Brian Mak |
| 2011 | ICASSP | Eigentriphones: A basis for context-dependent acoustic modeling. | Tom Ko, Brian Mak |
| 2011 | Interspeech | A Fully Automated Derivation of State-Based Eigentriphones for Triphone Modeling with No Tied States Using Regularization. | Tom Ko, Brian Mak |
| 2010 | ICASSP | Improving speech recognition by explicit modeling of phone deletions. | Tom Ko, Brian Mak |
| 2010 | Interspeech | The use of subvector quantization and discrete densities for fast GMM computation for speaker verification. | Guoli Ye, Brian Mak |
| 2009 | Interspeech | Automatic estimation of decoding parameters using large-margin iterative linear programming. | Brian Mak, Tom Ko |
| 2009 | Interspeech | Fast GMM computation for speaker verification using scalar quantization and discrete densities. | Guoli Ye, Brian Mak, Man-Wai Mak |
| 2008 | ICASSP | Discriminative training by iterative linear programming optimization. | Brian Mak, Benny Ng |
| 2008 | Interspeech | Robust speaker verification using short-time frequency with long-time window and fusion of multi-resolutions. | Chien-Lin Huang, Bin Ma, Chung-Hsien Wu, Brian Mak, Haizhou Li |
| 2008 | Interspeech | Min-max discriminative training of decoding parameters using iterative linear programming. | Brian Mak, Tom Ko |
| 2007 | Interspeech | A model-based estimation of phonotactic language verification performance. | Kakeung Wong, Man-Hung Siu, Brian Mak |
| 2007 | Interspeech | Boosting with anti-models for automatic language identification. | Xi Yang, Man-Hung Siu, Herbert Gish, Brian Mak |
| 2006 | ICASSP | A Comparison of Various Adaptation Methods for Speaker Verification With Limited Enrollment Data. | Man-Wai Mak, Roger Wend-Huu Hsiao, Brian Mak |
| 2006 | ICASSP | Improving Reference Speaker Weighting Adaptation by the Use of Maximum-Likelihood Reference Speakers. | Brian Mak, Tsz-Chung Lai, Roger Wend-Huu Hsiao |
| 2006 | ICASSP | Fast Speaker Adaption Via Maximum Penalized Likelihood Kernel Regression. | Ivor W. Tsang, James T. Kwok, Brian Mak, Kai Zhang, Jeffrey Junfeng Pan |
| 2005 | ICASSP | Various Reference Speakers Determination Methods for Embedded Kernel Eigenvoice Speaker Adaptation. | Brian Mak, Simon Ka-Lung Ho |
| 2005 | Interspeech | High-density discrete HMM with the use of scalar quantization indexing. | Brian Mak, Jeff Siu-Kei Au-Yeung, Yiu-Pong Lai, Man-Hung Siu |
| 2004 | ICASSP | Discriminative feature transformation by guided discriminative training. | Roger Hsiao, Brian Mak |
| 2004 | ICASSP | A study of various composite kernels for kernel eigenvoice speaker adaptation. | Brian Mak, James T. Kwok, Simon Ka-Lung Ho |
| 2004 | Interspeech | Speedup of kernel eigenvoice speaker adaptation by embedded kernel PCA. | Brian Mak, Simon Ka-Lung Ho, James T. Kwok |
| 2003 | ICASSP | Discriminative training of auditory filters of different shapes for robust speech recognition. | Brian Mak, Yik-Cheung Tam, Roger Hsiao |
| 2003 | Interspeech | Joint estimation of thresholds in a bi-threshold verification problem. | Simon Ka-Lung Ho, Brian Mak |
| 2002 | ICASSP | Discriminative auditory features for robust speech recognition. | Brian Mak, Yik-Cheung Tam, Peter Qi Li |
| 2002 | ICASSP | An alternative approach of finding competing hypotheses for better minimum classification error training. | Yik-Cheung Tam, Brian Mak |
| 2000 | ICASSP | MAP adaptation with subspace regression classes and tying. | Kwok-Man Wong, Brian Mak |
| 1998 | ICASSP | Training of subspace distribution clustering hidden Markov model. | Brian Mak, Enrico Bocchieri |
| 1998 | Interspeech | Training of context-dependent subspace distribution clustering hidden Markov model. | Brian Mak, Enrico Bocchieri |
| 1997 | ICASSP | Combining ANNs to improve phone recognition. | Brian Mak |
| 1997 | Interspeech | Subspace distribution clustering for continuous observation density hidden Markov models. | Enrico Bocchieri, Brian Mak |
| 1996 | ICASSP | The contribution of consonants versus vowels to word recognition in fluent speech. | Ronald A. Cole, Yonghong Yan, Brian Mak, Mark A. Fanty, Troy Bailey |
| 1996 | Interspeech | Phone clustering using the bhattacharyya distance. | Brian Mak, Etienne Barnard |
| 1992 | ICASSP | A robust speech/non-speech detection algorithm using time and frequency-based features. | Brian Mak, Jean-Claude Junqua, Ben Reaves |
| 1991 | Interspeech | A study of endpoint detection algorithms in adverse conditions: incidence on a DTW and HMM recognizer. | Jean-Claude Junqua, Ben Reaves, Brian Mak |