| 2026 | ACL | Closing the Modality Reasoning Gap for Speech Large Language Models. | Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu |
| 2026 | ACL | SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation. | Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin |
| 2025 | ACL | SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training. | Wenxi Chen, Ziyang Ma, Ruiqi Yan, Yuzhe Liang, Xiquan Li, Ruiyang Xu, Zhikang Niu, Yanqiao Zhu, Yifan Yang, Zhanxun Liu, Kai Yu, Yuxuan Hu, Jinyu Li, Yan Lu, Shujie Liu, Xie Chen |
| 2025 | ACL | Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation. | Sreyan Ghosh, Mohammad Sadegh Rasooli, Michael Levit, Peidong Wang, Jian Xue, Dinesh Manocha, Jinyu Li |
| 2025 | ACL | Autoregressive Speech Synthesis without Vector Quantization. | Lingwei Meng, Long Zhou, Shujie Liu, Sanyuan Chen, Bing Han, Shujie Hu, Yanqing Liu, Jinyu Li, Sheng Zhao, Xixin Wu, Helen M. Meng, Furu Wei |
| 2025 | ASRU | SLM-S2ST: A multimodal language model for direct speech-to-speech translation. | Yuxuan Hu, Haibin Wu, Ruchao Fan, Xiaofei Wang, Heng Lu, Yao Qian, Jinyu Li |
| 2025 | ASRU | Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems. | Bo Ren, Yu Shi, Jinyu Li |
| 2025 | ASRU | Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model. | Haibin Wu, Yuxuan Hu, Ruchao Fan, Xiaofei Wang, Ken'ichi Kumatani, Bo Ren, Jianwei Yu, Heng Lu, Lijuan Wang, Yao Qian, Jinyu Li |
| 2025 | ICASSP | V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow. | Jeongsoo Choi, Ji-Hoon Kim, Jinyu Li, Joon Son Chung, Shujie Liu |
| 2025 | ICASSP | Boosting Large Language Model for Speech Synthesis: An Empirical Study. | Hongkun Hao, Long Zhou, Shujie Liu, Jinyu Li, Shujie Hu, Rui Wang, Furu Wei |
| 2025 | ICASSP | Target word activity detector: An approach to obtain ASR word boundaries without lexicon. | Sunit Sivasankaran, Eric Sun, Jinyu Li, Yan Huang, Jing Pan |
| 2025 | ICLR | ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation. | Zongyi Li, Shujie Hu, Shujie Liu, Long Zhou, Jeongsoo Choi, Lingwei Meng, Xun Guo, Jinyu Li, Hefei Ling, Furu Wei |
| 2025 | Interspeech | Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios. | Aswin Shanmugam Subramanian, Amit Das, Naoyuki Kanda, Jinyu Li, Xiaofei Wang, Yifan Gong |
| 2025 | Interspeech | Length Aware Speech Translation for Video Dubbing. | Aswin Shanmugam Subramanian, Harveen Singh Chadha, Vikas Joshi, Shubham Bansal, Jian Xue, Rupeshkumar Mehta, Jinyu Li |
| 2025 | Interspeech | TS3-Codec: Transformer-Based Simple Streaming Single Codec. | Haibin Wu, Naoyuki Kanda, Sefik Emre Eskimez, Jinyu Li |
| 2024 | CIKM | TrafCL: Robust Encrypted Malicious Traffic Detection via Contrastive Learning. | Xiaodu Yang, Sijie Ruan, Jinyu Li, Yinliang Yue, Bo Sun |
| 2024 | EMNLP | WavLLM: Towards Robust and Adaptive Speech Large Language Model. | Shujie Hu, Long Zhou, Shujie Liu, Sanyuan Chen, Lingwei Meng, Hongkun Hao, Jing Pan, Xunying Liu, Jinyu Li, Sunit Sivasankaran, Linquan Liu, Furu Wei |
| 2024 | ICASSP | Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation. | Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Naoyuki Kanda, Jinyu Li, Yashesh Gaur |
| 2024 | ICASSP | Residualtransformer: Residual Low-Rank Learning With Weight-Sharing For Transformer Layers. | Yiming Wang, Jinyu Li |
| 2024 | ICASSP | T-SOT FNT: Streaming Multi-Talker ASR with Text-Only Domain Adaptation Capability. | Jian Wu, Naoyuki Kanda, Takuya Yoshioka, Rui Zhao, Zhuo Chen, Jinyu Li |
| 2024 | ICASSP | Diarist: Streaming Speech Translation with Speaker Diarization. | Mu Yang, Naoyuki Kanda, Xiaofei Wang, Jun-Kun Chen, Peidong Wang, Jian Xue, Jinyu Li, Takuya Yoshioka |
| 2024 | ICML | NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models. | Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Eric Liu, Yichong Leng, Kaitao Song, Siliang Tang, Zhizheng Wu, Tao Qin, Xiangyang Li, Wei Ye, Shikun Zhang, Jiang Bian, Lei He, Jinyu Li, Sheng Zhao |
| 2024 | Interspeech | An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS. | Xiaofei Wang, Sefik Emre Eskimez, Manthan Thakker, Hemin Yang, Zirun Zhu, Min Tang, Yufei Xia, Jinzhu Li, Sheng Zhao, Jinyu Li, Naoyuki Kanda |
| 2024 | Interspeech | Total-Duration-Aware Duration Modeling for Text-to-Speech Systems. | Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Chung-Hsien Tsai, Canrun Li, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Jinyu Li, Sheng Zhao, Naoyuki Kanda |
| 2024 | Interspeech | A multimodal approach to study the nature of coordinative patterns underlying speech rhythm. | Jinyu Li, Leonardo Lancia |
| 2024 | Interspeech | COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning. | Jing Pan, Jian Wu, Yashesh Gaur, Sunit Sivasankaran, Zhuo Chen, Shujie Liu, Jinyu Li |
| 2024 | Interspeech | Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation. | Peidong Wang, Jian Xue, Jinyu Li, Jun-Kun Chen, Aswin Shanmugam Subramanian |
| 2023 | ASRU | Improving Stability in Simultaneous Speech Translation: A Revision-Controllable Decoding Approach. | Jun-Kun Chen, Jian Xue, Peidong Wang, Jing Pan, Jinyu Li |
| 2023 | ASRU | Prompting Large Language Models for Zero-Shot Domain Adaptation in Speech Recognition. | Yuang Li, Yu Wu, Jinyu Li, Shujie Liu |
| 2023 | ASRU | Token-Level Serialized Output Training for Joint Streaming ASR and ST Leveraging Textual Alignments. | Sara Papi, Peidong Wang, Jun-Kun Chen, Jian Xue, Jinyu Li, Yashesh Gaur |
| 2023 | ASRU | Building High-Accuracy Multilingual ASR With Gated Language Experts and Curriculum Training. | Eric Sun, Jinyu Li, Yuxuan Hu, Yimeng Zhu, Long Zhou, Jian Xue, Peidong Wang, Linquan Liu, Shujie Liu, Edward Lin, Yifan Gong |
| 2023 | ASRU | On Decoder-Only Architecture For Speech-to-Text and Large Language Model Integration. | Jian Wu, Yashesh Gaur, Zhuo Chen, Long Zhou, Yimeng Zhu, Tianrui Wang, Jinyu Li, Shujie Liu, Bo Ren, Linquan Liu, Yu Wu |
| 2023 | ASRU | A Weakly-Supervised Streaming Multilingual Speech Model with Truly Zero-Shot Capability. | Jian Xue, Peidong Wang, Jinyu Li, Eric Sun |
| 2023 | CVPR | PillarNeXt: Rethinking Network Designs for 3D Object Detection in LiDAR Point Clouds. | Jinyu Li, Chenxu Luo, Xiaodong Yang |
| 2023 | ICASSP | Speech Separation with Large-Scale Self-Supervised Learning. | Zhuo Chen, Naoyuki Kanda, Jian Wu, Yu Wu, Xiaofei Wang, Takuya Yoshioka, Jinyu Li, Sunit Sivasankaran, Sefik Emre Eskimez |
| 2023 | ICASSP | CTCBERT: Advancing Hidden-Unit Bert with CTC Objectives. | Ruchao Fan, Yiming Wang, Yashesh Gaur, Jinyu Li |
| 2023 | ICASSP | LongFNT: Long-Form Speech Recognition with Factorized Neural Transducer. | Xun Gong, Yu Wu, Jinyu Li, Shujie Liu, Rui Zhao, Xie Chen, Yanmin Qian |
| 2023 | ICASSP | Self-Supervised Learning with Bi-Label Masked Speech Prediction for Streaming Multi-Talker Speech Recognition. | Zili Huang, Zhuo Chen, Naoyuki Kanda, Jian Wu, Yiming Wang, Jinyu Li, Takuya Yoshioka, Xiaofei Wang, Peidong Wang |
| 2023 | ICASSP | Vararray Meets T-Sot: Advancing the State of the Art of Streaming Distant Conversational Speech Recognition. | Naoyuki Kanda, Jian Wu, Xiaofei Wang, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2023 | ICASSP | Improving Contextual Spelling Correction by External Acoustics Attention and Semantic Aware Data Augmentation. | Xiaoqiang Wang, Yanqing Liu, Jinyu Li, Sheng Zhao |
| 2023 | ICASSP | Joint Pre-Training with Speech and Bilingual Text for Direct Speech to Speech Translation. | Kun Wei, Long Zhou, Ziqiang Zhang, Liping Chen, Shujie Liu, Lei He, Jinyu Li, Furu Wei |
| 2023 | ICASSP | Speaker Change Detection For Transformer Transducer ASR. | Jian Wu, Zhuo Chen, Min Hu, Xiong Xiao, Jinyu Li |
| 2023 | ICASSP | Simulating Realistic Speech Overlaps Improves Multi-Talker ASR. | Muqiao Yang, Naoyuki Kanda, Xiaofei Wang, Jian Wu, Sunit Sivasankaran, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2023 | ICASSP | Fast and Accurate Factorized Neural Transducer for Text Adaption of End-to-End Speech Recognition Models. | Rui Zhao, Jian Xue, Partha Parthasarathy, Veljko Miljanic, Jinyu Li |
| 2023 | IGARSS | Aligned Feature for Vector-Based Rotated Object Detection. | Yang Tian, Jinyu Li, Mengmeng Zhang |
| 2023 | Interspeech | Accurate and Structured Pruning for Efficient Automatic Speech Recognition. | Huiqiang Jiang, Li Lyna Zhang, Yuang Li, Yu Wu, Shijie Cao, Ting Cao, Yuqing Yang, Jinyu Li, Mao Yang, Lili Qiu |
| 2023 | Interspeech | Accelerating Transducers through Adjacent Token Merging. | Yuang Li, Yu Wu, Jinyu Li, Shujie Liu |
| 2023 | Interspeech | LAMASSU: A Streaming Language-Agnostic Multilingual Speech Recognition and Translation Model Using Neural Transducers. | Peidong Wang, Eric Sun, Jian Xue, Yu Wu, Long Zhou, Yashesh Gaur, Shujie Liu, Jinyu Li |
| 2022 | ACL | SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing. | Junyi Ao, Rui Wang, Long Zhou, Chengyi Wang, Shuo Ren, Yu Wu, Shujie Liu, Tom Ko, Qing Li, Yu Zhang, Zhihua Wei, Yao Qian, Jinyu Li, Furu Wei |
| 2022 | EMNLP | SpeechUT: Bridging Speech and Text with Hidden-Unit for Encoder-Decoder Based Speech-Text Pre-training. | Ziqiang Zhang, Long Zhou, Junyi Ao, Shujie Liu, Lirong Dai, Jinyu Li, Furu Wei |
| 2022 | ICASSP | Factorized Neural Transducer for Efficient Language Model Adaptation. | Xie Chen, Zhong Meng, Sarangarajan Parthasarathy, Jinyu Li |
| 2022 | ICASSP | Unispeech-Sat: Universal Speech Representation Learning With Speaker Aware Pre-Training. | Sanyuan Chen, Yu Wu, Chengyi Wang, Zhengyang Chen, Zhuo Chen, Shujie Liu, Jian Wu, Yao Qian, Furu Wei, Jinyu Li, Xiangzhan Yu |
| 2022 | ICASSP | Endpoint Detection for Streaming End-to-End Multi-Talker ASR. | Liang Lu, Jinyu Li, Yifan Gong |
| 2022 | ICASSP | Continuous Streaming Multi-Talker ASR with Dual-Path Transducers. | Desh Raj, Liang Lu, Zhuo Chen, Yashesh Gaur, Jinyu Li |
| 2022 | ICASSP | Wav2vec-Switch: Contrastive Learning from Original-Noisy Speech Pairs for Robust Speech Recognition. | Yiming Wang, Jinyu Li, Heming Wang, Yao Qian, Chengyi Wang, Yu Wu |
| 2022 | ICASSP | Improving Noise Robustness of Contrastive Speech Representation Learning with Speech Reconstruction. | Heming Wang, Yao Qian, Xiaofei Wang, Yiming Wang, Chengyi Wang, Shujie Liu, Takuya Yoshioka, Jinyu Li, DeLiang Wang |
| 2022 | ICASSP | Improving Self-Supervised Learning for Speech Recognition with Intermediate Layer Supervision. | Chengyi Wang, Yu Wu, Sanyuan Chen, Shujie Liu, Jinyu Li, Yao Qian, Zhenglu Yang |
| 2022 | ICASSP | Have Best of Both Worlds: Two-Pass Hybrid and E2E Cascading Framework for Speech Recognition. | Guoli Ye, Vadim Mazalov, Jinyu Li, Yifan Gong |
| 2022 | ICASSP | Continuous Speech Separation with Recurrent Selective Attention Network. | Yixuan Zhang, Zhuo Chen, Jian Wu, Takuya Yoshioka, Peidong Wang, Zhong Meng, Jinyu Li |
| 2022 | ICASSP | A Configurable Multilingual Model is All You Need to Recognize All Languages. | Long Zhou, Jinyu Li, Eric Sun, Shujie Liu |
| 2022 | ICDE | Tower Bridge Net (TB-Net): Bidirectional Knowledge Graph Aware Embedding Propagation for Explainable Recommender Systems. | Shendi Wang, Haoyang Li, Caleb Chen Cao, Xiao-Hui Li, Ng Ngai Fai, Jianxin Liu, Xun Xue, Hu Song, Jinyu Li, Guangye Gu, Lei Chen |
| 2022 | Interspeech | Pre-Training Transformer Decoder for End-to-End ASR Model with Unpaired Speech Data. | Junyi Ao, Ziqiang Zhang, Long Zhou, Shujie Liu, Haizhou Li, Tom Ko, Lirong Dai, Jinyu Li, Yao Qian, Furu Wei |
| 2022 | Interspeech | Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition? | Sanyuan Chen, Yu Wu, Chengyi Wang, Shujie Liu, Zhuo Chen, Peidong Wang, Gang Liu, Jinyu Li, Jian Wu, Xiangzhan Yu, Furu Wei |
| 2022 | Interspeech | Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings. | Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2022 | Interspeech | Streaming Multi-Talker ASR with Token-Level Serialized Output Training. | Naoyuki Kanda, Jian Wu, Yu Wu, Xiong Xiao, Zhong Meng, Xiaofei Wang, Yashesh Gaur, Zhuo Chen, Jinyu Li, Takuya Yoshioka |
| 2022 | Interspeech | Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition. | Zhong Meng, Yashesh Gaur, Naoyuki Kanda, Jinyu Li, Xie Chen, Yu Wu, Yifan Gong |
| 2022 | Interspeech | Supervision-Guided Codebooks for Masked Prediction in Speech Pre-training. | Chengyi Wang, Yiming Wang, Yu Wu, Sanyuan Chen, Jinyu Li, Shujie Liu, Furu Wei |
| 2022 | Interspeech | Large-Scale Streaming End-to-End Speech Translation with Neural Transducers. | Jian Xue, Peidong Wang, Jinyu Li, Matt Post, Yashesh Gaur |
| 2022 | Interspeech | Separating Long-Form Speech with Group-wise Permutation Invariant Training. | Wangyou Zhang, Zhuo Chen, Naoyuki Kanda, Shujie Liu, Jinyu Li, Sefik Emre Eskimez, Takuya Yoshioka, Xiong Xiao, Zhong Meng, Yanmin Qian, Furu Wei |
| 2022 | SMC | NewsThumbnail: Automatic Generation of News Video Thumbnail. | Jinyu Li, Shujin Lin, Fan Zhou, Ruomei Wang |
| 2021 | ASRU | On Addressing Practical Challenges for RNN-Transducer. | Rui Zhao, Jian Xue, Jinyu Li, Wenning Wei, Lei He, Yifan Gong |
| 2021 | ICASSP | Developing Real-Time Streaming Transformer Transducer for Speech Recognition on Large-Scale Dataset. | Xie Chen, Yu Wu, Zhenghao Wang, Shujie Liu, Jinyu Li |
| 2021 | ICASSP | Continuous Speech Separation with Conformer. | Sanyuan Chen, Yu Wu, Zhuo Chen, Jian Wu, Jinyu Li, Takuya Yoshioka, Chengyi Wang, Shujie Liu, Ming Zhou |
| 2021 | ICASSP | Internal Language Model Training for Domain-Adaptive End-To-End Speech Recognition. | Zhong Meng, Naoyuki Kanda, Yashesh Gaur, Sarangarajan Parthasarathy, Eric Sun, Liang Lu, Xie Chen, Jinyu Li, Yifan Gong |
| 2021 | ICASSP | Ensemble Combination between Different Time Segmentations. | Jeremy Heng Meng Wong, Dimitrios Dimitriadis, Ken'ichi Kumatani, Yashesh Gaur, George Polovets, Partha Parthasarathy, Eric Sun, Jinyu Li, Yifan Gong |
| 2021 | ICASSP | Microsoft Speaker Diarization System for the Voxceleb Speaker Recognition Challenge 2020. | Xiong Xiao, Naoyuki Kanda, Zhuo Chen, Tianyan Zhou, Takuya Yoshioka, Sanyuan Chen, Yong Zhao, Gang Liu, Yu Wu, Jian Wu, Shujie Liu, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | Streaming Multi-Talker Speech Recognition with Joint Speaker Identification. | Liang Lu, Naoyuki Kanda, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | On Minimum Word Error Rate Training of the Hybrid Autoregressive Transducer. | Liang Lu, Zhong Meng, Naoyuki Kanda, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | Rapid Speaker Adaptation for Conformer Transducer: Attention and Bias Are All You Need. | Yan Huang, Guoli Ye, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | Ultra Fast Speech Separation Model with Teacher Student Learning. | Sanyuan Chen, Yu Wu, Zhuo Chen, Jian Wu, Takuya Yoshioka, Shujie Liu, Jinyu Li, Xiangzhan Yu |
| 2021 | Interspeech | Improving RNN-T for Domain Scaling Using Semi-Supervised Training with Neural TTS. | Yan Deng, Rui Zhao, Zhong Meng, Xie Chen, Bing Liu, Jinyu Li, Yifan Gong, Lei He |
| 2021 | Interspeech | Multiple Softmax Architecture for Streaming Multilingual End-to-End ASR Systems. | Vikas Joshi, Amit Das, Eric Sun, Rupesh R. Mehta, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | Minimum Word Error Rate Training with Language Model Fusion for End-to-End Speech Recognition. | Zhong Meng, Yu Wu, Naoyuki Kanda, Liang Lu, Xie Chen, Guoli Ye, Eric Sun, Jinyu Li, Yifan Gong |
| 2021 | Interspeech | Improving Multilingual Transformer Transducer Models by Reducing Language Confusions. | Eric Sun, Jinyu Li, Zhong Meng, Yu Wu, Jian Xue, Shujie Liu, Yifan Gong |
| 2021 | Interspeech | A Light-Weight Contextual Spelling Correction Model for Customizing Transducer-Based Speech Recognition Systems. | Xiaoqiang Wang, Yanqing Liu, Sheng Zhao, Jinyu Li |
| 2021 | Interspeech | Investigation of Practical Aspects of Single Channel Speech Separation for ASR. | Jian Wu, Zhuo Chen, Sanyuan Chen, Yu Wu, Takuya Yoshioka, Naoyuki Kanda, Shujie Liu, Jinyu Li |
| 2020 | ICASSP | Using Personalized Speech Synthesis and Neural Language Generator for Rapid Speaker Adaptation. | Yan Huang, Lei He, Wenning Wei, William Gale, Jinyu Li, Yifan Gong |
| 2020 | ICASSP | Continuous Speech Separation: Dataset and Analysis. | Zhuo Chen, Takuya Yoshioka, Liang Lu, Tianyan Zhou, Zhong Meng, Yi Luo, Jian Wu, Xiong Xiao, Jinyu Li |
| 2020 | ICASSP | Exploring Pre-Training with Alignments for RNN Transducer Based End-to-End Speech Recognition. | Hu Hu, Rui Zhao, Jinyu Li, Liang Lu, Yifan Gong |
| 2020 | ICASSP | Minimum Latency Training Strategies for Streaming Sequence-to-Sequence ASR. | Hirofumi Inaguma, Yashesh Gaur, Liang Lu, Jinyu Li, Yifan Gong |
| 2020 | ICASSP | High-Accuracy and Low-Latency Speech Recognition with Two-Head Contextual Layer Trajectory LSTM Model. | Jinyu Li, Rui Zhao, Eric Sun, Jeremy Heng Meng Wong, Amit Das, Zhong Meng, Yifan Gong |
| 2020 | ICASSP | L-Vector: Neural Label Embedding for Domain Adaptation. | Zhong Meng, Hu Hu, Jinyu Li, Changliang Liu, Yan Huang, Yifan Gong, Chin-Hui Lee |
| 2020 | Interspeech | Semantic Mask for Transformer Based End-to-End Speech Recognition. | Chengyi Wang, Yu Wu, Yujiao Du, Jinyu Li, Shujie Liu, Liang Lu, Shuo Ren, Guoli Ye, Sheng Zhao, Ming Zhou |
| 2020 | Interspeech | Low Latency End-to-End Streaming Speech Recognition with a Scout Network. | Chengyi Wang, Yu Wu, Liang Lu, Shujie Liu, Jinyu Li, Guoli Ye, Ming Zhou |
| 2020 | Interspeech | Rapid RNN-T Adaptation Using Personalized Speech Synthesis and Neural Language Generator. | Yan Huang, Jinyu Li, Lei He, Wenning Wei, William Gale, Yifan Gong |
| 2020 | Interspeech | Transfer Learning Approaches for Streaming End-to-End Speech Recognition System. | Vikas Joshi, Rui Zhao, Rupesh R. Mehta, Kshitiz Kumar, Jinyu Li |
| 2020 | Interspeech | Sequence-Level Self-Learning with Multiple Hypotheses. | Ken'ichi Kumatani, Dimitrios Dimitriadis, Yashesh Gaur, Robert Gmyr, Sefik Emre Eskimez, Jinyu Li, Michael Zeng |
| 2020 | Interspeech | On the Comparison of Popular End-to-End Models for Large Scale Speech Recognition. | Jinyu Li, Yu Wu, Yashesh Gaur, Chengyi Wang, Rui Zhao, Shujie Liu |
| 2020 | Interspeech | Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability. | Jinyu Li, Rui Zhao, Zhong Meng, Yanqing Liu, Wenning Wei, Sarangarajan Parthasarathy, Vadim Mazalov, Zhenghao Wang, Lei He, Sheng Zhao, Yifan Gong |
| 2020 | Interspeech | Exploring Transformers for Large-Scale Speech Recognition. | Liang Lu, Changliang Liu, Jinyu Li, Yifan Gong |
| 2020 | Interspeech | Combination of End-to-End and Hybrid Models for Speech Recognition. | Jeremy Heng Meng Wong, Yashesh Gaur, Rui Zhao, Liang Lu, Eric Sun, Jinyu Li, Yifan Gong |
| 2020 | Interspeech | An End-to-End Architecture of Online Multi-Channel Speech Separation. | Jian Wu, Zhuo Chen, Jinyu Li, Takuya Yoshioka, Zhili Tan, Ed Lin, Yi Luo, Lei Xie |
| 2019 | ASRU | Improving RNN Transducer Modeling for End-to-End Speech Recognition. | Jinyu Li, Rui Zhao, Hu Hu, Yifan Gong |
| 2019 | ASRU | Character-Aware Attention-Based End-to-End Speech Recognition. | Zhong Meng, Yashesh Gaur, Jinyu Li, Yifan Gong |
| 2019 | ASRU | Domain Adaptation via Teacher-Student Learning for End-to-End Speech Recognition. | Zhong Meng, Jinyu Li, Yashesh Gaur, Yifan Gong |
| 2019 | ASRU | Speech Separation Using Speaker Inventory. | Peidong Wang, Zhuo Chen, Xiong Xiao, Zhong Meng, Takuya Yoshioka, Tianyan Zhou, Liang Lu, Jinyu Li |
| 2019 | ASRU | CNN with Phonetic Attention for Text-Independent Speaker Verification. | Tianyan Zhou, Yong Zhao, Jinyu Li, Yifan Gong, Jian Wu |
| 2019 | ICASSP | Universal Acoustic Modeling Using Neural Mixture Models. | Amit Das, Jinyu Li, Changliang Liu, Yifan Gong |
| 2019 | ICASSP | Improving Layer Trajectory LSTM with Future Context Frames. | Jinyu Li, Liang Lu, Changliang Liu, Yifan Gong |
| 2019 | ICASSP | Towards Code-switching ASR for End-to-end CTC Models. | Ke Li, Jinyu Li, Guoli Ye, Rui Zhao, Yifan Gong |
| 2019 | ICASSP | Adversarial Speaker Adaptation. | Zhong Meng, Jinyu Li, Yifan Gong |
| 2019 | ICASSP | Attentive Adversarial Learning for Domain-invariant Training. | Zhong Meng, Jinyu Li, Yifan Gong |
| 2019 | ICASSP | Conditional Teacher-student Learning. | Zhong Meng, Jinyu Li, Yong Zhao, Yifan Gong |
| 2019 | ICASSP | Adversarial Speaker Verification. | Zhong Meng, Yong Zhao, Jinyu Li, Yifan Gong |
| 2019 | ICDM | Prediction Approach for Ising Model Estimation. | Jinyu Li, Yu Pan, Hongfeng Yu, Qi Zhang |
| 2019 | Interspeech | Acoustic-to-Phrase Models for Speech Recognition. | Yashesh Gaur, Jinyu Li, Zhong Meng, Yifan Gong |
| 2019 | Interspeech | Speaker Adaptation for Attention-Based End-to-End Speech Recognition. | Zhong Meng, Yashesh Gaur, Jinyu Li, Yifan Gong |
| 2019 | Interspeech | Layer Trajectory BLSTM. | Eric Sun, Jinyu Li, Yifan Gong |
| 2019 | IROS | Rapid and Robust Monocular Visual-Inertial Initialization with Gravity Estimation via Vertical Edges. | Jinyu Li, Hujun Bao, Guofeng Zhang |
| 2018 | ICASSP | Advancing Connectionist Temporal Classification with Attention Modeling. | Amit Das, Jinyu Li, Rui Zhao, Yifan Gong |
| 2018 | ICASSP | Advancing Acoustic-to-Word CTC Model. | Jinyu Li, Guoli Ye, Amit Das, Rui Zhao, Yifan Gong |
| 2018 | ICASSP | Developing Far-Field Speaker System Via Teacher-Student Learning. | Jinyu Li, Rui Zhao, Zhuo Chen, Changliang Liu, Xiong Xiao, Guoli Ye, Yifan Gong |
| 2018 | ICASSP | Speaker-Invariant Training Via Adversarial Learning. | Zhong Meng, Jinyu Li, Zhuo Chen, Yang Zhao, Vadim Mazalov, Yifan Gong, Biing-Hwang Juang |
| 2018 | ICASSP | Adversarial Teacher-Student Learning for Unsupervised Domain Adaptation. | Zhong Meng, Jinyu Li, Yifan Gong, Biing-Hwang Juang |
| 2018 | ICASSP | Domain and Speaker Adaptation for Cortana Speech Recognition. | Yong Zhao, Jinyu Li, Shi-Xiong Zhang, Liping Chen, Yifan Gong |
| 2018 | Interspeech | Improved Training for Online End-to-end Speech Recognition Systems. | Suyoun Kim, Michael L. Seltzer, Jinyu Li, Rui Zhao |
| 2018 | Interspeech | Layer Trajectory LSTM. | Jinyu Li, Changliang Liu, Yifan Gong |
| 2018 | Interspeech | Cycle-Consistent Speech Enhancement. | Zhong Meng, Jinyu Li, Yifan Gong, Biing-Hwang Fred Juang |
| 2018 | Interspeech | Adversarial Feature-Mapping for Speech Enhancement. | Zhong Meng, Jinyu Li, Yifan Gong, Biing-Hwang Fred Juang |
| 2017 | ASRU | Cracking the cocktail party problem by multi-beam deep attractor network. | Zhuo Chen, Jinyu Li, Xiong Xiao, Takuya Yoshioka, Huaming Wang, Zhenghao Wang, Yifan Gong |
| 2017 | ASRU | Acoustic-to-word model without OOV. | Jinyu Li, Guoli Ye, Rui Zhao, Jasha Droppo, Yifan Gong |
| 2017 | ASRU | Unsupervised adaptation with domain separation networks for robust speech recognition. | Zhong Meng, Zhuo Chen, Vadim Mazalov, Jinyu Li, Yifan Gong |
| 2017 | ICASSP | Improved cepstra minimum-mean-square-error noise reduction algorithm for robust speech recognition. | Jinyu Li, Yan Huang, Yifan Gong |
| 2017 | ICASSP | Extended low-rank plus diagonal adaptation for deep and recurrent neural networks. | Yong Zhao, Jinyu Li, Kshitiz Kumar, Yifan Gong |
| 2017 | Interspeech | Improving Mask Learning Based Speech Enhancement System with Restoration Layers and Residual Connection. | Zhuo Chen, Yan Huang, Jinyu Li, Yifan Gong |
| 2017 | Interspeech | Large-Scale Domain Adaptation via Teacher-Student Learning. | Jinyu Li, Michael L. Seltzer, Xi Wang, Rui Zhao, Yifan Gong |
| 2016 | ICASSP | Exploring multidimensional lstms for large vocabulary ASR. | Jinyu Li, Abdelrahman Mohamed, Geoffrey Zweig, Yifan Gong |
| 2016 | ICASSP | Simplifying long short-term memory acoustic models for fast training and decoding. | Yajie Miao, Jinyu Li, Yongqiang Wang, Shi-Xiong Zhang, Yifan Gong |
| 2016 | ICASSP | Recurrent support vector machines for speech recognition. | Shi-Xiong Zhang, Rui Zhao, Chaojun Liu, Jinyu Li, Yifan Gong |
| 2016 | ICASSP | Low-rank plus diagonal adaptation for deep neural networks. | Yong Zhao, Jinyu Li, Yifan Gong |
| 2016 | Interspeech | Deep Convolutional Neural Networks with Layer-Wise Context Expansion and Attention. | Dong Yu, Wayne Xiong, Jasha Droppo, Andreas Stolcke, Guoli Ye, Jinyu Li, Geoffrey Zweig |
| 2015 | ASRU | LSTM time and frequency recurrence for automatic speech recognition. | Jinyu Li, Abdelrahman Mohamed, Geoffrey Zweig, Yifan Gong |
| 2015 | ICASSP | An analysis of convolutional neural networks for speech recognition. | Jui-Ting Huang, Jinyu Li, Yifan Gong |
| 2015 | ICASSP | Small-footprint high-performance deep neural network-based speech recognition using split-VQ. | Yongqiang Wang, Jinyu Li, Yifan Gong |
| 2015 | ICASSP | Investigating online low-footprint speaker adaptation using generalized linear regression and click-through data. | Yong Zhao, Jinyu Li, Jian Xue, Yifan Gong |
| 2015 | Interspeech | Rapid adaptation for deep neural networks through multi-task learning. | Zhen Huang, Jinyu Li, Sabato Marco Siniscalchi, I-Fan Chen, Ji Wu, Chin-Hui Lee |
| 2015 | Interspeech | Maximum a posteriori adaptation of network parameters in deep models. | Zhen Huang, Sabato Marco Siniscalchi, I-Fan Chen, Jinyu Li, Jiadong Wu, Chin-Hui Lee |
| 2015 | Interspeech | SVD-based universal DNN modeling for multiple scenarios. | Changliang Liu, Jinyu Li, Yifan Gong |
| 2014 | ICASSP | Factorized adaptation for deep neural network. | Jinyu Li, Jui-Ting Huang, Yifan Gong |
| 2014 | ICASSP | Investigation of maxout networks for speech recognition. | Pawel Swietojanski, Jinyu Li, Jui-Ting Huang |
| 2014 | ICASSP | Feature compensation using linear combination of speaker and environment dependent correction vectors. | Xiong Xiao, Jinyu Li, Engsiong Chng, Haizhou Li |
| 2014 | ICASSP | Singular value decomposition based low-footprint speaker adaptation and personalization for deep neural network. | Jian Xue, Jinyu Li, Dong Yu, Mike Seltzer, Yifan Gong |
| 2014 | Interspeech | Feature space maximum a posteriori linear regression for adaptation of deep neural networks. | Zhen Huang, Jinyu Li, Sabato Marco Siniscalchi, I-Fan Chen, Chao Weng, Chin-Hui Lee |
| 2014 | Interspeech | Beyond cross-entropy: towards better frame-level objective functions for deep neural network training in automatic speech recognition. | Zhen Huang, Jinyu Li, Chao Weng, Chin-Hui Lee |
| 2014 | Interspeech | Learning small-size DNN with output-distribution-based criteria. | Jinyu Li, Rui Zhao, Jui-Ting Huang, Yifan Gong |
| 2014 | Interspeech | Variable-component deep neural network for robust speech recognition. | Rui Zhao, Jinyu Li, Yifan Gong |
| 2013 | ICASSP | Recent advances in deep learning for speech research at Microsoft. | Li Deng, Jinyu Li, Jui-Ting Huang, Kaisheng Yao, Dong Yu, Frank Seide, Michael L. Seltzer, Geoffrey Zweig, Xiaodong He, Jason D. Williams, Yifan Gong, Alex Acero |
| 2013 | ICASSP | Cross-language knowledge transfer using multilingual deep neural network with shared hidden layers. | Jui-Ting Huang, Jinyu Li, Dong Yu, Li Deng, Yifan Gong |
| 2013 | Interspeech | Investigations on hessian-free optimization for cross-entropy training of deep neural networks. | Simon Wiesler, Jinyu Li, Jian Xue |
| 2013 | Interspeech | Restructuring of deep neural network acoustic models with singular value decomposition. | Jian Xue, Jinyu Li, Yifan Gong |
| 2012 | ICASSP | Improvements to VTS feature enhancement. | Jinyu Li, Michael L. Seltzer, Yifan Gong |
| 2012 | ICASSP | Lasso environment model combination for robust speech recognition. | Xiong Xiao, Jinyu Li, Engsiong Chng, Haizhou Li |
| 2012 | Interspeech | Efficient VTS Adaptation Using Jacobian Approximation. | Jinyu Li, Michael L. Seltzer, Yifan Gong |
| 2012 | Interspeech | Hermitian based Hidden Activation Functions for Adaptation of Hybrid HMM/ANN Models. | Sabato Marco Siniscalchi, Jinyu Li, Chin-Hui Lee |
| 2011 | ICASSP | Maximum likelihood adaptation of histogram equalization with constraint for robust speech recognition. | Xiong Xiao, Jinyu Li, Engsiong Chng, Haizhou Li |
| 2011 | Interspeech | Feature Normalization Using Structured Full Transforms for Robust Speech Recognition. | Xiong Xiao, Jinyu Li, Chng Eng Siong, Haizhou Li |
| 2010 | ICASSP | Word confidence calibration using a maximum entropy model with constraints on confidence and word distributions. | Dong Yu, Shizhen Wang, Jinyu Li, Li Deng |
| 2010 | Interspeech | Shrinkage model adaptation in automatic speech recognition. | Jinyu Li, Yu Tsao, Chin-Hui Lee |
| 2010 | Interspeech | Unscented transform with online distortion estimation for HMM adaptation. | Jinyu Li, Dong Yu, Yifan Gong, Li Deng |
| 2009 | ASRU | A study on hidden Markov model's generalization capability for speech recognition. | Xiong Xiao, Jinyu Li, Engsiong Chng, Haizhou Li, Chin-Hui Lee |
| 2009 | ICASSP | Ensemble speaker and speaking environment modeling approach with advanced online estimation process. | Yu Tsao, Jinyu Li, Chin-Hui Lee |
| 2009 | Interspeech | A study on soft margin estimation of linear regression parameters for speaker adaptation. | Shigeki Matsuda, Yu Tsao, Jinyu Li, Satoshi Nakamura, Chin-Hui Lee |
| 2008 | CSCWD | A cooperative engagement system based on dynamic workflow. | Jun Peng, Shufen Liu, Jinyu Li, Xiaoyan Wang, Tingting Qin |
| 2008 | ICASSP | HMM adaptation using a phase-sensitive acoustic distortion model for environment-robust speech recognition. | Jinyu Li, Li Deng, Dong Yu, Yifan Gong, Alex Acero |
| 2008 | ICASSP | Adaptation of compressed HMM parameters for resource-constrained speech recognition. | Jinyu Li, Li Deng, Dong Yu, Jian Wu, Yifan Gong, Alex Acero |
| 2008 | Interspeech | On a generalization of margin-based discriminative training to robust speech recognition. | Jinyu Li, Chin-Hui Lee |
| 2008 | Interspeech | Soft margin estimation with various separation levels for LVCSR. | Jinyu Li, Zhi-Jie Yan, Chin-Hui Lee, Ren-Hua Wang |
| 2007 | ASRU | High-performance hmm adaptation with joint compensation of additive and convolutive distortions via Vector Taylor Series. | Jinyu Li, Li Deng, Dong Yu, Yifan Gong, Alex Acero |
| 2007 | ASRU | A study on soft margin estimation for LVCSR. | Jinyu Li, Zhi-Jie Yan, Chin-Hui Lee, Ren-Hua Wang |
| 2007 | ICASSP | Approximate Test Risk Minimization Through Soft Margin Estimation. | Jinyu Li, Sabato Marco Siniscalchi, Chin-Hui Lee |
| 2007 | Interspeech | Detection-based ASR in the automatic speech attribute transcription project. | Ilana Bromberg, Qian Qian, Jun Hou, Jinyu Li, Chengyuan Ma, Brett Matthews, Antonio Moreno-Daniel, Jeremy Morris, Sabato Marco Siniscalchi, Yu Tsao, Yu Wang |
| 2007 | Interspeech | Soft margin feature extraction for automatic speech recognition. | Jinyu Li, Chin-Hui Lee |
| 2006 | Interspeech | Soft margin estimation of hidden Markov model parameters. | Jinyu Li, Ming Yuan, Chin-Hui Lee |
| 2006 | Interspeech | A study on lattice rescoring with knowledge scores for automatic speech recognition. | Sabato Marco Siniscalchi, Jinyu Li, Chin-Hui Lee |
| 2005 | ICASSP | A Study on Knowledge Source Integration for Candidate Rescoring in Automatic Speech Recognition. | Jinyu Li, Yu Tsao, Chin-Hui Lee |
| 2005 | Interspeech | On designing and evaluating speech event detectors. | Jinyu Li, Chin-Hui Lee |
| 2005 | Interspeech | A study on separation between acoustic models and its applications. | Yu Tsao, Jinyu Li, Chin-Hui Lee |
| 2001 | ICASSP | Relax frame independence assumption for standard hmms by state dependent auto-regressive feature models. | Ying Jia, Jinyu Li |
| 2000 | Interspeech | A novel search algorithm for LSF VQ. | Jinyu Li, Xin Luo, Ren-Hua Wang |