Skip to content

Tara N. Sainath

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

173

Venues

9

Active years

2006–2024

Best venue rank

A*

Where they publish

Papers

173 indexed papers, newest first.

YearVenueTitleAuthors
2024ACLHandling Ambiguity in Emotion: From Out-of-Domain Detection to Distribution Estimation.Wen Wu, Bo Li, Chao Zhang, Chung-Cheng Chiu, Qiujia Li, Junwen Bai, Tara N. Sainath, Philip C. Woodland
2024ICASSPEfficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR.Junwen Bai, Bo Li, Qiujia Li, Tara N. Sainath, Trevor Strohman
2024ICASSPUSM-Lite: Quantization and Sparsity Aware Fine-Tuning for Speech Recognition with Universal Speech Models.Shaojin Ding, David Qiu, David Rim, Yanzhang He, Oleg Rybakov, Bo Li, Rohit Prabhavalkar, Weiran Wang, Tara N. Sainath, Zhonglin Han, Jian Li, Amir Yazdanbakhsh, Shivani Agrawal
2024ICASSPImproving Speech Recognition for African American English with Audio Classification.Shefali Garg, Zhouyuan Huo, Khe Chai Sim, Suzan Schwartz, Mason Chua, Alna Aksnova, Tsendsuren Munkhdalai, Levi King, Darryl Wright, Zion Mengesha, Dongseong Hwang, Tara N. Sainath, Franoise Beaufays, Pedro Moreno Mengibar
2024ICASSPMultilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study.W. Ronny Huang, Cyril Allauzen, Tongzhou Chen, Kilol Gupta, Ke Hu, James Qin, Yu Zhang, Yongqiang Wang, Shuo-Yiin Chang, Tara N. Sainath
2024ICASSPExtreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models.Rohit Prabhavalkar, Zhong Meng, Weiran Wang, Adam Stooke, Xingyu Cai, Yanzhang He, Arun Narayanan, Dongseong Hwang, Tara N. Sainath, Pedro J. Moreno
2024ICASSPAugmenting Conformers With Structured State-Space Sequence Models For Online Speech Recognition.Haozhe Shan, Albert Gu, Zhong Meng, Weiran Wang, Krzysztof Choromanski, Tara N. Sainath
2024ICASSPA Comparison of Parameter-Efficient ASR Domain Adaptation Methods for Universal Speech and Language Models.Khe Chai Sim, Zhouyuan Huo, Tsendsuren Munkhdalai, Nikhil Siddhartha, Adam Stooke, Zhong Meng, Bo Li, Tara N. Sainath
2024InterspeechText Injection for Neural Contextual Biasing.Zhong Meng, Zelin Wu, Rohit Prabhavalkar, Cal Peyser, Weiran Wang, Nanxin Chen, Tara N. Sainath, Bhuvana Ramabhadran
2024NAACLMassive End-to-end Speech Recognition Models with Time Reduction.Weiran Wang, Rohit Prabhavalkar, Haozhe Shan, Zhong Meng, Dongseong Hwang, Qiujia Li, Khe Chai Sim, Bo Li, James Qin, Xingyu Cai, Adam Stooke, Chengjian Zheng, Yanzhang He, Tara N. Sainath, Pedro Moreno Mengibar
2023ASRUImproved Long-Form Speech Recognition By Jointly Modeling The Primary And Non-Primary Speakers.Guru Prakash Arumugam, Shuo-Yiin Chang, Tara N. Sainath, Rohit Prabhavalkar, Quan Wang, Shaan Bijwadia
2023ASRUEfficient Cascaded Streaming ASR System Via Frame Rate Reduction.Xingyu Cai, David Qiu, Shaojin Ding, Dongseong Hwang, Weiran Wang, Antoine Bruguier, Rohit Prabhavalkar, Tara N. Sainath, Yanzhang He
2023ASRUImproving Multilingual and Code-Switching ASR Using Large Language Model Generated Text.Ke Hu, Tara N. Sainath, Bo Li, Yu Zhang, Yong Cheng, Tao Wang, Yujing Zhang, Frederick Liu
2023ICASSPLego-Features: Exporting Modular Encoder Features for Streaming and Deliberation ASR.Rami Botros, Rohit Prabhavalkar, Johan Schalkwyk, Ciprian Chelba, Tara N. Sainath, Franoise Beaufays
2023ICASSPContext-Aware end-to-end ASR Using Self-Attentive Embedding and Tensor Fusion.Shuo-Yiin Chang, Chao Zhang, Tara N. Sainath, Bo Li, Trevor Strohman
2023ICASSPSharing Low Rank Conformer Weights for Tiny Always-On Ambient Speech Recognition Models.Steven M. Hernandez, Ding Zhao, Shaojin Ding, Antoine Bruguier, Rohit Prabhavalkar, Tara N. Sainath, Yanzhang He, Ian McGraw
2023ICASSPE2E Segmentation in a Two-Pass Cascaded Encoder ASR Model.W. Ronny Huang, Shuo-Yiin Chang, Tara N. Sainath, Yanzhang He, David Rybach, Robert David, Rohit Prabhavalkar, Cyril Allauzen, Cal Peyser, Trevor D. Strohman
2023ICASSPResource-Efficient Transfer Learning from Speech Foundation Model Using Hierarchical Feature Fusion.Zhouyuan Huo, Khe Chai Sim, Bo Li, Dongseong Hwang, Tara N. Sainath, Trevor Strohman
2023ICASSPMassively Multilingual Shallow Fusion with Large Language Models.Ke Hu, Tara N. Sainath, Bo Li, Nan Du, Yanping Huang, Andrew M. Dai, Yu Zhang, Rodrigo Cabrera, Zhifeng Chen, Trevor Strohman
2023ICASSPEfficient Domain Adaptation for Speech Foundation Models.Bo Li, Dongseong Hwang, Zhouyuan Huo, Junwen Bai, Guru Prakash, Tara N. Sainath, Khe Chai Sim, Yu Zhang, Wei Han, Trevor Strohman, Franoise Beaufays
2023ICASSPJEIT: Joint End-to-End Model and Internal Language Model Training for Speech Recognition.Zhong Meng, Weiran Wang, Rohit Prabhavalkar, Tara N. Sainath, Tongzhou Chen, Ehsan Variani, Yu Zhang, Bo Li, Andrew Rosenberg, Bhuvana Ramabhadran
2023ICASSPA Comparison of Semi-Supervised Learning Techniques for Streaming ASR at Scale.Cal Peyser, Michael Picheny, Kyunghyun Cho, Rohit Prabhavalkar, W. Ronny Huang, Tara N. Sainath
2023ICASSPImproving Contextual Biasing with Text Injection.Tara N. Sainath, Rohit Prabhavalkar, Diamantino Caseiro, Pat Rondon, Cyril Allauzen
2023ICASSPMulti-Output RNN-T Joint Networks for Multi-Task Learning of ASR and Auxiliary Tasks.Weiran Wang, Ding Zhao, Shaojin Ding, Hao Zhang, Shuo-Yiin Chang, David Rybach, Tara N. Sainath, Yanzhang He, Ian McGraw, Shankar Kumar
2023ICASSPFrom English to More Languages: Parameter-Efficient Model Reprogramming for Cross-Lingual Speech Recognition.Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Rohit Prabhavalkar, Tara N. Sainath, Trevor Strohman
2023ICASSPA Quantum Kernel Learning Approach to Acoustic Modeling for Spoken Command Recognition.Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Tara N. Sainath, Sabato Marco Siniscalchi, Chin-Hui Lee
2023ICASSPUML: A Universal Monolingual Output Layer For Multilingual Asr.Chao Zhang, Bo Li, Tara N. Sainath, Trevor Strohman, Shuo-Yiin Chang
2023InterspeechHow to Estimate Model Transferability of Pre-Trained Speech Models?Zih-Ching Chen, Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Shuo-Yiin Chang, Rohit Prabhavalkar, Hung-yi Lee, Tara N. Sainath
2023InterspeechMixture-of-Expert Conformer for Streaming Multilingual ASR.Ke Hu, Bo Li, Tara N. Sainath, Yu Zhang, Franoise Beaufays
2023InterspeechSemantic Segmentation with Bidirectional Language Models Improves Long-form ASR.W. Ronny Huang, Hao Zhang, Shankar Kumar, Shuo-Yiin Chang, Tara N. Sainath
2023InterspeechRe-investigating the Efficient Transfer Learning of Speech Foundation Model using Feature Fusion Methods.Zhouyuan Huo, Khe Chai Sim, Dongseong Hwang, Tsendsuren Munkhdalai, Tara N. Sainath, Pedro Moreno Mengibar
2023InterspeechModular Domain Adaptation for Conformer-Based Streaming ASR.Qiujia Li, Bo Li, Dongseong Hwang, Tara N. Sainath, Pedro Moreno Mengibar
2023InterspeechImproving Joint Speech-Text Representations Without Alignment.Cal Peyser, Zhong Meng, Rohit Prabhavalkar, Andrew Rosenberg, Tara N. Sainath, Michael Picheny, Kyunghyun Cho, Ke Hu
2022ICASSPJoint Unsupervised and Supervised Training for Multilingual ASR.Junwen Bai, Bo Li, Yu Zhang, Ankur Bapna, Nikhil Siddhartha, Khe Chai Sim, Tara N. Sainath
2022ICASSPTransducer-Based Streaming Deliberation for Cascaded Encoders.Ke Hu, Tara N. Sainath, Arun Narayanan, Ruoming Pang, Trevor Strohman
2022ICASSPMassively Multilingual ASR: A Lifelong Learning Solution.Bo Li, Ruoming Pang, Yu Zhang, Tara N. Sainath, Trevor Strohman, Parisa Haghani, Yun Zhu, Brian Farris, Neeraj Gaur, Manasa Prasad
2022ICASSPImproving The Latency And Quality Of Cascaded Encoders.Tara N. Sainath, Yanzhang He, Arun Narayanan, Rami Botros, Weiran Wang, David Qiu, Chung-Cheng Chiu, Rohit Prabhavalkar, Alexander Gruenstein, Anmol Gulati, Bo Li, David Rybach, Emmanuel Guzman, Ian McGraw, James Qin, Krzysztof Choromanski, Qiao Liang, Robert David, Ruoming Pang, Shuo-Yiin Chang, Trevor Strohman, W. Ronny Huang, Wei Han, Yonghui Wu, Yu Zhang
2022ICASSPDeliberation of Streaming RNN-Transducer by Non-Autoregressive Decoding.Weiran Wang, Ke Hu, Tara N. Sainath
2022ICASSPImproving the Fusion of Acoustic and Text Representations in RNN-T.Chao Zhang, Bo Li, Zhiyun Lu, Tara N. Sainath, Shuo-Yiin Chang
2022InterspeechTurn-Taking Prediction for Natural Conversational Speech.Shuo-Yiin Chang, Bo Li, Tara N. Sainath, Chao Zhang, Trevor Strohman, Qiao Liang, Yanzhang He
2022InterspeechStreaming Intended Query Detection using E2E Modeling for Continued Conversation.Shuo-Yiin Chang, Guru Prakash, Zelin Wu, Tara N. Sainath, Bo Li, Qiao Liang, Adam Stambler, Shyam Upadhyay, Manaal Faruqui, Trevor Strohman
2022InterspeechA Unified Cascaded Encoder ASR Model for Dynamic Model Sizes.Shaojin Ding, Weiran Wang, Ding Zhao, Tara N. Sainath, Yanzhang He, Robert David, Rami Botros, Xin Wang, Rina Panigrahy, Qiao Liang, Dongseong Hwang, Ian McGraw, Rohit Prabhavalkar, Trevor Strohman
2022InterspeechE2E Segmenter: Joint Segmenting and Decoding for Long-Form ASR.W. Ronny Huang, Shuo-Yiin Chang, David Rybach, Tara N. Sainath, Rohit Prabhavalkar, Cal Peyser, Zhiyun Lu, Cyril Allauzen
2022InterspeechSentence-Select: Large-Scale Language Model Data Selection for Rare-Word Speech Recognition.W. Ronny Huang, Cal Peyser, Tara N. Sainath, Ruoming Pang, Trevor D. Strohman, Shankar Kumar
2022InterspeechImproving Deliberation by Text-Only and Semi-Supervised Training.Ke Hu, Tara N. Sainath, Yanzhang He, Rohit Prabhavalkar, Trevor Strohman, Sepand Mavandadi, Weiran Wang
2022InterspeechA Language Agnostic Multilingual Streaming On-Device ASR System.Bo Li, Tara N. Sainath, Ruoming Pang, Shuo-Yiin Chang, Qiumin Xu, Trevor Strohman, Vince Chen, Qiao Liang, Heguang Liu, Yanzhang He, Parisa Haghani, Sameer Bidichandani
2022InterspeechTowards Disentangled Speech Representations.Cal Peyser, W. Ronny Huang, Andrew Rosenberg, Tara N. Sainath, Michael Picheny, Kyunghyun Cho
2022InterspeechImproving Rare Word Recognition with LM-aware MWER Training.Weiran Wang, Tongzhou Chen, Tara N. Sainath, Ehsan Variani, Rohit Prabhavalkar, W. Ronny Huang, Bhuvana Ramabhadran, Neeraj Gaur, Sepand Mavandadi, Cal Peyser, Trevor Strohman, Yanzhang He, David Rybach
2022InterspeechStreaming Align-Refine for Non-autoregressive Deliberation.Weiran Wang, Ke Hu, Tara N. Sainath
2022InterspeechStreaming End-to-End Multilingual Speech Recognition with Joint Language Identification.Chao Zhang, Bo Li, Tara N. Sainath, Trevor Strohman, Sepand Mavandadi, Shuo-Yiin Chang, Parisa Haghani
2021ASRUScaling End-to-End Models for Large-Scale Multilingual ASR.Bo Li, Ruoming Pang, Tara N. Sainath, Anmol Gulati, Yu Zhang, James Qin, Parisa Haghani, W. Ronny Huang, Min Ma, Junwen Bai
2021ICASSPA Better and Faster end-to-end Model for Streaming ASR.Bo Li, Anmol Gulati, Jiahui Yu, Tara N. Sainath, Chung-Cheng Chiu, Arun Narayanan, Shuo-Yiin Chang, Ruoming Pang, Yanzhang He, James Qin, Wei Han, Qiao Liang, Yu Zhang, Trevor Strohman, Yonghui Wu
2021ICASSPCascaded Encoders for Unifying Streaming and Non-Streaming ASR.Arun Narayanan, Tara N. Sainath, Ruoming Pang, Jiahui Yu, Chung-Cheng Chiu, Rohit Prabhavalkar, Ehsan Variani, Trevor Strohman
2021ICASSPLess is More: Improved RNN-T Decoding Using Limited Label Context and Path Merging.Rohit Prabhavalkar, Yanzhang He, David Rybach, Sean Campbell, Arun Narayanan, Trevor Strohman, Tara N. Sainath
2021ICASSPLearning Word-Level Confidence for Subword End-To-End ASR.David Qiu, Qiujia Li, Yanzhang He, Yu Zhang, Bo Li, Liangliang Cao, Rohit Prabhavalkar, Deepti Bhatia, Wei Li, Ke Hu, Tara N. Sainath, Ian McGraw
2021ICASSPEcho State Speech Recognition.Harsh Shrivastava, Ankush Garg, Yuan Cao, Yu Zhang, Tara N. Sainath
2021ICASSPFastEmit: Low-Latency Streaming ASR with Sequence-Level Emission Regularization.Jiahui Yu, Chung-Cheng Chiu, Bo Li, Shuo-Yiin Chang, Tara N. Sainath, Yanzhang He, Arun Narayanan, Wei Han, Anmol Gulati, Yonghui Wu, Ruoming Pang
2021ICLRDual-mode ASR: Unify and Improve Streaming ASR with Full-context Modeling.Jiahui Yu, Wei Han, Anmol Gulati, Chung-Cheng Chiu, Bo Li, Tara N. Sainath, Yonghui Wu, Ruoming Pang
2021InterspeechTied & Reduced RNN-T Decoder.Rami Botros, Tara N. Sainath, Robert David, Emmanuel Guzman, Wei Li, Yanzhang He
2021InterspeechLookup-Table Recurrent Language Models for Long Tail Speech Recognition.W. Ronny Huang, Tara N. Sainath, Cal Peyser, Shankar Kumar, David Rybach, Trevor Strohman
2021InterspeechA Deliberation-Based Joint Acoustic and Text Decoder.Sepand Mavandadi, Tara N. Sainath, Ke Hu, Zelin Wu
2021InterspeechAn Efficient Streaming Non-Recurrent On-Device End-to-End Model with Improvements to Rare-Word Modeling.Tara N. Sainath, Yanzhang He, Arun Narayanan, Rami Botros, Ruoming Pang, David Rybach, Cyril Allauzen, Ehsan Variani, James Qin, Quoc-Nam Le-The, Shuo-Yiin Chang, Bo Li, Anmol Gulati, Jiahui Yu, Chung-Cheng Chiu, Diamantino Caseiro, Wei Li, Qiao Liang, Pat Rondon
2021InterspeechMultitask Training with Text Data for End-to-End Speech Recognition.Peidong Wang, Tara N. Sainath, Ron J. Weiss
2020ICASSPDeliberation Model Based Two-Pass End-To-End Speech Recognition.Ke Hu, Tara N. Sainath, Ruoming Pang, Rohit Prabhavalkar
2020ICASSPTowards Fast and Accurate Streaming End-To-End ASR.Bo Li, Shuo-Yiin Chang, Tara N. Sainath, Ruoming Pang, Yanzhang He, Trevor Strohman, Yonghui Wu
2020ICASSPImproving Proper Noun Recognition in End-To-End Asr by Customization of the Mwer Loss Criterion.Cal Peyser, Tara N. Sainath, Golan Pundak
2020ICASSPA Streaming On-Device End-To-End Model Surpassing Server-Side Conventional Model Quality and Latency.Tara N. Sainath, Yanzhang He, Bo Li, Arun Narayanan, Ruoming Pang, Antoine Bruguier, Shuo-Yiin Chang, Wei Li, Raziel Alvarez, Zhifeng Chen, Chung-Cheng Chiu, David Garcia, Alexander Gruenstein, Ke Hu, Anjuli Kannan, Qiao Liang, Ian McGraw, Cal Peyser, Rohit Prabhavalkar, Golan Pundak, David Rybach, Yuan Shangguan, Yash Sheth, Trevor Strohman, Mirk Visontai, Yonghui Wu, Yu Zhang, Ding Zhao
2020ICASSPAn Attention-Based Joint Acoustic and Text on-Device End-To-End Model.Tara N. Sainath, Ruoming Pang, Ron J. Weiss, Yanzhang He, Chung-Cheng Chiu, Trevor Strohman
2020ICASSPMultistate Encoding with End-To-End Speech RNN Transducer Network.Zelin Wu, Bo Li, Yu Zhang, Petar S. Aleksic, Tara N. Sainath
2020InterspeechLow Latency Speech Recognition Using End-to-End Prefetching.Shuo-Yiin Chang, Bo Li, David Rybach, Yanzhang He, Wei Li, Tara N. Sainath, Trevor Strohman
2020InterspeechImproving Tail Performance of a Deliberation E2E ASR Model Using a Large Text Corpus.Cal Peyser, Sepand Mavandadi, Tara N. Sainath, James Apfel, Ruoming Pang, Shankar Kumar
2020InterspeechEmitting Word Timings with End-to-End Models.Tara N. Sainath, Ruoming Pang, David Rybach, Basi Garca, Trevor Strohman
2019ASRUA Comparison of End-to-End Models for Long-Form Speech Recognition.Chung-Cheng Chiu, Anjuli Kannan, Rohit Prabhavalkar, Zhifeng Chen, Tara N. Sainath, Yonghui Wu, Wei Han, Yu Zhang, Ruoming Pang, Sergey Kishchenko, Patrick Nguyen, Arun Narayanan, Hank Liao, Shuyuan Zhang
2019ASRURecognizing Long-Form Speech Using Streaming End-to-End Models.Arun Narayanan, Rohit Prabhavalkar, Chung-Cheng Chiu, David Rybach, Tara N. Sainath, Trevor Strohman
2019ICASSPContextual Speech Recognition with Difficult Negative Training Examples.Uri Alon, Golan Pundak, Tara N. Sainath
2019ICASSPSemi-supervised Training for End-to-end Models via Weak Distillation.Bo Li, Tara N. Sainath, Ruoming Pang, Zelin Wu
2019ICASSPPhoebe: Pronunciation-aware Contextualization for End-to-end Speech Recognition.Antoine Bruguier, Rohit Prabhavalkar, Golan Pundak, Tara N. Sainath
2019ICASSPJoint Endpointing and Decoding with End-to-end Models.Shuo-Yiin Chang, Rohit Prabhavalkar, Yanzhang He, Tara N. Sainath, Gabor Simko
2019ICASSPA Spelling Correction Model for End-to-end Speech Recognition.Jinxi Guo, Tara N. Sainath, Ron J. Weiss
2019ICASSPStreaming End-to-end Speech Recognition for Mobile Devices.Yanzhang He, Tara N. Sainath, Rohit Prabhavalkar, Ian McGraw, Raziel Alvarez, Ding Zhao, David Rybach, Anjuli Kannan, Yonghui Wu, Ruoming Pang, Qiao Liang, Deepti Bhatia, Yuan Shangguan, Bo Li, Golan Pundak, Khe Chai Sim, Tom Bagby, Shuo-Yiin Chang, Kanishka Rao, Alexander Gruenstein
2019ICASSPBytes Are All You Need: End-to-end Multilingual Speech Recognition and Synthesis with Bytes.Bo Li, Yu Zhang, Tara N. Sainath, Yonghui Wu, William Chan
2019InterspeechPhoneme-Based Contextualization for Cross-Lingual Speech Recognition in End-to-End Models.Ke Hu, Antoine Bruguier, Tara N. Sainath, Rohit Prabhavalkar, Golan Pundak
2019InterspeechLarge-Scale Multilingual Speech Recognition with a Streaming End-to-End Model.Anjuli Kannan, Arindrima Datta, Tara N. Sainath, Eugene Weinstein, Bhuvana Ramabhadran, Yonghui Wu, Ankur Bapna, Zhifeng Chen, Seungji Lee
2019InterspeechImproving Performance of End-to-End ASR on Numeric Sequences.Cal Peyser, Hao Zhang, Tara N. Sainath, Zelin Wu
2019InterspeechTwo-Pass End-to-End Speech Recognition.Tara N. Sainath, Ruoming Pang, David Rybach, Yanzhang He, Rohit Prabhavalkar, Wei Li, Mirk Visontai, Qiao Liang, Trevor Strohman, Yonghui Wu, Ian McGraw, Chung-Cheng Chiu
2019InterspeechShallow-Fusion End-to-End Contextual Biasing.Ding Zhao, Tara N. Sainath, David Rybach, Pat Rondon, Deepti Bhatia, Bo Li, Ruoming Pang
2018ICASSPTemporal Modeling Using Dilated Convolution and Gating for Voice-Activity-Detection.Shuo-Yiin Chang, Bo Li, Gabor Simko, Tara N. Sainath, Anshuman Tripathi, Aron van den Oord, Oriol Vinyals
2018ICASSPState-of-the-Art Speech Recognition with Sequence-to-Sequence Models.Chung-Cheng Chiu, Tara N. Sainath, Yonghui Wu, Rohit Prabhavalkar, Patrick Nguyen, Zhifeng Chen, Anjuli Kannan, Ron J. Weiss, Kanishka Rao, Ekaterina Gonina, Navdeep Jaitly, Bo Li, Jan Chorowski, Michiel Bacchiani
2018ICASSPPerformance of Mask Based Statistical Beamforming in a Smart Home Scenario.Jahn Heymann, Michiel Bacchiani, Tara N. Sainath
2018ICASSPAn Analysis of Incorporating an External Language Model into a Sequence-to-Sequence Model.Anjuli Kannan, Yonghui Wu, Patrick Nguyen, Tara N. Sainath, Zhifeng Chen, Rohit Prabhavalkar
2018ICASSPSpectral Distortion Model for Training Phase-Sensitive Deep-Neural Networks for Far-Field Speech Recognition.Chanwoo Kim, Tara N. Sainath, Arun Narayanan, Ananya Misra, Rajeev C. Nongpiur, Michiel Bacchiani
2018ICASSPMulti-Dialect Speech Recognition with a Single Sequence-to-Sequence Model.Bo Li, Tara N. Sainath, Khe Chai Sim, Michiel Bacchiani, Eugene Weinstein, Patrick Nguyen, Zhifeng Chen, Yanghui Wu, Kanishka Rao
2018ICASSPMinimum Word Error Rate Training for Attention-Based Sequence-to-Sequence Models.Rohit Prabhavalkar, Tara N. Sainath, Yonghui Wu, Patrick Nguyen, Zhifeng Chen, Chung-Cheng Chiu, Anjuli Kannan
2018ICASSPImproving the Performance of Online Neural Transducer Models.Tara N. Sainath, Chung-Cheng Chiu, Rohit Prabhavalkar, Anjuli Kannan, Yonghui Wu, Patrick Nguyen, Zhifeng Chen
2018ICASSPNo Need for a Lexicon? Evaluating the Value of the Pronunciation Lexica in End-to-End Models.Tara N. Sainath, Rohit Prabhavalkar, Shankar Kumar, Seungji Lee, Anjuli Kannan, David Rybach, Vlad Schogol, Patrick Nguyen, Bo Li, Yonghui Wu, Zhifeng Chen, Chung-Cheng Chiu
2018ICASSPMultilingual Speech Recognition with a Single End-to-End Model.Shubham Toshniwal, Tara N. Sainath, Ron J. Weiss, Bo Li, Pedro J. Moreno, Eugene Weinstein, Kanishka Rao
2018InterspeechCompression of End-to-End Models.Ruoming Pang, Tara N. Sainath, Rohit Prabhavalkar, Suyog Gupta, Yonghui Wu, Shuyuan Zhang, Chung-Cheng Chiu
2018InterspeechDomain Adaptation Using Factorized Hidden Layer for Robust Automatic Speech Recognition.Khe Chai Sim, Arun Narayanan, Ananya Misra, Anshuman Tripathi, Golan Pundak, Tara N. Sainath, Parisa Haghani, Bo Li, Michiel Bacchiani
2018InterspeechContextual Speech Recognition in End-to-end Neural Network Systems Using Beam Search.Ian Williams, Anjuli Kannan, Petar S. Aleksic, David Rybach, Tara N. Sainath
2017ASRUImproving the efficiency of forward-backward algorithm using batched computation in TensorFlow.Khe Chai Sim, Arun Narayanan, Tom Bagby, Tara N. Sainath, Michiel Bacchiani
2017InterspeechEndpoint Detection Using Grid Long Short-Term Memory Networks for Streaming Speech Recognition.Shuo-Yiin Chang, Bo Li, Tara N. Sainath, Gabor Simko, Carolina Parada
2017InterspeechGeneration of Large-Scale Simulated Utterances in Virtual Rooms to Train Deep-Neural Networks for Far-Field Speech Recognition in Google Home.Chanwoo Kim, Ananya Misra, Kean K. Chin, Thad Hughes, Arun Narayanan, Tara N. Sainath, Michiel Bacchiani
2017InterspeechReducing the Computational Complexity of Two-Dimensional LSTMs.Bo Li, Tara N. Sainath
2017InterspeechAcoustic Modeling for Google Home.Bo Li, Tara N. Sainath, Arun Narayanan, Joe Caroselli, Michiel Bacchiani, Ananya Misra, Izhak Shafran, Hasim Sak, Golan Pundak, Kean K. Chin, Khe Chai Sim, Ron J. Weiss, Kevin W. Wilson, Ehsan Variani, Chanwoo Kim, Olivier Siohan, Mitchel Weintraub, Erik McDermott, Richard Rose, Matt Shannon
2017InterspeechA Comparison of Sequence-to-Sequence Models for Speech Recognition.Rohit Prabhavalkar, Kanishka Rao, Tara N. Sainath, Bo Li, Leif Johnson, Navdeep Jaitly
2017InterspeechAn Analysis of "Attention" in Sequence-to-Sequence Models.Rohit Prabhavalkar, Tara N. Sainath, Bo Li, Kanishka Rao, Navdeep Jaitly
2017InterspeechHighway-LSTM and Recurrent Highway Networks for Speech Recognition.Golan Pundak, Tara N. Sainath
2017InterspeechAnnealed f-Smoothing as a Mechanism to Speed up Neural Network Training.Tara N. Sainath, Vijayaditya Peddinti, Olivier Siohan, Arun Narayanan
2016ICASSPLearning compact recurrent neural networks.Zhiyun Lu, Vikas Sindhwani, Tara N. Sainath
2016ICASSPFactored spatial and spectral multichannel raw waveform CLDNNs.Tara N. Sainath, Ron J. Weiss, Kevin W. Wilson, Arun Narayanan, Michiel Bacchiani
2016InterspeechNeural Network Adaptive Beamforming for Robust Multichannel Speech Recognition.Bo Li, Tara N. Sainath, Ron J. Weiss, Kevin W. Wilson, Michiel Bacchiani
2016InterspeechLower Frame Rate Neural Network Acoustic Models.Golan Pundak, Tara N. Sainath
2016InterspeechModeling Time-Frequency Patterns with LSTM vs. Convolutional Architectures for LVCSR Tasks.Tara N. Sainath, Bo Li
2016InterspeechReducing the Computational Complexity of Multimicrophone Acoustic Models with Integrated Feature Extraction.Tara N. Sainath, Arun Narayanan, Ron J. Weiss, Ehsan Variani, Kevin W. Wilson, Michiel Bacchiani, Izhak Shafran
2016InterspeechComplex Linear Projection (CLP): A Discriminative Approach to Joint Feature Extraction and Acoustic Modeling.Ehsan Variani, Tara N. Sainath, Izhak Shafran, Michiel Bacchiani
2016InterspeechFeature Learning with Raw-Waveform CLDNNs for Voice Activity Detection.Rubn Zazo, Tara N. Sainath, Gabor Simko, Carolina Parada
2015ASRUSpeaker location and microphone spacing invariant acoustic modeling from raw multichannel waveforms.Tara N. Sainath, Ron J. Weiss, Kevin W. Wilson, Arun Narayanan, Michiel Bacchiani, Andrew W. Senior
2015ASRUAcoustic modelling with CD-CTC-SMBR LSTM RNNS.Andrew W. Senior, Hasim Sak, Felix de Chaumont Quitry, Tara N. Sainath, Kanishka Rao
2015ICASSPQuery-by-example keyword spotting using long short-term memory networks.Guoguo Chen, Carolina Parada, Tara N. Sainath
2015ICASSPAutomatic gain control and multi-style training for robust small-footprint keyword spotting with deep neural networks.Rohit Prabhavalkar, Raziel Alvarez, Carolina Parada, Preetum Nakkiran, Tara N. Sainath
2015ICASSPConvolutional, Long Short-Term Memory, fully connected Deep Neural Networks.Tara N. Sainath, Oriol Vinyals, Andrew W. Senior, Hasim Sak
2015InterspeechLocally-connected and convolutional neural networks for small footprint speaker recognition.Yu-hsin Chen, Ignacio Lpez-Moreno, Tara N. Sainath, Mirk Visontai, Raziel Alvarez, Carolina Parada
2015InterspeechLarge vocabulary automatic speech recognition for children.Hank Liao, Golan Pundak, Olivier Siohan, Melissa K. Carroll, Noah Coccaro, Qi-Ming Jiang, Tara N. Sainath, Andrew W. Senior, Franoise Beaufays, Michiel Bacchiani
2015InterspeechConvolutional neural networks for small-footprint keyword spotting.Tara N. Sainath, Carolina Parada
2015InterspeechLearning the speech front-end with raw waveform CLDNNs.Tara N. Sainath, Ron J. Weiss, Andrew W. Senior, Kevin W. Wilson, Oriol Vinyals
2014ICASSPKernel methods match Deep Neural Networks on TIMIT.Po-Sen Huang, Haim Avron, Tara N. Sainath, Vikas Sindhwani, Bhuvana Ramabhadran
2014ICASSPDeep Scattering Spectrum with deep neural networks.Vijayaditya Peddinti, Tara N. Sainath, Shay Maymon, Bhuvana Ramabhadran, David Nahamoo, Vaibhava Goel
2014ICASSPImprovements to filterbank and delta learning within a deep neural network framework.Tara N. Sainath, Brian Kingsbury, Abdel-rahman Mohamed, George Saon, Bhuvana Ramabhadran
2014ICASSPJoint training of convolutional and non-convolutional neural networks.Hagen Soltau, George Saon, Tara N. Sainath
2014InterspeechParallel deep neural network training for LVCSR tasks using blue gene/Q.Tara N. Sainath, I-Hsin Chung, Bhuvana Ramabhadran, Michael Picheny, John A. Gunnels, Brian Kingsbury, George Saon, Vernon Austel, Upendra V. Chaudhari
2014InterspeechDeep scattering spectra with deep neural networks for LVCSR tasks.Tara N. Sainath, Vijayaditya Peddinti, Brian Kingsbury, Petr Fousek, Bhuvana Ramabhadran, David Nahamoo
2014SCParallel Deep Neural Network Training for Big Data on Blue Gene/Q.I-Hsin Chung, Tara N. Sainath, Bhuvana Ramabhadran, Michael Picheny, John A. Gunnels, Vernon Austel, Upendra V. Chaudhari, Brian Kingsbury
2013ASRUAccelerating Hessian-free optimization for Deep Neural Networks by implicit preconditioning and sampling.Tara N. Sainath, Lior Horesh, Brian Kingsbury, Aleksandr Y. Aravkin, Bhuvana Ramabhadran
2013ASRUImprovements to Deep Convolutional Neural Networks for LVCSR.Tara N. Sainath, Brian Kingsbury, Abdel-rahman Mohamed, George E. Dahl, George Saon, Hagen Soltau, Toms Beran, Aleksandr Y. Aravkin, Bhuvana Ramabhadran
2013ASRULearning filter banks within a deep neural network framework.Tara N. Sainath, Brian Kingsbury, Abdel-rahman Mohamed, Bhuvana Ramabhadran
2013ICASSPDeveloping speech recognition systems for corpus indexing under the IARPA Babel program.Jia Cui, Xiaodong Cui, Bhuvana Ramabhadran, Janice Kim, Brian Kingsbury, Jonathan Mamou, Lidia Mangu, Michael Picheny, Tara N. Sainath, Abhinav Sethy
2013ICASSPImproving deep neural networks for LVCSR using rectified linear units and dropout.George E. Dahl, Tara N. Sainath, Geoffrey E. Hinton
2013ICASSPAn evaluation of posterior modeling techniques for phonetic recognition.Rohit Prabhavalkar, Tara N. Sainath, David Nahamoo, Bhuvana Ramabhadran, Dimitri Kanevsky
2013ICASSPLow-rank matrix factorization for Deep Neural Network training with high-dimensional output targets.Tara N. Sainath, Brian Kingsbury, Vikas Sindhwani, Ebru Arisoy, Bhuvana Ramabhadran
2013ICASSPDeep convolutional neural networks for LVCSR.Tara N. Sainath, Abdel-rahman Mohamed, Brian Kingsbury, Bhuvana Ramabhadran
2012ICASSPN-best entropy based data selection for acoustic modeling.Nobuyasu Itoh, Tara N. Sainath, Dan-Ning Jiang, Jie Zhou, Bhuvana Ramabhadran
2012ICASSPImproved pre-training of Deep Belief Networks using Sparse Encoding Symmetric Machines.Christian Plahl, Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo
2012ICASSPAuto-encoder bottleneck features using deep belief networks.Tara N. Sainath, Brian Kingsbury, Bhuvana Ramabhadran
2012InterspeechScalable Minimum Bayes Risk Training of Deep Neural Network Acoustic Models Using Distributed Hessian-free Optimization.Brian Kingsbury, Tara N. Sainath, Hagen Soltau
2012InterspeechEnhancing Exemplar-Based Posteriors for Speech Recognition Tasks.Tara N. Sainath, David Nahamoo, Dimitri Kanevsky, Bhuvana Ramabhadran
2012NAACLDeep Neural Network Language Models.Ebru Arisoy, Tara N. Sainath, Brian Kingsbury, Bhuvana Ramabhadran
2011ASRUMaking Deep Belief Networks effective for large vocabulary continuous speech recognition.Tara N. Sainath, Brian Kingsbury, Bhuvana Ramabhadran, Petr Fousek, Petr Novk, Abdel-rahman Mohamed
2011ASRUA convex hull approach to sparse representations for exemplar-based speech recognition.Tara N. Sainath, David Nahamoo, Dimitri Kanevsky, Bhuvana Ramabhadran, Parikshit M. Shah
2011ICASSPA-Functions: A generalization of Extended Baum-Welch transformations to convex optimization.Dimitri Kanevsky, David Nahamoo, Tara N. Sainath, Bhuvana Ramabhadran, Peder A. Olsen
2011ICASSPDeep Belief Networks using discriminative features for phone recognition.Abdel-rahman Mohamed, Tara N. Sainath, George E. Dahl, Bhuvana Ramabhadran, Geoffrey E. Hinton, Michael A. Picheny
2011ICASSPExemplar-based Sparse Representation phone identification features.Tara N. Sainath, David Nahamoo, Bhuvana Ramabhadran, Dimitri Kanevsky, Vaibhava Goel, Parikshit M. Shah
2011ICASSPApplication specific loss minimization using gradient boosting.Bin Zhang, Abhinav Sethy, Tara N. Sainath, Bhuvana Ramabhadran
2011InterspeechConvergence of Line Search A-Function Methods.Dimitri Kanevsky, David Nahamoo, Tara N. Sainath, Bhuvana Ramabhadran
2011InterspeechReducing Computational Complexities of Exemplar-Based Sparse Representations with Applications to Large Vocabulary Speech Recognition.Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo, Dimitri Kanevsky
2010FUSIONKalman filtering for compressed sensing.Dimitri Kanevsky, Avishy Carmi, Lior Horesh, Pini Gurfil, Bhuvana Ramabhadran, Tara N. Sainath
2010ICASSPThe Use of isometric transformations and bayesian estimation in compressive sensing for fMRI classification.Avishy Carmi, Tara N. Sainath, Pini Gurfil, Dimitri Kanevsky, David Nahamoo, Bhuvana Ramabhadran
2010ICASSPBayesian compressive sensing for phonetic classification.Tara N. Sainath, Avishy Carmi, Dimitri Kanevsky, Bhuvana Ramabhadran
2010InterspeechIncorporating sparse representation phone identification features in automatic speech recognition using exponential families.Vaibhava Goel, Tara N. Sainath, Bhuvana Ramabhadran, Peder A. Olsen, David Nahamoo, Dimitri Kanevsky
2010InterspeechAn analysis of sparseness and regularization in exemplar-based methods for speech classification.Dimitri Kanevsky, Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo
2010InterspeechSparse representations for text categorization.Tara N. Sainath, Sameer Maskey, Dimitri Kanevsky, Bhuvana Ramabhadran, David Nahamoo, Julia Hirschberg
2010InterspeechSparse representation features for speech recognition.Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo, Dimitri Kanevsky, Abhinav Sethy
2010InterspeechData selection for language modeling using sparse representations.Abhinav Sethy, Tara N. Sainath, Bhuvana Ramabhadran, Dimitri Kanevsky
2010ICRAA voice-commandable robotic forklift working alongside humans in minimally-prepared outdoor environments.Seth J. Teller, Matthew R. Walter, Matthew E. Antone, Andrew Correa, Randall Davis, Luke Fletcher, Emilio Frazzoli, Jim Glass, Jonathan P. How, Albert S. Huang, Jeong hwan Jeon, Sertac Karaman, Brandon Luders, Nicholas Roy, Tara N. Sainath
2009ASRUIsland-driven search using broad phonetic classes.Tara N. Sainath
2009ASRUAn exploration of large vocabulary tools for small vocabulary phonetic recognition.Tara N. Sainath, Bhuvana Ramabhadran, Michael Picheny
2009ICASSPA generalized family of parameter estimation techniques.Dimitri Kanevsky, Tara N. Sainath, Bhuvana Ramabhadran
2008ICASSPGradient steepness metrics using extended Baum-Welch transformations for universal pattern recognition tasks.Tara N. Sainath, Dimitri Kanevsky, Bhuvana Ramabhadran
2008InterspeechGeneralization of extended baum-welch parameter estimation for discriminative training and decoding.Dimitri Kanevsky, Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo
2008InterspeechA comparison of broad phonetic and acoustic units for noise robust segment-based phonetic recognition.Tara N. Sainath, Victor Zue
2007ASRUBroad phonetic class recognition in a Hidden Markov model framework using extended Baum-Welch transformations.Tara N. Sainath, Dimitri Kanevsky, Bhuvana Ramabhadran
2007ICASSPUnsupervised Audio Segmentation using Extended Baum-Welch Transformations.Tara N. Sainath, Dimitri Kanevsky, Giridharan Iyengar
2007InterspeechAudio classification using extended baum-welch transformations.Tara N. Sainath, Victor Zue, Dimitri Kanevsky
2006ICASSPA Sinusoidal Model Approach to Acoustic Landmark Detection and Segmentation for Robust Segment-Based Speech Recognition.Tara N. Sainath, Timothy J. Hazen