Tara N. Sainath
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
173
Venues
9
Active years
2006–2024
Best venue rank
A*
Where they publish
Papers
173 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2024 | ACL | Handling Ambiguity in Emotion: From Out-of-Domain Detection to Distribution Estimation. | Wen Wu, Bo Li, Chao Zhang, Chung-Cheng Chiu, Qiujia Li, Junwen Bai, Tara N. Sainath, Philip C. Woodland |
| 2024 | ICASSP | Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR. | Junwen Bai, Bo Li, Qiujia Li, Tara N. Sainath, Trevor Strohman |
| 2024 | ICASSP | USM-Lite: Quantization and Sparsity Aware Fine-Tuning for Speech Recognition with Universal Speech Models. | Shaojin Ding, David Qiu, David Rim, Yanzhang He, Oleg Rybakov, Bo Li, Rohit Prabhavalkar, Weiran Wang, Tara N. Sainath, Zhonglin Han, Jian Li, Amir Yazdanbakhsh, Shivani Agrawal |
| 2024 | ICASSP | Improving Speech Recognition for African American English with Audio Classification. | Shefali Garg, Zhouyuan Huo, Khe Chai Sim, Suzan Schwartz, Mason Chua, Alna Aksnova, Tsendsuren Munkhdalai, Levi King, Darryl Wright, Zion Mengesha, Dongseong Hwang, Tara N. Sainath, Franoise Beaufays, Pedro Moreno Mengibar |
| 2024 | ICASSP | Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study. | W. Ronny Huang, Cyril Allauzen, Tongzhou Chen, Kilol Gupta, Ke Hu, James Qin, Yu Zhang, Yongqiang Wang, Shuo-Yiin Chang, Tara N. Sainath |
| 2024 | ICASSP | Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models. | Rohit Prabhavalkar, Zhong Meng, Weiran Wang, Adam Stooke, Xingyu Cai, Yanzhang He, Arun Narayanan, Dongseong Hwang, Tara N. Sainath, Pedro J. Moreno |
| 2024 | ICASSP | Augmenting Conformers With Structured State-Space Sequence Models For Online Speech Recognition. | Haozhe Shan, Albert Gu, Zhong Meng, Weiran Wang, Krzysztof Choromanski, Tara N. Sainath |
| 2024 | ICASSP | A Comparison of Parameter-Efficient ASR Domain Adaptation Methods for Universal Speech and Language Models. | Khe Chai Sim, Zhouyuan Huo, Tsendsuren Munkhdalai, Nikhil Siddhartha, Adam Stooke, Zhong Meng, Bo Li, Tara N. Sainath |
| 2024 | Interspeech | Text Injection for Neural Contextual Biasing. | Zhong Meng, Zelin Wu, Rohit Prabhavalkar, Cal Peyser, Weiran Wang, Nanxin Chen, Tara N. Sainath, Bhuvana Ramabhadran |
| 2024 | NAACL | Massive End-to-end Speech Recognition Models with Time Reduction. | Weiran Wang, Rohit Prabhavalkar, Haozhe Shan, Zhong Meng, Dongseong Hwang, Qiujia Li, Khe Chai Sim, Bo Li, James Qin, Xingyu Cai, Adam Stooke, Chengjian Zheng, Yanzhang He, Tara N. Sainath, Pedro Moreno Mengibar |
| 2023 | ASRU | Improved Long-Form Speech Recognition By Jointly Modeling The Primary And Non-Primary Speakers. | Guru Prakash Arumugam, Shuo-Yiin Chang, Tara N. Sainath, Rohit Prabhavalkar, Quan Wang, Shaan Bijwadia |
| 2023 | ASRU | Efficient Cascaded Streaming ASR System Via Frame Rate Reduction. | Xingyu Cai, David Qiu, Shaojin Ding, Dongseong Hwang, Weiran Wang, Antoine Bruguier, Rohit Prabhavalkar, Tara N. Sainath, Yanzhang He |
| 2023 | ASRU | Improving Multilingual and Code-Switching ASR Using Large Language Model Generated Text. | Ke Hu, Tara N. Sainath, Bo Li, Yu Zhang, Yong Cheng, Tao Wang, Yujing Zhang, Frederick Liu |
| 2023 | ICASSP | Lego-Features: Exporting Modular Encoder Features for Streaming and Deliberation ASR. | Rami Botros, Rohit Prabhavalkar, Johan Schalkwyk, Ciprian Chelba, Tara N. Sainath, Franoise Beaufays |
| 2023 | ICASSP | Context-Aware end-to-end ASR Using Self-Attentive Embedding and Tensor Fusion. | Shuo-Yiin Chang, Chao Zhang, Tara N. Sainath, Bo Li, Trevor Strohman |
| 2023 | ICASSP | Sharing Low Rank Conformer Weights for Tiny Always-On Ambient Speech Recognition Models. | Steven M. Hernandez, Ding Zhao, Shaojin Ding, Antoine Bruguier, Rohit Prabhavalkar, Tara N. Sainath, Yanzhang He, Ian McGraw |
| 2023 | ICASSP | E2E Segmentation in a Two-Pass Cascaded Encoder ASR Model. | W. Ronny Huang, Shuo-Yiin Chang, Tara N. Sainath, Yanzhang He, David Rybach, Robert David, Rohit Prabhavalkar, Cyril Allauzen, Cal Peyser, Trevor D. Strohman |
| 2023 | ICASSP | Resource-Efficient Transfer Learning from Speech Foundation Model Using Hierarchical Feature Fusion. | Zhouyuan Huo, Khe Chai Sim, Bo Li, Dongseong Hwang, Tara N. Sainath, Trevor Strohman |
| 2023 | ICASSP | Massively Multilingual Shallow Fusion with Large Language Models. | Ke Hu, Tara N. Sainath, Bo Li, Nan Du, Yanping Huang, Andrew M. Dai, Yu Zhang, Rodrigo Cabrera, Zhifeng Chen, Trevor Strohman |
| 2023 | ICASSP | Efficient Domain Adaptation for Speech Foundation Models. | Bo Li, Dongseong Hwang, Zhouyuan Huo, Junwen Bai, Guru Prakash, Tara N. Sainath, Khe Chai Sim, Yu Zhang, Wei Han, Trevor Strohman, Franoise Beaufays |
| 2023 | ICASSP | JEIT: Joint End-to-End Model and Internal Language Model Training for Speech Recognition. | Zhong Meng, Weiran Wang, Rohit Prabhavalkar, Tara N. Sainath, Tongzhou Chen, Ehsan Variani, Yu Zhang, Bo Li, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2023 | ICASSP | A Comparison of Semi-Supervised Learning Techniques for Streaming ASR at Scale. | Cal Peyser, Michael Picheny, Kyunghyun Cho, Rohit Prabhavalkar, W. Ronny Huang, Tara N. Sainath |
| 2023 | ICASSP | Improving Contextual Biasing with Text Injection. | Tara N. Sainath, Rohit Prabhavalkar, Diamantino Caseiro, Pat Rondon, Cyril Allauzen |
| 2023 | ICASSP | Multi-Output RNN-T Joint Networks for Multi-Task Learning of ASR and Auxiliary Tasks. | Weiran Wang, Ding Zhao, Shaojin Ding, Hao Zhang, Shuo-Yiin Chang, David Rybach, Tara N. Sainath, Yanzhang He, Ian McGraw, Shankar Kumar |
| 2023 | ICASSP | From English to More Languages: Parameter-Efficient Model Reprogramming for Cross-Lingual Speech Recognition. | Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Rohit Prabhavalkar, Tara N. Sainath, Trevor Strohman |
| 2023 | ICASSP | A Quantum Kernel Learning Approach to Acoustic Modeling for Spoken Command Recognition. | Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Tara N. Sainath, Sabato Marco Siniscalchi, Chin-Hui Lee |
| 2023 | ICASSP | UML: A Universal Monolingual Output Layer For Multilingual Asr. | Chao Zhang, Bo Li, Tara N. Sainath, Trevor Strohman, Shuo-Yiin Chang |
| 2023 | Interspeech | How to Estimate Model Transferability of Pre-Trained Speech Models? | Zih-Ching Chen, Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Shuo-Yiin Chang, Rohit Prabhavalkar, Hung-yi Lee, Tara N. Sainath |
| 2023 | Interspeech | Mixture-of-Expert Conformer for Streaming Multilingual ASR. | Ke Hu, Bo Li, Tara N. Sainath, Yu Zhang, Franoise Beaufays |
| 2023 | Interspeech | Semantic Segmentation with Bidirectional Language Models Improves Long-form ASR. | W. Ronny Huang, Hao Zhang, Shankar Kumar, Shuo-Yiin Chang, Tara N. Sainath |
| 2023 | Interspeech | Re-investigating the Efficient Transfer Learning of Speech Foundation Model using Feature Fusion Methods. | Zhouyuan Huo, Khe Chai Sim, Dongseong Hwang, Tsendsuren Munkhdalai, Tara N. Sainath, Pedro Moreno Mengibar |
| 2023 | Interspeech | Modular Domain Adaptation for Conformer-Based Streaming ASR. | Qiujia Li, Bo Li, Dongseong Hwang, Tara N. Sainath, Pedro Moreno Mengibar |
| 2023 | Interspeech | Improving Joint Speech-Text Representations Without Alignment. | Cal Peyser, Zhong Meng, Rohit Prabhavalkar, Andrew Rosenberg, Tara N. Sainath, Michael Picheny, Kyunghyun Cho, Ke Hu |
| 2022 | ICASSP | Joint Unsupervised and Supervised Training for Multilingual ASR. | Junwen Bai, Bo Li, Yu Zhang, Ankur Bapna, Nikhil Siddhartha, Khe Chai Sim, Tara N. Sainath |
| 2022 | ICASSP | Transducer-Based Streaming Deliberation for Cascaded Encoders. | Ke Hu, Tara N. Sainath, Arun Narayanan, Ruoming Pang, Trevor Strohman |
| 2022 | ICASSP | Massively Multilingual ASR: A Lifelong Learning Solution. | Bo Li, Ruoming Pang, Yu Zhang, Tara N. Sainath, Trevor Strohman, Parisa Haghani, Yun Zhu, Brian Farris, Neeraj Gaur, Manasa Prasad |
| 2022 | ICASSP | Improving The Latency And Quality Of Cascaded Encoders. | Tara N. Sainath, Yanzhang He, Arun Narayanan, Rami Botros, Weiran Wang, David Qiu, Chung-Cheng Chiu, Rohit Prabhavalkar, Alexander Gruenstein, Anmol Gulati, Bo Li, David Rybach, Emmanuel Guzman, Ian McGraw, James Qin, Krzysztof Choromanski, Qiao Liang, Robert David, Ruoming Pang, Shuo-Yiin Chang, Trevor Strohman, W. Ronny Huang, Wei Han, Yonghui Wu, Yu Zhang |
| 2022 | ICASSP | Deliberation of Streaming RNN-Transducer by Non-Autoregressive Decoding. | Weiran Wang, Ke Hu, Tara N. Sainath |
| 2022 | ICASSP | Improving the Fusion of Acoustic and Text Representations in RNN-T. | Chao Zhang, Bo Li, Zhiyun Lu, Tara N. Sainath, Shuo-Yiin Chang |
| 2022 | Interspeech | Turn-Taking Prediction for Natural Conversational Speech. | Shuo-Yiin Chang, Bo Li, Tara N. Sainath, Chao Zhang, Trevor Strohman, Qiao Liang, Yanzhang He |
| 2022 | Interspeech | Streaming Intended Query Detection using E2E Modeling for Continued Conversation. | Shuo-Yiin Chang, Guru Prakash, Zelin Wu, Tara N. Sainath, Bo Li, Qiao Liang, Adam Stambler, Shyam Upadhyay, Manaal Faruqui, Trevor Strohman |
| 2022 | Interspeech | A Unified Cascaded Encoder ASR Model for Dynamic Model Sizes. | Shaojin Ding, Weiran Wang, Ding Zhao, Tara N. Sainath, Yanzhang He, Robert David, Rami Botros, Xin Wang, Rina Panigrahy, Qiao Liang, Dongseong Hwang, Ian McGraw, Rohit Prabhavalkar, Trevor Strohman |
| 2022 | Interspeech | E2E Segmenter: Joint Segmenting and Decoding for Long-Form ASR. | W. Ronny Huang, Shuo-Yiin Chang, David Rybach, Tara N. Sainath, Rohit Prabhavalkar, Cal Peyser, Zhiyun Lu, Cyril Allauzen |
| 2022 | Interspeech | Sentence-Select: Large-Scale Language Model Data Selection for Rare-Word Speech Recognition. | W. Ronny Huang, Cal Peyser, Tara N. Sainath, Ruoming Pang, Trevor D. Strohman, Shankar Kumar |
| 2022 | Interspeech | Improving Deliberation by Text-Only and Semi-Supervised Training. | Ke Hu, Tara N. Sainath, Yanzhang He, Rohit Prabhavalkar, Trevor Strohman, Sepand Mavandadi, Weiran Wang |
| 2022 | Interspeech | A Language Agnostic Multilingual Streaming On-Device ASR System. | Bo Li, Tara N. Sainath, Ruoming Pang, Shuo-Yiin Chang, Qiumin Xu, Trevor Strohman, Vince Chen, Qiao Liang, Heguang Liu, Yanzhang He, Parisa Haghani, Sameer Bidichandani |
| 2022 | Interspeech | Towards Disentangled Speech Representations. | Cal Peyser, W. Ronny Huang, Andrew Rosenberg, Tara N. Sainath, Michael Picheny, Kyunghyun Cho |
| 2022 | Interspeech | Improving Rare Word Recognition with LM-aware MWER Training. | Weiran Wang, Tongzhou Chen, Tara N. Sainath, Ehsan Variani, Rohit Prabhavalkar, W. Ronny Huang, Bhuvana Ramabhadran, Neeraj Gaur, Sepand Mavandadi, Cal Peyser, Trevor Strohman, Yanzhang He, David Rybach |
| 2022 | Interspeech | Streaming Align-Refine for Non-autoregressive Deliberation. | Weiran Wang, Ke Hu, Tara N. Sainath |
| 2022 | Interspeech | Streaming End-to-End Multilingual Speech Recognition with Joint Language Identification. | Chao Zhang, Bo Li, Tara N. Sainath, Trevor Strohman, Sepand Mavandadi, Shuo-Yiin Chang, Parisa Haghani |
| 2021 | ASRU | Scaling End-to-End Models for Large-Scale Multilingual ASR. | Bo Li, Ruoming Pang, Tara N. Sainath, Anmol Gulati, Yu Zhang, James Qin, Parisa Haghani, W. Ronny Huang, Min Ma, Junwen Bai |
| 2021 | ICASSP | A Better and Faster end-to-end Model for Streaming ASR. | Bo Li, Anmol Gulati, Jiahui Yu, Tara N. Sainath, Chung-Cheng Chiu, Arun Narayanan, Shuo-Yiin Chang, Ruoming Pang, Yanzhang He, James Qin, Wei Han, Qiao Liang, Yu Zhang, Trevor Strohman, Yonghui Wu |
| 2021 | ICASSP | Cascaded Encoders for Unifying Streaming and Non-Streaming ASR. | Arun Narayanan, Tara N. Sainath, Ruoming Pang, Jiahui Yu, Chung-Cheng Chiu, Rohit Prabhavalkar, Ehsan Variani, Trevor Strohman |
| 2021 | ICASSP | Less is More: Improved RNN-T Decoding Using Limited Label Context and Path Merging. | Rohit Prabhavalkar, Yanzhang He, David Rybach, Sean Campbell, Arun Narayanan, Trevor Strohman, Tara N. Sainath |
| 2021 | ICASSP | Learning Word-Level Confidence for Subword End-To-End ASR. | David Qiu, Qiujia Li, Yanzhang He, Yu Zhang, Bo Li, Liangliang Cao, Rohit Prabhavalkar, Deepti Bhatia, Wei Li, Ke Hu, Tara N. Sainath, Ian McGraw |
| 2021 | ICASSP | Echo State Speech Recognition. | Harsh Shrivastava, Ankush Garg, Yuan Cao, Yu Zhang, Tara N. Sainath |
| 2021 | ICASSP | FastEmit: Low-Latency Streaming ASR with Sequence-Level Emission Regularization. | Jiahui Yu, Chung-Cheng Chiu, Bo Li, Shuo-Yiin Chang, Tara N. Sainath, Yanzhang He, Arun Narayanan, Wei Han, Anmol Gulati, Yonghui Wu, Ruoming Pang |
| 2021 | ICLR | Dual-mode ASR: Unify and Improve Streaming ASR with Full-context Modeling. | Jiahui Yu, Wei Han, Anmol Gulati, Chung-Cheng Chiu, Bo Li, Tara N. Sainath, Yonghui Wu, Ruoming Pang |
| 2021 | Interspeech | Tied & Reduced RNN-T Decoder. | Rami Botros, Tara N. Sainath, Robert David, Emmanuel Guzman, Wei Li, Yanzhang He |
| 2021 | Interspeech | Lookup-Table Recurrent Language Models for Long Tail Speech Recognition. | W. Ronny Huang, Tara N. Sainath, Cal Peyser, Shankar Kumar, David Rybach, Trevor Strohman |
| 2021 | Interspeech | A Deliberation-Based Joint Acoustic and Text Decoder. | Sepand Mavandadi, Tara N. Sainath, Ke Hu, Zelin Wu |
| 2021 | Interspeech | An Efficient Streaming Non-Recurrent On-Device End-to-End Model with Improvements to Rare-Word Modeling. | Tara N. Sainath, Yanzhang He, Arun Narayanan, Rami Botros, Ruoming Pang, David Rybach, Cyril Allauzen, Ehsan Variani, James Qin, Quoc-Nam Le-The, Shuo-Yiin Chang, Bo Li, Anmol Gulati, Jiahui Yu, Chung-Cheng Chiu, Diamantino Caseiro, Wei Li, Qiao Liang, Pat Rondon |
| 2021 | Interspeech | Multitask Training with Text Data for End-to-End Speech Recognition. | Peidong Wang, Tara N. Sainath, Ron J. Weiss |
| 2020 | ICASSP | Deliberation Model Based Two-Pass End-To-End Speech Recognition. | Ke Hu, Tara N. Sainath, Ruoming Pang, Rohit Prabhavalkar |
| 2020 | ICASSP | Towards Fast and Accurate Streaming End-To-End ASR. | Bo Li, Shuo-Yiin Chang, Tara N. Sainath, Ruoming Pang, Yanzhang He, Trevor Strohman, Yonghui Wu |
| 2020 | ICASSP | Improving Proper Noun Recognition in End-To-End Asr by Customization of the Mwer Loss Criterion. | Cal Peyser, Tara N. Sainath, Golan Pundak |
| 2020 | ICASSP | A Streaming On-Device End-To-End Model Surpassing Server-Side Conventional Model Quality and Latency. | Tara N. Sainath, Yanzhang He, Bo Li, Arun Narayanan, Ruoming Pang, Antoine Bruguier, Shuo-Yiin Chang, Wei Li, Raziel Alvarez, Zhifeng Chen, Chung-Cheng Chiu, David Garcia, Alexander Gruenstein, Ke Hu, Anjuli Kannan, Qiao Liang, Ian McGraw, Cal Peyser, Rohit Prabhavalkar, Golan Pundak, David Rybach, Yuan Shangguan, Yash Sheth, Trevor Strohman, Mirk Visontai, Yonghui Wu, Yu Zhang, Ding Zhao |
| 2020 | ICASSP | An Attention-Based Joint Acoustic and Text on-Device End-To-End Model. | Tara N. Sainath, Ruoming Pang, Ron J. Weiss, Yanzhang He, Chung-Cheng Chiu, Trevor Strohman |
| 2020 | ICASSP | Multistate Encoding with End-To-End Speech RNN Transducer Network. | Zelin Wu, Bo Li, Yu Zhang, Petar S. Aleksic, Tara N. Sainath |
| 2020 | Interspeech | Low Latency Speech Recognition Using End-to-End Prefetching. | Shuo-Yiin Chang, Bo Li, David Rybach, Yanzhang He, Wei Li, Tara N. Sainath, Trevor Strohman |
| 2020 | Interspeech | Improving Tail Performance of a Deliberation E2E ASR Model Using a Large Text Corpus. | Cal Peyser, Sepand Mavandadi, Tara N. Sainath, James Apfel, Ruoming Pang, Shankar Kumar |
| 2020 | Interspeech | Emitting Word Timings with End-to-End Models. | Tara N. Sainath, Ruoming Pang, David Rybach, Basi Garca, Trevor Strohman |
| 2019 | ASRU | A Comparison of End-to-End Models for Long-Form Speech Recognition. | Chung-Cheng Chiu, Anjuli Kannan, Rohit Prabhavalkar, Zhifeng Chen, Tara N. Sainath, Yonghui Wu, Wei Han, Yu Zhang, Ruoming Pang, Sergey Kishchenko, Patrick Nguyen, Arun Narayanan, Hank Liao, Shuyuan Zhang |
| 2019 | ASRU | Recognizing Long-Form Speech Using Streaming End-to-End Models. | Arun Narayanan, Rohit Prabhavalkar, Chung-Cheng Chiu, David Rybach, Tara N. Sainath, Trevor Strohman |
| 2019 | ICASSP | Contextual Speech Recognition with Difficult Negative Training Examples. | Uri Alon, Golan Pundak, Tara N. Sainath |
| 2019 | ICASSP | Semi-supervised Training for End-to-end Models via Weak Distillation. | Bo Li, Tara N. Sainath, Ruoming Pang, Zelin Wu |
| 2019 | ICASSP | Phoebe: Pronunciation-aware Contextualization for End-to-end Speech Recognition. | Antoine Bruguier, Rohit Prabhavalkar, Golan Pundak, Tara N. Sainath |
| 2019 | ICASSP | Joint Endpointing and Decoding with End-to-end Models. | Shuo-Yiin Chang, Rohit Prabhavalkar, Yanzhang He, Tara N. Sainath, Gabor Simko |
| 2019 | ICASSP | A Spelling Correction Model for End-to-end Speech Recognition. | Jinxi Guo, Tara N. Sainath, Ron J. Weiss |
| 2019 | ICASSP | Streaming End-to-end Speech Recognition for Mobile Devices. | Yanzhang He, Tara N. Sainath, Rohit Prabhavalkar, Ian McGraw, Raziel Alvarez, Ding Zhao, David Rybach, Anjuli Kannan, Yonghui Wu, Ruoming Pang, Qiao Liang, Deepti Bhatia, Yuan Shangguan, Bo Li, Golan Pundak, Khe Chai Sim, Tom Bagby, Shuo-Yiin Chang, Kanishka Rao, Alexander Gruenstein |
| 2019 | ICASSP | Bytes Are All You Need: End-to-end Multilingual Speech Recognition and Synthesis with Bytes. | Bo Li, Yu Zhang, Tara N. Sainath, Yonghui Wu, William Chan |
| 2019 | Interspeech | Phoneme-Based Contextualization for Cross-Lingual Speech Recognition in End-to-End Models. | Ke Hu, Antoine Bruguier, Tara N. Sainath, Rohit Prabhavalkar, Golan Pundak |
| 2019 | Interspeech | Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model. | Anjuli Kannan, Arindrima Datta, Tara N. Sainath, Eugene Weinstein, Bhuvana Ramabhadran, Yonghui Wu, Ankur Bapna, Zhifeng Chen, Seungji Lee |
| 2019 | Interspeech | Improving Performance of End-to-End ASR on Numeric Sequences. | Cal Peyser, Hao Zhang, Tara N. Sainath, Zelin Wu |
| 2019 | Interspeech | Two-Pass End-to-End Speech Recognition. | Tara N. Sainath, Ruoming Pang, David Rybach, Yanzhang He, Rohit Prabhavalkar, Wei Li, Mirk Visontai, Qiao Liang, Trevor Strohman, Yonghui Wu, Ian McGraw, Chung-Cheng Chiu |
| 2019 | Interspeech | Shallow-Fusion End-to-End Contextual Biasing. | Ding Zhao, Tara N. Sainath, David Rybach, Pat Rondon, Deepti Bhatia, Bo Li, Ruoming Pang |
| 2018 | ICASSP | Temporal Modeling Using Dilated Convolution and Gating for Voice-Activity-Detection. | Shuo-Yiin Chang, Bo Li, Gabor Simko, Tara N. Sainath, Anshuman Tripathi, Aron van den Oord, Oriol Vinyals |
| 2018 | ICASSP | State-of-the-Art Speech Recognition with Sequence-to-Sequence Models. | Chung-Cheng Chiu, Tara N. Sainath, Yonghui Wu, Rohit Prabhavalkar, Patrick Nguyen, Zhifeng Chen, Anjuli Kannan, Ron J. Weiss, Kanishka Rao, Ekaterina Gonina, Navdeep Jaitly, Bo Li, Jan Chorowski, Michiel Bacchiani |
| 2018 | ICASSP | Performance of Mask Based Statistical Beamforming in a Smart Home Scenario. | Jahn Heymann, Michiel Bacchiani, Tara N. Sainath |
| 2018 | ICASSP | An Analysis of Incorporating an External Language Model into a Sequence-to-Sequence Model. | Anjuli Kannan, Yonghui Wu, Patrick Nguyen, Tara N. Sainath, Zhifeng Chen, Rohit Prabhavalkar |
| 2018 | ICASSP | Spectral Distortion Model for Training Phase-Sensitive Deep-Neural Networks for Far-Field Speech Recognition. | Chanwoo Kim, Tara N. Sainath, Arun Narayanan, Ananya Misra, Rajeev C. Nongpiur, Michiel Bacchiani |
| 2018 | ICASSP | Multi-Dialect Speech Recognition with a Single Sequence-to-Sequence Model. | Bo Li, Tara N. Sainath, Khe Chai Sim, Michiel Bacchiani, Eugene Weinstein, Patrick Nguyen, Zhifeng Chen, Yanghui Wu, Kanishka Rao |
| 2018 | ICASSP | Minimum Word Error Rate Training for Attention-Based Sequence-to-Sequence Models. | Rohit Prabhavalkar, Tara N. Sainath, Yonghui Wu, Patrick Nguyen, Zhifeng Chen, Chung-Cheng Chiu, Anjuli Kannan |
| 2018 | ICASSP | Improving the Performance of Online Neural Transducer Models. | Tara N. Sainath, Chung-Cheng Chiu, Rohit Prabhavalkar, Anjuli Kannan, Yonghui Wu, Patrick Nguyen, Zhifeng Chen |
| 2018 | ICASSP | No Need for a Lexicon? Evaluating the Value of the Pronunciation Lexica in End-to-End Models. | Tara N. Sainath, Rohit Prabhavalkar, Shankar Kumar, Seungji Lee, Anjuli Kannan, David Rybach, Vlad Schogol, Patrick Nguyen, Bo Li, Yonghui Wu, Zhifeng Chen, Chung-Cheng Chiu |
| 2018 | ICASSP | Multilingual Speech Recognition with a Single End-to-End Model. | Shubham Toshniwal, Tara N. Sainath, Ron J. Weiss, Bo Li, Pedro J. Moreno, Eugene Weinstein, Kanishka Rao |
| 2018 | Interspeech | Compression of End-to-End Models. | Ruoming Pang, Tara N. Sainath, Rohit Prabhavalkar, Suyog Gupta, Yonghui Wu, Shuyuan Zhang, Chung-Cheng Chiu |
| 2018 | Interspeech | Domain Adaptation Using Factorized Hidden Layer for Robust Automatic Speech Recognition. | Khe Chai Sim, Arun Narayanan, Ananya Misra, Anshuman Tripathi, Golan Pundak, Tara N. Sainath, Parisa Haghani, Bo Li, Michiel Bacchiani |
| 2018 | Interspeech | Contextual Speech Recognition in End-to-end Neural Network Systems Using Beam Search. | Ian Williams, Anjuli Kannan, Petar S. Aleksic, David Rybach, Tara N. Sainath |
| 2017 | ASRU | Improving the efficiency of forward-backward algorithm using batched computation in TensorFlow. | Khe Chai Sim, Arun Narayanan, Tom Bagby, Tara N. Sainath, Michiel Bacchiani |
| 2017 | Interspeech | Endpoint Detection Using Grid Long Short-Term Memory Networks for Streaming Speech Recognition. | Shuo-Yiin Chang, Bo Li, Tara N. Sainath, Gabor Simko, Carolina Parada |
| 2017 | Interspeech | Generation of Large-Scale Simulated Utterances in Virtual Rooms to Train Deep-Neural Networks for Far-Field Speech Recognition in Google Home. | Chanwoo Kim, Ananya Misra, Kean K. Chin, Thad Hughes, Arun Narayanan, Tara N. Sainath, Michiel Bacchiani |
| 2017 | Interspeech | Reducing the Computational Complexity of Two-Dimensional LSTMs. | Bo Li, Tara N. Sainath |
| 2017 | Interspeech | Acoustic Modeling for Google Home. | Bo Li, Tara N. Sainath, Arun Narayanan, Joe Caroselli, Michiel Bacchiani, Ananya Misra, Izhak Shafran, Hasim Sak, Golan Pundak, Kean K. Chin, Khe Chai Sim, Ron J. Weiss, Kevin W. Wilson, Ehsan Variani, Chanwoo Kim, Olivier Siohan, Mitchel Weintraub, Erik McDermott, Richard Rose, Matt Shannon |
| 2017 | Interspeech | A Comparison of Sequence-to-Sequence Models for Speech Recognition. | Rohit Prabhavalkar, Kanishka Rao, Tara N. Sainath, Bo Li, Leif Johnson, Navdeep Jaitly |
| 2017 | Interspeech | An Analysis of "Attention" in Sequence-to-Sequence Models. | Rohit Prabhavalkar, Tara N. Sainath, Bo Li, Kanishka Rao, Navdeep Jaitly |
| 2017 | Interspeech | Highway-LSTM and Recurrent Highway Networks for Speech Recognition. | Golan Pundak, Tara N. Sainath |
| 2017 | Interspeech | Annealed f-Smoothing as a Mechanism to Speed up Neural Network Training. | Tara N. Sainath, Vijayaditya Peddinti, Olivier Siohan, Arun Narayanan |
| 2016 | ICASSP | Learning compact recurrent neural networks. | Zhiyun Lu, Vikas Sindhwani, Tara N. Sainath |
| 2016 | ICASSP | Factored spatial and spectral multichannel raw waveform CLDNNs. | Tara N. Sainath, Ron J. Weiss, Kevin W. Wilson, Arun Narayanan, Michiel Bacchiani |
| 2016 | Interspeech | Neural Network Adaptive Beamforming for Robust Multichannel Speech Recognition. | Bo Li, Tara N. Sainath, Ron J. Weiss, Kevin W. Wilson, Michiel Bacchiani |
| 2016 | Interspeech | Lower Frame Rate Neural Network Acoustic Models. | Golan Pundak, Tara N. Sainath |
| 2016 | Interspeech | Modeling Time-Frequency Patterns with LSTM vs. Convolutional Architectures for LVCSR Tasks. | Tara N. Sainath, Bo Li |
| 2016 | Interspeech | Reducing the Computational Complexity of Multimicrophone Acoustic Models with Integrated Feature Extraction. | Tara N. Sainath, Arun Narayanan, Ron J. Weiss, Ehsan Variani, Kevin W. Wilson, Michiel Bacchiani, Izhak Shafran |
| 2016 | Interspeech | Complex Linear Projection (CLP): A Discriminative Approach to Joint Feature Extraction and Acoustic Modeling. | Ehsan Variani, Tara N. Sainath, Izhak Shafran, Michiel Bacchiani |
| 2016 | Interspeech | Feature Learning with Raw-Waveform CLDNNs for Voice Activity Detection. | Rubn Zazo, Tara N. Sainath, Gabor Simko, Carolina Parada |
| 2015 | ASRU | Speaker location and microphone spacing invariant acoustic modeling from raw multichannel waveforms. | Tara N. Sainath, Ron J. Weiss, Kevin W. Wilson, Arun Narayanan, Michiel Bacchiani, Andrew W. Senior |
| 2015 | ASRU | Acoustic modelling with CD-CTC-SMBR LSTM RNNS. | Andrew W. Senior, Hasim Sak, Felix de Chaumont Quitry, Tara N. Sainath, Kanishka Rao |
| 2015 | ICASSP | Query-by-example keyword spotting using long short-term memory networks. | Guoguo Chen, Carolina Parada, Tara N. Sainath |
| 2015 | ICASSP | Automatic gain control and multi-style training for robust small-footprint keyword spotting with deep neural networks. | Rohit Prabhavalkar, Raziel Alvarez, Carolina Parada, Preetum Nakkiran, Tara N. Sainath |
| 2015 | ICASSP | Convolutional, Long Short-Term Memory, fully connected Deep Neural Networks. | Tara N. Sainath, Oriol Vinyals, Andrew W. Senior, Hasim Sak |
| 2015 | Interspeech | Locally-connected and convolutional neural networks for small footprint speaker recognition. | Yu-hsin Chen, Ignacio Lpez-Moreno, Tara N. Sainath, Mirk Visontai, Raziel Alvarez, Carolina Parada |
| 2015 | Interspeech | Large vocabulary automatic speech recognition for children. | Hank Liao, Golan Pundak, Olivier Siohan, Melissa K. Carroll, Noah Coccaro, Qi-Ming Jiang, Tara N. Sainath, Andrew W. Senior, Franoise Beaufays, Michiel Bacchiani |
| 2015 | Interspeech | Convolutional neural networks for small-footprint keyword spotting. | Tara N. Sainath, Carolina Parada |
| 2015 | Interspeech | Learning the speech front-end with raw waveform CLDNNs. | Tara N. Sainath, Ron J. Weiss, Andrew W. Senior, Kevin W. Wilson, Oriol Vinyals |
| 2014 | ICASSP | Kernel methods match Deep Neural Networks on TIMIT. | Po-Sen Huang, Haim Avron, Tara N. Sainath, Vikas Sindhwani, Bhuvana Ramabhadran |
| 2014 | ICASSP | Deep Scattering Spectrum with deep neural networks. | Vijayaditya Peddinti, Tara N. Sainath, Shay Maymon, Bhuvana Ramabhadran, David Nahamoo, Vaibhava Goel |
| 2014 | ICASSP | Improvements to filterbank and delta learning within a deep neural network framework. | Tara N. Sainath, Brian Kingsbury, Abdel-rahman Mohamed, George Saon, Bhuvana Ramabhadran |
| 2014 | ICASSP | Joint training of convolutional and non-convolutional neural networks. | Hagen Soltau, George Saon, Tara N. Sainath |
| 2014 | Interspeech | Parallel deep neural network training for LVCSR tasks using blue gene/Q. | Tara N. Sainath, I-Hsin Chung, Bhuvana Ramabhadran, Michael Picheny, John A. Gunnels, Brian Kingsbury, George Saon, Vernon Austel, Upendra V. Chaudhari |
| 2014 | Interspeech | Deep scattering spectra with deep neural networks for LVCSR tasks. | Tara N. Sainath, Vijayaditya Peddinti, Brian Kingsbury, Petr Fousek, Bhuvana Ramabhadran, David Nahamoo |
| 2014 | SC | Parallel Deep Neural Network Training for Big Data on Blue Gene/Q. | I-Hsin Chung, Tara N. Sainath, Bhuvana Ramabhadran, Michael Picheny, John A. Gunnels, Vernon Austel, Upendra V. Chaudhari, Brian Kingsbury |
| 2013 | ASRU | Accelerating Hessian-free optimization for Deep Neural Networks by implicit preconditioning and sampling. | Tara N. Sainath, Lior Horesh, Brian Kingsbury, Aleksandr Y. Aravkin, Bhuvana Ramabhadran |
| 2013 | ASRU | Improvements to Deep Convolutional Neural Networks for LVCSR. | Tara N. Sainath, Brian Kingsbury, Abdel-rahman Mohamed, George E. Dahl, George Saon, Hagen Soltau, Toms Beran, Aleksandr Y. Aravkin, Bhuvana Ramabhadran |
| 2013 | ASRU | Learning filter banks within a deep neural network framework. | Tara N. Sainath, Brian Kingsbury, Abdel-rahman Mohamed, Bhuvana Ramabhadran |
| 2013 | ICASSP | Developing speech recognition systems for corpus indexing under the IARPA Babel program. | Jia Cui, Xiaodong Cui, Bhuvana Ramabhadran, Janice Kim, Brian Kingsbury, Jonathan Mamou, Lidia Mangu, Michael Picheny, Tara N. Sainath, Abhinav Sethy |
| 2013 | ICASSP | Improving deep neural networks for LVCSR using rectified linear units and dropout. | George E. Dahl, Tara N. Sainath, Geoffrey E. Hinton |
| 2013 | ICASSP | An evaluation of posterior modeling techniques for phonetic recognition. | Rohit Prabhavalkar, Tara N. Sainath, David Nahamoo, Bhuvana Ramabhadran, Dimitri Kanevsky |
| 2013 | ICASSP | Low-rank matrix factorization for Deep Neural Network training with high-dimensional output targets. | Tara N. Sainath, Brian Kingsbury, Vikas Sindhwani, Ebru Arisoy, Bhuvana Ramabhadran |
| 2013 | ICASSP | Deep convolutional neural networks for LVCSR. | Tara N. Sainath, Abdel-rahman Mohamed, Brian Kingsbury, Bhuvana Ramabhadran |
| 2012 | ICASSP | N-best entropy based data selection for acoustic modeling. | Nobuyasu Itoh, Tara N. Sainath, Dan-Ning Jiang, Jie Zhou, Bhuvana Ramabhadran |
| 2012 | ICASSP | Improved pre-training of Deep Belief Networks using Sparse Encoding Symmetric Machines. | Christian Plahl, Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo |
| 2012 | ICASSP | Auto-encoder bottleneck features using deep belief networks. | Tara N. Sainath, Brian Kingsbury, Bhuvana Ramabhadran |
| 2012 | Interspeech | Scalable Minimum Bayes Risk Training of Deep Neural Network Acoustic Models Using Distributed Hessian-free Optimization. | Brian Kingsbury, Tara N. Sainath, Hagen Soltau |
| 2012 | Interspeech | Enhancing Exemplar-Based Posteriors for Speech Recognition Tasks. | Tara N. Sainath, David Nahamoo, Dimitri Kanevsky, Bhuvana Ramabhadran |
| 2012 | NAACL | Deep Neural Network Language Models. | Ebru Arisoy, Tara N. Sainath, Brian Kingsbury, Bhuvana Ramabhadran |
| 2011 | ASRU | Making Deep Belief Networks effective for large vocabulary continuous speech recognition. | Tara N. Sainath, Brian Kingsbury, Bhuvana Ramabhadran, Petr Fousek, Petr Novk, Abdel-rahman Mohamed |
| 2011 | ASRU | A convex hull approach to sparse representations for exemplar-based speech recognition. | Tara N. Sainath, David Nahamoo, Dimitri Kanevsky, Bhuvana Ramabhadran, Parikshit M. Shah |
| 2011 | ICASSP | A-Functions: A generalization of Extended Baum-Welch transformations to convex optimization. | Dimitri Kanevsky, David Nahamoo, Tara N. Sainath, Bhuvana Ramabhadran, Peder A. Olsen |
| 2011 | ICASSP | Deep Belief Networks using discriminative features for phone recognition. | Abdel-rahman Mohamed, Tara N. Sainath, George E. Dahl, Bhuvana Ramabhadran, Geoffrey E. Hinton, Michael A. Picheny |
| 2011 | ICASSP | Exemplar-based Sparse Representation phone identification features. | Tara N. Sainath, David Nahamoo, Bhuvana Ramabhadran, Dimitri Kanevsky, Vaibhava Goel, Parikshit M. Shah |
| 2011 | ICASSP | Application specific loss minimization using gradient boosting. | Bin Zhang, Abhinav Sethy, Tara N. Sainath, Bhuvana Ramabhadran |
| 2011 | Interspeech | Convergence of Line Search A-Function Methods. | Dimitri Kanevsky, David Nahamoo, Tara N. Sainath, Bhuvana Ramabhadran |
| 2011 | Interspeech | Reducing Computational Complexities of Exemplar-Based Sparse Representations with Applications to Large Vocabulary Speech Recognition. | Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo, Dimitri Kanevsky |
| 2010 | FUSION | Kalman filtering for compressed sensing. | Dimitri Kanevsky, Avishy Carmi, Lior Horesh, Pini Gurfil, Bhuvana Ramabhadran, Tara N. Sainath |
| 2010 | ICASSP | The Use of isometric transformations and bayesian estimation in compressive sensing for fMRI classification. | Avishy Carmi, Tara N. Sainath, Pini Gurfil, Dimitri Kanevsky, David Nahamoo, Bhuvana Ramabhadran |
| 2010 | ICASSP | Bayesian compressive sensing for phonetic classification. | Tara N. Sainath, Avishy Carmi, Dimitri Kanevsky, Bhuvana Ramabhadran |
| 2010 | Interspeech | Incorporating sparse representation phone identification features in automatic speech recognition using exponential families. | Vaibhava Goel, Tara N. Sainath, Bhuvana Ramabhadran, Peder A. Olsen, David Nahamoo, Dimitri Kanevsky |
| 2010 | Interspeech | An analysis of sparseness and regularization in exemplar-based methods for speech classification. | Dimitri Kanevsky, Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo |
| 2010 | Interspeech | Sparse representations for text categorization. | Tara N. Sainath, Sameer Maskey, Dimitri Kanevsky, Bhuvana Ramabhadran, David Nahamoo, Julia Hirschberg |
| 2010 | Interspeech | Sparse representation features for speech recognition. | Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo, Dimitri Kanevsky, Abhinav Sethy |
| 2010 | Interspeech | Data selection for language modeling using sparse representations. | Abhinav Sethy, Tara N. Sainath, Bhuvana Ramabhadran, Dimitri Kanevsky |
| 2010 | ICRA | A voice-commandable robotic forklift working alongside humans in minimally-prepared outdoor environments. | Seth J. Teller, Matthew R. Walter, Matthew E. Antone, Andrew Correa, Randall Davis, Luke Fletcher, Emilio Frazzoli, Jim Glass, Jonathan P. How, Albert S. Huang, Jeong hwan Jeon, Sertac Karaman, Brandon Luders, Nicholas Roy, Tara N. Sainath |
| 2009 | ASRU | Island-driven search using broad phonetic classes. | Tara N. Sainath |
| 2009 | ASRU | An exploration of large vocabulary tools for small vocabulary phonetic recognition. | Tara N. Sainath, Bhuvana Ramabhadran, Michael Picheny |
| 2009 | ICASSP | A generalized family of parameter estimation techniques. | Dimitri Kanevsky, Tara N. Sainath, Bhuvana Ramabhadran |
| 2008 | ICASSP | Gradient steepness metrics using extended Baum-Welch transformations for universal pattern recognition tasks. | Tara N. Sainath, Dimitri Kanevsky, Bhuvana Ramabhadran |
| 2008 | Interspeech | Generalization of extended baum-welch parameter estimation for discriminative training and decoding. | Dimitri Kanevsky, Tara N. Sainath, Bhuvana Ramabhadran, David Nahamoo |
| 2008 | Interspeech | A comparison of broad phonetic and acoustic units for noise robust segment-based phonetic recognition. | Tara N. Sainath, Victor Zue |
| 2007 | ASRU | Broad phonetic class recognition in a Hidden Markov model framework using extended Baum-Welch transformations. | Tara N. Sainath, Dimitri Kanevsky, Bhuvana Ramabhadran |
| 2007 | ICASSP | Unsupervised Audio Segmentation using Extended Baum-Welch Transformations. | Tara N. Sainath, Dimitri Kanevsky, Giridharan Iyengar |
| 2007 | Interspeech | Audio classification using extended baum-welch transformations. | Tara N. Sainath, Victor Zue, Dimitri Kanevsky |
| 2006 | ICASSP | A Sinusoidal Model Approach to Acoustic Landmark Detection and Segmentation for Robust Segment-Based Speech Recognition. | Tara N. Sainath, Timothy J. Hazen |