| 2025 | ICASSP | Audio Diffusion with Large Language Models. | Yinghui Huang, Kyle Kastner, Kartik Audhkhasi, Bhuvana Ramabhadran, Andrew Rosenberg |
| 2025 | ICASSP | Speech Re-Painting for Robust ASR. | Kyle Kastner, Gary Wang, Isaac Elias, Takaaki Saeki, Pedro Moreno Mengibar, Franoise Beaufays, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2024 | ICASSP | Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data. | Takaaki Saeki, Gary Wang, Nobuyuki Morioka, Isaac Elias, Kyle Kastner, Andrew Rosenberg, Bhuvana Ramabhadran, Heiga Zen, Franoise Beaufays, Hadar Shemtov |
| 2024 | Interspeech | Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions. | Murali Karthick Baskar, Andrew Rosenberg, Bhuvana Ramabhadran, Neeraj Gaur, Zhong Meng |
| 2024 | Interspeech | ASTRA: Aligning Speech and Text Representations for Asr without Sampling. | Neeraj Gaur, Rohan Agrawal, Gary Wang, Parisa Haghani, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2024 | Interspeech | Contemplative Mechanism for Speech Recognition: Speech Encoders can Think. | Tien-Ju Yang, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2024 | Interspeech | Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models. | Bolaji Yusuf, Murali Karthick Baskar, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2023 | ASRU | Mask-Conformer: Augmenting Conformer with Mask-Predict Decoder. | Yosuke Higuchi, Andrew Rosenberg, Yuan Wang, Murali Karthick Baskar, Bhuvana Ramabhadran |
| 2023 | ICASSP | JEIT: Joint End-to-End Model and Internal Language Model Training for Speech Recognition. | Zhong Meng, Weiran Wang, Rohit Prabhavalkar, Tara N. Sainath, Tongzhou Chen, Ehsan Variani, Yu Zhang, Bo Li, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2023 | ICASSP | Virtuoso: Massive Multilingual Speech-Text Joint Semi-Supervised Learning for Text-to-Speech. | Takaaki Saeki, Heiga Zen, Zhehuai Chen, Nobuyuki Morioka, Gary Wang, Yu Zhang, Ankur Bapna, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2023 | ICASSP | Understanding Shared Speech-Text Representations. | Gary Wang, Kyle Kastner, Ankur Bapna, Zhehuai Chen, Andrew Rosenberg, Bhuvana Ramabhadran, Yu Zhang |
| 2023 | Interspeech | O-1: Self-training with Oracle and 1-best Hypothesis. | Murali Karthick Baskar, Andrew Rosenberg, Bhuvana Ramabhadran, Kartik Audhkhasi |
| 2023 | Interspeech | Using Text Injection to Improve Recognition of Personal Identifiers in Speech. | Yochai Blau, Rohan Agrawal, Lior Madmony, Gary Wang, Andrew Rosenberg, Zhehuai Chen, Zorik Gekhman, Genady Beryozkin, Parisa Haghani, Bhuvana Ramabhadran |
| 2023 | Interspeech | Improving Joint Speech-Text Representations Without Alignment. | Cal Peyser, Zhong Meng, Rohit Prabhavalkar, Andrew Rosenberg, Tara N. Sainath, Michael Picheny, Kyunghyun Cho, Ke Hu |
| 2022 | ICASSP | Tts4pretrain 2.0: Advancing the use of Text and Speech in ASR Pretraining with Consistency and Contrastive Losses. | Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Gary Wang |
| 2022 | Interspeech | Reducing Domain mismatch in Self-supervised speech pre-training. | Murali Karthick Baskar, Andrew Rosenberg, Bhuvana Ramabhadran, Yu Zhang, Nicols Serrano |
| 2022 | Interspeech | A Scalable Model Specialization Framework for Training and Inference using Submodels and its Application to Speech Model Personalization. | Fadi Biadsy, Youzheng Chen, Xia Zhang, Oleg Rybakov, Andrew Rosenberg, Pedro J. Moreno |
| 2022 | Interspeech | MAESTRO: Matched Speech Text Representations through Modality Matching. | Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Ankur Bapna, Heiga Zen |
| 2022 | Interspeech | Towards Disentangled Speech Representations. | Cal Peyser, W. Ronny Huang, Andrew Rosenberg, Tara N. Sainath, Michael Picheny, Kyunghyun Cho |
| 2022 | Interspeech | Non-Parallel Voice Conversion for ASR Augmentation. | Gary Wang, Andrew Rosenberg, Bhuvana Ramabhadran, Fadi Biadsy, Jesse Emond, Yinghui Huang, Pedro J. Moreno |
| 2021 | ASRU | Injecting Text in Self-Supervised Speech Pretraining. | Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Gary Wang, Pedro J. Moreno |
| 2021 | ICASSP | Extending Parrotron: An End-to-End, Speech Conversion and Speech Recognition Model for Atypical Speech. | Rohan Doshi, Youzheng Chen, Liyang Jiang, Xia Zhang, Fadi Biadsy, Bhuvana Ramabhadran, Fang Chu, Andrew Rosenberg, Pedro J. Moreno |
| 2021 | Interspeech | Semi-Supervision in ASR: Sequential MixMatch and Factorized TTS-Based Augmentation. | Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Heiga Zen, Mohammadreza Ghodsi, Yinghui Huang, Jesse Emond, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno |
| 2020 | ICASSP | Generating Diverse and Natural Text-to-Speech Samples Using a Quantized Fine-Grained VAE and Autoregressive Prosody Prior. | Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Andrew Rosenberg, Bhuvana Ramabhadran, Yonghui Wu |
| 2020 | ICASSP | Improving Speech Recognition Using Consistent Predictions on Synthesized Speech. | Gary Wang, Andrew Rosenberg, Zhehuai Chen, Yu Zhang, Bhuvana Ramabhadran, Yonghui Wu, Pedro J. Moreno |
| 2020 | Interspeech | Improving Speech Recognition Using GAN-Based Speech Synthesis and Contrastive Unspoken Text Selection. | Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno |
| 2020 | Interspeech | SCADA: Stochastic, Consistent and Adversarial Data Augmentation to Improve ASR. | Gary Wang, Andrew Rosenberg, Zhehuai Chen, Yu Zhang, Bhuvana Ramabhadran, Pedro J. Moreno |
| 2019 | ASRU | Speech Recognition with Augmented Synthesized Speech. | Andrew Rosenberg, Yu Zhang, Bhuvana Ramabhadran, Ye Jia, Pedro J. Moreno, Yonghui Wu, Zelin Wu |
| 2019 | ICASSP | Comparison of Data Augmentation and Adaptation Strategies for Code-switched Automatic Speech Recognition. | Min Ma, Bhuvana Ramabhadran, Jesse Emond, Andrew Rosenberg, Fadi Biadsy |
| 2019 | Interspeech | Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning. | Yu Zhang, Ron J. Weiss, Heiga Zen, Yonghui Wu, Zhifeng Chen, R. J. Skerry-Ryan, Ye Jia, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2018 | ICASSP | Measuring the Effect of Linguistic Resources on Prosody Modeling for Speech Synthesis. | Andrew Rosenberg, Raul Fernandez, Bhuvana Ramabhadran |
| 2018 | ICASSP | Joint Modeling of Accents and Acoustics for Multi-Accent Speech Recognition. | Xuesong Yang, Kartik Audhkhasi, Andrew Rosenberg, Samuel Thomas, Bhuvana Ramabhadran, Mark Hasegawa-Johnson |
| 2018 | Interspeech | Data Augmentation Improves Recognition of Foreign Accented Speech. | Takashi Fukuda, Raul Fernandez, Andrew Rosenberg, Samuel Thomas, Bhuvana Ramabhadran, Alexander Sorin, Gakuto Kurata |
| 2018 | LREC | Interpersonal Relationship Labels for the CALLHOME Corpus. | Denys Katerenchuk, David Guy Brizan, Andrew Rosenberg |
| 2017 | ASRU | Investigating native and non-native English classification and transfer effects using Legendre polynomial coefficient clustering. | Rachel Rakov, Andrew Rosenberg |
| 2017 | ICASSP | End-to-end ASR-free keyword search from speech. | Kartik Audhkhasi, Andrew Rosenberg, Abhinav Sethy, Bhuvana Ramabhadran, Brian Kingsbury |
| 2017 | ICASSP | Knowledge distillation across ensembles of multilingual models for low-resource languages. | Jia Cui, Brian Kingsbury, Bhuvana Ramabhadran, George Saon, Tom Sercu, Kartik Audhkhasi, Abhinav Sethy, Markus Nubaum-Thom, Andrew Rosenberg |
| 2017 | ICASSP | Voice-transformation-based data augmentation for prosodic classification. | Raul Fernandez, Andrew Rosenberg, Alexander Sorin, Bhuvana Ramabhadran, Ron Hoory |
| 2017 | ICASSP | End-to-end speech recognition and keyword search on low-resource languages. | Andrew Rosenberg, Kartik Audhkhasi, Abhinav Sethy, Bhuvana Ramabhadran, Michael Picheny |
| 2017 | ICASSP | Active learning for low-resource speech recognition: Impact of selection size and language modeling data. | Ali Raza Syed, Andrew Rosenberg, Michael I. Mandel |
| 2017 | Interspeech | Weakly-Supervised Phrase Assignment from Text in a Speech-Synthesis System Using Noisy Labels. | Asaf Rendel, Raul Fernandez, Zvi Kons, Andrew Rosenberg, Ron Hoory, Bhuvana Ramabhadran |
| 2017 | Interspeech | Bias and Statistical Significance in Evaluating Speech Synthesis with Mean Opinion Scores. | Andrew Rosenberg, Bhuvana Ramabhadran |
| 2016 | AAAI | Hierarchy Prediction in Online Communities. | Denys Katerenchuk, Andrew Rosenberg |
| 2016 | ICASSP | Supervised and unsupervised active learning for automatic speech recognition of low-resource languages. | Ali Raza Syed, Andrew Rosenberg, Ellen Kislal |
| 2016 | Interspeech | Automatically Classifying Self-Rated Personality Scores from Speech. | Guozhen An, Sarah Ita Levitan, Rivka Levitan, Andrew Rosenberg, Michelle Levine, Julia Hirschberg |
| 2016 | Interspeech | Combining Acoustic-Prosodic, Lexical, and Phonotactic Features for Automatic Deception Detection. | Sarah Ita Levitan, Guozhen An, Min Ma, Rivka Levitan, Andrew Rosenberg, Julia Hirschberg |
| 2016 | LREC | RankDCG: Rank-Ordering Evaluation Measure. | Denys Katerenchuk, Andrew Rosenberg |
| 2015 | ICMI | Cross-Cultural Production and Detection of Deception from Speech. | Sarah Ita Levitan, Guozhen An, Mandi Wang, Gideon Mendels, Julia Hirschberg, Michelle Levine, Andrew Rosenberg |
| 2015 | Interspeech | Automatic recognition of unified parkinson's disease rating from speech with acoustic, i-vector and phonotactic features. | Guozhen An, David Guy Brizan, Min Ma, Michelle Morales, Ali Raza Syed, Andrew Rosenberg |
| 2015 | Interspeech | Modeling phrasing and prominence using deep recurrent learning. | Andrew Rosenberg, Raul Fernandez, Bhuvana Ramabhadran |
| 2014 | ICASSP | Using word burst analysis to rescore keyword search candidates on low-resource languages. | Justin Richards, Min Ma, Andrew Rosenberg |
| 2014 | ICASSP | Rescoring Confusion Networks for Keyword Search. | Victor Soto, Erica Cooper, Lidia Mangu, Andrew Rosenberg, Julia Hirschberg |
| 2014 | Interspeech | Improving deep neural network acoustic modeling for audio corpus indexing under the IARPA babel program. | Xiaodong Cui, Brian Kingsbury, Jia Cui, Bhuvana Ramabhadran, Andrew Rosenberg, Mohammad Sadegh Rasooli, Owen Rambow, Nizar Habash, Vaibhava Goel |
| 2014 | Interspeech | Recent improvements in neural network acoustic modeling for LVCSR in low resource languages. | Jia Cui, Bhuvana Ramabhadran, Xiaodong Cui, Andrew Rosenberg, Brian Kingsbury, Abhinav Sethy |
| 2014 | Interspeech | Exploiting vocal-source features to improve ASR accuracy for low-resource languages. | Raul Fernandez, Jia Cui, Andrew Rosenberg, Bhuvana Ramabhadran, Xiaodong Cui |
| 2014 | Interspeech | "was that your mother on the phone?": classifying interpersonal relationships between dialog participants with lexical and acoustic properties. | Denys Katerenchuk, David Guy Brizan, Andrew Rosenberg |
| 2014 | Interspeech | Improving named entity recognition with prosodic features. | Denys Katerenchuk, Andrew Rosenberg |
| 2014 | Interspeech | Strategies for rescoring keyword search results using word-burst and acoustic features. | Min Ma, Justin Richards, Victor Soto, Julia Hirschberg, Andrew Rosenberg |
| 2014 | Interspeech | A comparison of multiple methods for rescoring keyword search lists for low resource languages. | Victor Soto, Lidia Mangu, Andrew Rosenberg, Julia Hirschberg |
| 2013 | ICASSP | Cross-language phrase boundary detection. | Victor Soto, Erica Cooper, Andrew Rosenberg, Julia Hirschberg |
| 2013 | Interspeech | Detecting laughter and filled pauses using syllable-based features. | Gouzhen An, David Guy Brizan, Andrew Rosenberg |
| 2013 | Interspeech | Let me finish: automatic conflict detection using speaker overlap. | Flix Grzes, Justin Richards, Andrew Rosenberg |
| 2013 | Interspeech | "sure, i did the right thing": a system for sarcasm detection in speech. | Rachel Rakov, Andrew Rosenberg |
| 2013 | Interspeech | Modeling prosodic sequences with k-means and dirichlet process GMMs. | Andrew Rosenberg |
| 2012 | Interspeech | Power Mean Pyramid Scores for Summarization Evaluation. | Sameer Maskey, Andrew Rosenberg |
| 2012 | Interspeech | Rethinking The Corpus: Moving towards Dynamic Linguistic Resources. | Andrew Rosenberg |
| 2012 | Interspeech | Using Prominence and Phrasing Predictions to Improve Weighted Dictionary Pronunciation Models. | Andrew Rosenberg |
| 2012 | Interspeech | Classifying Skewed Data: Importance Weighting to Optimize Average Recall. | Andrew Rosenberg |
| 2012 | Interspeech | Phrase Boundary Assignment from Text in Multiple Domains. | Andrew Rosenberg, Raul Fernandez, Bhuvana Ramabhadran |
| 2011 | ASSETS | Evaluating importance of facial expression in american sign language and pidgin signed english animations. | Matt Huenerfauth, Pengfei Lu, Andrew Rosenberg |
| 2011 | EUROGP | Multi-objective Genetic Programming for Visual Analytics. | Ilknur Icke, Andrew Rosenberg |
| 2011 | Interspeech | Intoxication Detection Using Phonetic, Phonotactic and Prosodic Cues. | Fadi Biadsy, William Yang Wang, Andrew Rosenberg, Julia Hirschberg |
| 2011 | Interspeech | Symbolic and Direct Sequential Modeling of Prosody for Classification of Speaking-Style and Nativeness. | Andrew Rosenberg |
| 2011 | Interspeech | Using Mutual Information to Identify Regions of Analysis for Prosodic Analysis. | Andrew Rosenberg |
| 2011 | Interspeech | "What is... Dengue Fever?" - Modeling and Predicting Pronunciation Errors in a Text-to-Speech System. | Andrew Rosenberg, Raul Fernandez, Bhuvana Ramabhadran |
| 2010 | GECCO | Dimensionality reduction using symbolic regression. | Ilknur Icke, Andrew Rosenberg |
| 2010 | Interspeech | AutoBI - a tool for automatic toBI annotation. | Andrew Rosenberg |
| 2010 | NAACL | Classification of Prosodic Events using Quantized Contour Modeling. | Andrew Rosenberg |
| 2009 | NAACL | Detecting Pitch Accents at the Word, Syllable and Vowel Level. | Andrew Rosenberg, Julia Hirschberg |
| 2008 | Interspeech | Intonational phrases for speech summarization. | Sameer Maskey, Andrew Rosenberg, Julia Hirschberg |
| 2007 | EMNLP | V-Measure: A Conditional Entropy-Based External Cluster Evaluation Measure. | Andrew Rosenberg, Julia Hirschberg |
| 2007 | Interspeech | Comparing american and palestinian perceptions of charisma using acoustic-prosodic and lexical analysis. | Fadi Biadsy, Julia Hirschberg, Andrew Rosenberg, Wisam Dakka |
| 2007 | Interspeech | Detecting pitch accent using pitch-corrected energy-based predictors. | Andrew Rosenberg, Julia Hirschberg |
| 2007 | Interspeech | Varying input segmentation for story boundary detection in English, Arabic and Mandarin broadcast news. | Andrew Rosenberg, Mehrbod Sharifi, Julia Hirschberg |
| 2006 | Interspeech | On the correlation between energy and pitch accent in read English speech. | Andrew Rosenberg, Julia Hirschberg |
| 2006 | NAACL | Story Segmentation of Broadcast News in English, Mandarin and Arabic. | Andrew Rosenberg, Julia Hirschberg |
| 2005 | Interspeech | Acoustic/prosodic and lexical correlates of charismatic speech. | Andrew Rosenberg, Julia Hirschberg |
| 2004 | NAACL | Augmenting the kappa statistic to determine interannotator reliability for multiply labeled data points. | Andrew Rosenberg, Ed Binkowski |