Skip to content

Bryan Catanzaro

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

77

Venues

20

Active years

2005–2026

Best venue rank

A*

Where they publish

Papers

77 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLFrom 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models.Chejian Xu, Wei Ping, Peng Xu, Zihan Liu, Boxin Wang, Mohammad Shoeybi, Bo Li, Bryan Catanzaro
2026EACLNemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning.Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov, Seungju Han, Ying Lin, Evelina Bakhturina, Eric Nyberg, Yejin Choi, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro
2025ACLNemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset.Dan Su, Kezhi Kong, Ying Lin, Joseph Jennings, Brandon Norick, Markus Kliegl, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro
2025ACLAceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling.Zihan Liu, Yang Chen, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping
2025CVPRRADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models.Greg Heinrich, Mike Ranzinger, Hongxu Yin, Yao Lu, Jan Kautz, Andrew Tao, Bryan Catanzaro, Pavlo Molchanov
2025ICLRMIND: Math Informed syNthetic Dialogues for Pretraining LLMs.Syeda Nahida Akter, Shrimai Prabhumoye, John Kamalu, Sanjeev Satheesh, Eric Nyberg, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro
2025ICLRSynthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data.Sreyan Ghosh, Sonal Kumar, Zhifeng Kong, Rafael Valle, Bryan Catanzaro, Dinesh Manocha
2025ICLRNV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models.Chankyu Lee, Rajarshi Roy, Mengyao Xu, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping
2025ICLRMm-Embed: Universal Multimodal Retrieval with Multimodal LLMS.Sheng-Chieh Lin, Chankyu Lee, Mohammad Shoeybi, Jimmy Lin, Bryan Catanzaro, Wei Ping
2025ICLRUniWav: Towards Unified Pre-training for Speech Representation Learning and Generation.Alexander H. Liu, Sang-gil Lee, Chao-Han Huck Yang, Yuan Gong, Yu-Chiang Frank Wang, James R. Glass, Rafael Valle, Bryan Catanzaro
2025ICLREagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders.Min Shi, Fuxiao Liu, Shihao Wang, Shijia Liao, Subhashree Radhakrishnan, Yilin Zhao, De-An Huang, Hongxu Yin, Karan Sapra, Yaser Yacoob, Humphrey Shi, Bryan Catanzaro, Andrew Tao, Jan Kautz, Zhiding Yu, Guilin Liu
2025ICLRFugatto 1: Foundational Generative Audio Transformer Opus 1.Rafael Valle, Rohan Badlani, Zhifeng Kong, Sang-gil Lee, Arushi Goel, Sungwon Kim, Joo Felipe Santos, Shuqi Dai, Siddharth Gururani, Aya Aljafari, Alexander H. Liu, Kevin J. Shih, Ryan Prenger, Wei Ping, Chao-Han Huck Yang, Bryan Catanzaro
2025ICLRChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities.Peng Xu, Wei Ping, Xianchao Wu, Chejian Xu, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro
2025ICMLAudio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities.Sreyan Ghosh, Zhifeng Kong, Sonal Kumar, S. Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, Bryan Catanzaro
2025ICMLETTA: Elucidating the Design Space of Text-to-Audio Models.Sang-gil Lee, Zhifeng Kong, Arushi Goel, Sungwon Kim, Rafael Valle, Bryan Catanzaro
2025ICMLFeatSharp: Your Vision Model Features, Sharper.Mike Ranzinger, Greg Heinrich, Pavlo Molchanov, Bryan Catanzaro, Andrew Tao
2025ICMLNemotron-CORTEXA: Enhancing LLM Agents for Software Engineering Tasks via Improved Localization and Solution Diversity.Atefeh Sohrabizadeh, Jialin Song, Mingjie Liu, Rajarshi Roy, Chankyu Lee, Jonathan Raiman, Bryan Catanzaro
2024DACCircuitVAE: Efficient and Scalable Latent Circuit Optimization.Jialin Song, Aidan M. Swope, Robert Kirby, Rajarshi Roy, Saad Godil, Jonathan Raiman, Bryan Catanzaro
2024EMNLPData, Data Everywhere: A Guide for Pretraining Dataset Construction.Jupinder Parmar, Shrimai Prabhumoye, Joseph Jennings, Bo Liu, Aastha Jhunjhunwala, Zhilin Wang, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro
2024EMNLPLLM-Evolve: Evaluation for LLM's Evolving Capability on Benchmarks.Jiaxuan You, Mingjie Liu, Shrimai Prabhumoye, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro
2024ICASSPScaling Nvidia's Multi-Speaker Multi-Lingual TTS Systems With Zero-Shot TTS to Indic Languages.Akshit Arora, Rohan Badlani, Sungwon Kim, Rafael Valle, Bryan Catanzaro
2024ICLRRetrieval meets Long Context Large Language Models.Peng Xu, Wei Ping, Xianchao Wu, Lawrence McAfee, Chen Zhu, Zihan Liu, Sandeep Subramanian, Evelina Bakhturina, Mohammad Shoeybi, Bryan Catanzaro
2024ICMLODIN: Disentangled Reward Mitigates Hacking in RLHF.Lichang Chen, Chen Zhu, Jiuhai Chen, Davit Soselia, Tianyi Zhou, Tom Goldstein, Heng Huang, Mohammad Shoeybi, Bryan Catanzaro
2024ICMLAudio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities.Zhifeng Kong, Arushi Goel, Rohan Badlani, Wei Ping, Rafael Valle, Bryan Catanzaro
2024ICMLInstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining.Boxin Wang, Wei Ping, Lawrence McAfee, Peng Xu, Bo Li, Mohammad Shoeybi, Bryan Catanzaro
2024WACVLeveraging Bitstream Metadata for Fast, Accurate, Generalized Compressed Video Quality Enhancement.Max Ehrlich, Jon Barker, Namitha Padmanabhan, Larry Davis, Andrew Tao, Bryan Catanzaro, Abhinav Shrivastava
2023ASPLOSLanguage Models: The Most Important Compute Challenge of Our Time (Keynote).Bryan Catanzaro
2023EACLAdding Instructions during Pretraining: Effective way of Controlling Toxicity in Language Models.Shrimai Prabhumoye, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro
2023EACLContext Generation Improves Open Domain Question Answering.Dan Su, Mostofa Patwary, Shrimai Prabhumoye, Peng Xu, Ryan Prenger, Mohammad Shoeybi, Pascale Fung, Anima Anandkumar, Bryan Catanzaro
2023EMNLPShall We Pretrain Autoregressive Language Models with Retrieval? A Comprehensive Study.Boxin Wang, Wei Ping, Peng Xu, Lawrence McAfee, Zihan Liu, Mohammad Shoeybi, Yi Dong, Oleksii Kuchaiev, Bo Li, Chaowei Xiao, Anima Anandkumar, Bryan Catanzaro
2023EMNLPRe-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning.Zhuolin Yang, Wei Ping, Zihan Liu, Vijay Korthikanti, Weili Nie, De-An Huang, Linxi Fan, Zhiding Yu, Shiyi Lan, Bo Li, Mohammad Shoeybi, Ming-Yu Liu, Yuke Zhu, Bryan Catanzaro, Chaowei Xiao, Anima Anandkumar
2023ICASSPVani: Very-Lightweight Accent-Controllable TTS for Native And Non-Native Speakers With Identity Preservation.Rohan Badlani, Akshit Arora, Subhankar Ghosh, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Boris Ginsburg, Bryan Catanzaro
2023ICASSPAny-to-Any Voice Conversion with F0 and Timbre Disentanglement and Novel Timbre Conditioning.Sudheer Kovela, Rafael Valle, Ambrish Dantrey, Bryan Catanzaro
2023ICASSPHigh-Acoustic Fidelity Text To Speech Synthesis With Fine-Grained Control Of Speech Attributes.Rafael Valle, Joo Felipe Santos, Kevin J. Shih, Rohan Badlani, Bryan Catanzaro
2023ICCADGraPhSyM: Graph Physical Synthesis Model.Ahmed Agiza, Rajarshi Roy, Teodor-Dumitru Ene, Saad Godil, Sherief Reda, Bryan Catanzaro
2023ICCVPreserve Your Own Correlation: A Noise Prior for Video Diffusion Models.Songwei Ge, Seungjun Nah, Guilin Liu, Tyler Poon, Andrew Tao, Bryan Catanzaro, David Jacobs, Jia-Bin Huang, Ming-Yu Liu, Yogesh Balaji
2023ICLRBigVGAN: A Universal Neural Vocoder with Large-Scale Training.Sang-gil Lee, Wei Ping, Boris Ginsburg, Bryan Catanzaro, Sungroh Yoon
2023InterspeechRAD-MMM: Multilingual Multiaccented Multispeaker Text To Speech.Rohan Badlani, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Siddharth Gururani, Bryan Catanzaro
2023InterspeechCleanUNet 2: A Hybrid Speech Denoising Model on Waveform and Spectrogram.Zhifeng Kong, Wei Ping, Ambrish Dantrey, Bryan Catanzaro
2022ACLMulti-Stage Prompting for Knowledgeable Dialogue Generation.Zihan Liu, Mostofa Patwary, Ryan Prenger, Shrimai Prabhumoye, Wei Ping, Mohammad Shoeybi, Bryan Catanzaro
2022EMNLPEvaluating Parameter Efficient Learning for Generation.Peng Xu, Mostofa Patwary, Shrimai Prabhumoye, Virginia Adams, Ryan Prenger, Wei Ping, Nayeon Lee, Mohammad Shoeybi, Bryan Catanzaro
2022ICASSPOne TTS Alignment to Rule Them All.Rohan Badlani, Adrian Lancucki, Kevin J. Shih, Rafael Valle, Wei Ping, Bryan Catanzaro
2022ICASSPSpeech Denoising in the Waveform Domain With Self-Attention.Zhifeng Kong, Wei Ping, Ambrish Dantrey, Bryan Catanzaro
2022ICLREfficient Token Mixing for Transformers via Adaptive Fourier Neural Operators.John Guibas, Morteza Mardani, Zongyi Li, Andrew Tao, Anima Anandkumar, Bryan Catanzaro
2021ACLEnd-to-End Training of Neural Retrievers for Open-Domain Question Answering.Devendra Singh Sachan, Mostofa Patwary, Mohammad Shoeybi, Neel Kant, Wei Ping, William L. Hamilton, Bryan Catanzaro
2021CVPRView Generalization for Single Image Textured 3D Models.Anand Bhattad, Aysegul Dundar, Guilin Liu, Andrew Tao, Bryan Catanzaro
2021DACPrefixRL: Optimization of Parallel Prefix Circuits using Deep Reinforcement Learning.Rajarshi Roy, Jonathan Raiman, Neel Kant, Ilyas Elkin, Robert Kirby, Michael Y. Siu, Stuart F. Oberman, Saad Godil, Bryan Catanzaro
2021ICCVDual Contrastive Loss and Attention for GANs.Ning Yu, Guilin Liu, Aysegul Dundar, Andrew Tao, Bryan Catanzaro, Larry Davis, Mario Fritz
2021ICLRDiffWave: A Versatile Diffusion Model for Audio Synthesis.Zhifeng Kong, Wei Ping, Jiaji Huang, Kexin Zhao, Bryan Catanzaro
2021ICLRFlowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis.Rafael Valle, Kevin J. Shih, Ryan Prenger, Bryan Catanzaro
2021SCEfficient large-scale language model training on GPU clusters using megatron-LM.Deepak Narayanan, Mohammad Shoeybi, Jared Casper, Patrick LeGresley, Mostofa Patwary, Vijay Korthikanti, Dmitri Vainbrand, Prethvi Kashinkunti, Julie Bernauer, Bryan Catanzaro, Amar Phanishayee, Matei Zaharia
2020ACLLarge Scale Multi-Actor Generative Dialog Modeling.Alex Boyd, Raul Puri, Mohammad Shoeybi, Mostofa Patwary, Bryan Catanzaro
2020CVPRPanoptic-Based Image Synthesis.Aysegul Dundar, Karan Sapra, Guilin Liu, Andrew Tao, Bryan Catanzaro
2020EMNLPTraining Question Answering Models From Synthetic Data.Raul Puri, Ryan Spring, Mohammad Shoeybi, Mostofa Patwary, Bryan Catanzaro
2020EMNLPMEGATRON-CNTRL: Controllable Story Generation with External Knowledge Using Large-Scale Language Models.Peng Xu, Mostofa Patwary, Mohammad Shoeybi, Raul Puri, Pascale Fung, Anima Anandkumar, Bryan Catanzaro
2020ICASSPMellotron: Multispeaker Expressive Voice Synthesis by Conditioning on Rhythm, Pitch and Global Style Tokens.Rafael Valle, Jason Li, Ryan Prenger, Bryan Catanzaro
2019CVPRImproving Semantic Segmentation via Video Propagation and Label Relaxation.Yi Zhu, Karan Sapra, Fitsum A. Reda, Kevin J. Shih, Shawn D. Newsam, Andrew Tao, Bryan Catanzaro
2019CVPRGraphical Contrastive Losses for Scene Graph Parsing.Ji Zhang, Kevin J. Shih, Ahmed Elgammal, Andrew Tao, Bryan Catanzaro
2019ICASSPWaveglow: A Flow-based Generative Network for Speech Synthesis.Ryan Prenger, Rafael Valle, Bryan Catanzaro
2019ICCVUnsupervised Video Interpolation Using Cycle Consistency.Fitsum A. Reda, Deqing Sun, Aysegul Dundar, Mohammad Shoeybi, Guilin Liu, Kevin J. Shih, Andrew Tao, Jan Kautz, Bryan Catanzaro
2018AAAIMalware Detection by Eating a Whole EXE.Edward Raff, Jon Barker, Jared Sylvester, Robert Brandon, Bryan Catanzaro, Charles K. Nicholas
2018CVPRHigh-Resolution Image Synthesis and Semantic Manipulation With Conditional GANs.Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu, Andrew Tao, Jan Kautz, Bryan Catanzaro
2018ECCVImage Inpainting for Irregular Holes Using Partial Convolutions.Guilin Liu, Fitsum A. Reda, Kevin J. Shih, Ting-Chun Wang, Andrew Tao, Bryan Catanzaro
2018ECCVSDC-Net: Video Prediction Using Spatially-Displaced Convolution.Fitsum A. Reda, Guilin Liu, Kevin J. Shih, Robert Kirby, Jon Barker, David Tarjan, Andrew Tao, Bryan Catanzaro
2018SBAC-PADLarge Scale Language Modeling: Converging on 40GB of Text in Four Hours.Raul Puri, Robert Kirby, Nikolai Yakovenko, Bryan Catanzaro
2017ICLRDSD: Dense-Sparse-Dense Training for Deep Neural Networks.Song Han, Jeff Pool, Sharan Narang, Huizi Mao, Enhao Gong, Shijian Tang, Erich Elsen, Peter Vajda, Manohar Paluri, John Tran, Bryan Catanzaro, William J. Dally
2016ICMLDeep Speech 2 : End-to-End Speech Recognition in English and Mandarin.Dario Amodei, Sundaram Ananthanarayanan, Rishita Anubhai, Jingliang Bai, Eric Battenberg, Carl Case, Jared Casper, Bryan Catanzaro, Jingdong Chen, Mike Chrzanowski, Adam Coates, Greg Diamos, Erich Elsen, Jesse H. Engel, Linxi Fan, Christopher Fougner, Awni Y. Hannun, Billy Jun, Tony Han, Patrick LeGresley, Xiangang Li, Libby Lin, Sharan Narang, Andrew Y. Ng, Sherjil Ozair, Ryan Prenger, Sheng Qian, Jonathan Raiman, Sanjeev Satheesh, David Seetapun, Shubho Sengupta, Chong Wang, Yi Wang, Zhiqian Wang, Bo Xiao, Yan Xie, Dani Yogatama, Jun Zhan, Zhenyao Zhu
2016ICMLPersistent RNNs: Stashing Recurrent Weights On-Chip.Greg Diamos, Shubho Sengupta, Bryan Catanzaro, Mike Chrzanowski, Adam Coates, Erich Elsen, Jesse H. Engel, Awni Y. Hannun, Sanjeev Satheesh
2015PPoPPA collection-oriented programming model for performance portability.Saurav Muralidharan, Michael Garland, Bryan Catanzaro, Albert Sidelnik, Mary W. Hall
2014PPoPPA decomposition for in-place matrix transposition.Bryan Catanzaro, Alexander Keller, Michael Garland
2013ICMLDeep learning with COTS HPC systems.Adam Coates, Brody Huval, Tao Wang, David J. Wu, Bryan Catanzaro, Andrew Y. Ng
2011PPoPPCopperhead: compiling an embedded data parallel language.Bryan Catanzaro, Michael Garland, Kurt Keutzer
2009ICCVEfficient, high-quality image contour detection.Bryan Catanzaro, Bor-Yiing Su, Narayanan Sundaram, Yunsup Lee, Mark Murphy, Kurt Keutzer
2008DACParallelizing CAD: a timely research agenda for EDA.Bryan Catanzaro, Kurt Keutzer, Bor-Yiing Su
2008ICMLFast support vector machine training and classification on graphics processors.Bryan Catanzaro, Narayanan Sundaram, Kurt Keutzer
2005FCCMHigher Radix Floating-Point Representations for FPGA-Based Arithmetic.Bryan Catanzaro, Brent E. Nelson
2005FPGAChoice of base revisited: higher radices for FPGA-based floating-point computation (abstract only).Bryan Catanzaro, Brent E. Nelson