Skip to content

Rafael Valle

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

19

Venues

7

Active years

2019–2026

Best venue rank

A*

Where they publish

Papers

19 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLSpeech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception.Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang
2025EMNLPKoel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance.Shehzeen Samarah Hussain, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Subhankar Ghosh, Roy Fejgin, Mikyas T. Desta, Rafael Valle, Jason Li
2025ICLRSynthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data.Sreyan Ghosh, Sonal Kumar, Zhifeng Kong, Rafael Valle, Bryan Catanzaro, Dinesh Manocha
2025ICLRUniWav: Towards Unified Pre-training for Speech Representation Learning and Generation.Alexander H. Liu, Sang-gil Lee, Chao-Han Huck Yang, Yuan Gong, Yu-Chiang Frank Wang, James R. Glass, Rafael Valle, Bryan Catanzaro
2025ICLRFugatto 1: Foundational Generative Audio Transformer Opus 1.Rafael Valle, Rohan Badlani, Zhifeng Kong, Sang-gil Lee, Arushi Goel, Sungwon Kim, Joo Felipe Santos, Shuqi Dai, Siddharth Gururani, Aya Aljafari, Alexander H. Liu, Kevin J. Shih, Ryan Prenger, Wei Ping, Chao-Han Huck Yang, Bryan Catanzaro
2025ICMLAudio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities.Sreyan Ghosh, Zhifeng Kong, Sonal Kumar, S. Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, Bryan Catanzaro
2025ICMLETTA: Elucidating the Design Space of Text-to-Audio Models.Sang-gil Lee, Zhifeng Kong, Arushi Goel, Sungwon Kim, Rafael Valle, Bryan Catanzaro
2024ICASSPScaling Nvidia's Multi-Speaker Multi-Lingual TTS Systems With Zero-Shot TTS to Indic Languages.Akshit Arora, Rohan Badlani, Sungwon Kim, Rafael Valle, Bryan Catanzaro
2024ICMLAudio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities.Zhifeng Kong, Arushi Goel, Rohan Badlani, Wei Ping, Rafael Valle, Bryan Catanzaro
2024ICMLSelfVC: Voice Conversion With Iterative Refinement using Self Transformations.Paarth Neekhara, Shehzeen Samarah Hussain, Rafael Valle, Boris Ginsburg, Rishabh Ranjan, Shlomo Dubnov, Farinaz Koushanfar, Julian J. McAuley
2023ICASSPVani: Very-Lightweight Accent-Controllable TTS for Native And Non-Native Speakers With Identity Preservation.Rohan Badlani, Akshit Arora, Subhankar Ghosh, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Boris Ginsburg, Bryan Catanzaro
2023ICASSPAny-to-Any Voice Conversion with F0 and Timbre Disentanglement and Novel Timbre Conditioning.Sudheer Kovela, Rafael Valle, Ambrish Dantrey, Bryan Catanzaro
2023ICASSPHigh-Acoustic Fidelity Text To Speech Synthesis With Fine-Grained Control Of Speech Attributes.Rafael Valle, Joo Felipe Santos, Kevin J. Shih, Rohan Badlani, Bryan Catanzaro
2023ICCVSPACE: Speech-driven Portrait Animation with Controllable Expression.Siddharth Gururani, Arun Mallya, Ting-Chun Wang, Rafael Valle, Ming-Yu Liu
2023InterspeechRAD-MMM: Multilingual Multiaccented Multispeaker Text To Speech.Rohan Badlani, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Siddharth Gururani, Bryan Catanzaro
2022ICASSPOne TTS Alignment to Rule Them All.Rohan Badlani, Adrian Lancucki, Kevin J. Shih, Rafael Valle, Wei Ping, Bryan Catanzaro
2021ICLRFlowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis.Rafael Valle, Kevin J. Shih, Ryan Prenger, Bryan Catanzaro
2020ICASSPMellotron: Multispeaker Expressive Voice Synthesis by Conditioning on Rhythm, Pitch and Global Style Tokens.Rafael Valle, Jason Li, Ryan Prenger, Bryan Catanzaro
2019ICASSPWaveglow: A Flow-based Generative Network for Speech Synthesis.Ryan Prenger, Rafael Valle, Bryan Catanzaro