Rafael Valle
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
19
Venues
7
Active years
2019–2026
Best venue rank
A*
Where they publish
Papers
19 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception. | Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang |
| 2025 | EMNLP | Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance. | Shehzeen Samarah Hussain, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Subhankar Ghosh, Roy Fejgin, Mikyas T. Desta, Rafael Valle, Jason Li |
| 2025 | ICLR | Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data. | Sreyan Ghosh, Sonal Kumar, Zhifeng Kong, Rafael Valle, Bryan Catanzaro, Dinesh Manocha |
| 2025 | ICLR | UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation. | Alexander H. Liu, Sang-gil Lee, Chao-Han Huck Yang, Yuan Gong, Yu-Chiang Frank Wang, James R. Glass, Rafael Valle, Bryan Catanzaro |
| 2025 | ICLR | Fugatto 1: Foundational Generative Audio Transformer Opus 1. | Rafael Valle, Rohan Badlani, Zhifeng Kong, Sang-gil Lee, Arushi Goel, Sungwon Kim, Joo Felipe Santos, Shuqi Dai, Siddharth Gururani, Aya Aljafari, Alexander H. Liu, Kevin J. Shih, Ryan Prenger, Wei Ping, Chao-Han Huck Yang, Bryan Catanzaro |
| 2025 | ICML | Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities. | Sreyan Ghosh, Zhifeng Kong, Sonal Kumar, S. Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, Bryan Catanzaro |
| 2025 | ICML | ETTA: Elucidating the Design Space of Text-to-Audio Models. | Sang-gil Lee, Zhifeng Kong, Arushi Goel, Sungwon Kim, Rafael Valle, Bryan Catanzaro |
| 2024 | ICASSP | Scaling Nvidia's Multi-Speaker Multi-Lingual TTS Systems With Zero-Shot TTS to Indic Languages. | Akshit Arora, Rohan Badlani, Sungwon Kim, Rafael Valle, Bryan Catanzaro |
| 2024 | ICML | Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities. | Zhifeng Kong, Arushi Goel, Rohan Badlani, Wei Ping, Rafael Valle, Bryan Catanzaro |
| 2024 | ICML | SelfVC: Voice Conversion With Iterative Refinement using Self Transformations. | Paarth Neekhara, Shehzeen Samarah Hussain, Rafael Valle, Boris Ginsburg, Rishabh Ranjan, Shlomo Dubnov, Farinaz Koushanfar, Julian J. McAuley |
| 2023 | ICASSP | Vani: Very-Lightweight Accent-Controllable TTS for Native And Non-Native Speakers With Identity Preservation. | Rohan Badlani, Akshit Arora, Subhankar Ghosh, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Boris Ginsburg, Bryan Catanzaro |
| 2023 | ICASSP | Any-to-Any Voice Conversion with F0 and Timbre Disentanglement and Novel Timbre Conditioning. | Sudheer Kovela, Rafael Valle, Ambrish Dantrey, Bryan Catanzaro |
| 2023 | ICASSP | High-Acoustic Fidelity Text To Speech Synthesis With Fine-Grained Control Of Speech Attributes. | Rafael Valle, Joo Felipe Santos, Kevin J. Shih, Rohan Badlani, Bryan Catanzaro |
| 2023 | ICCV | SPACE: Speech-driven Portrait Animation with Controllable Expression. | Siddharth Gururani, Arun Mallya, Ting-Chun Wang, Rafael Valle, Ming-Yu Liu |
| 2023 | Interspeech | RAD-MMM: Multilingual Multiaccented Multispeaker Text To Speech. | Rohan Badlani, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Siddharth Gururani, Bryan Catanzaro |
| 2022 | ICASSP | One TTS Alignment to Rule Them All. | Rohan Badlani, Adrian Lancucki, Kevin J. Shih, Rafael Valle, Wei Ping, Bryan Catanzaro |
| 2021 | ICLR | Flowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis. | Rafael Valle, Kevin J. Shih, Ryan Prenger, Bryan Catanzaro |
| 2020 | ICASSP | Mellotron: Multispeaker Expressive Voice Synthesis by Conditioning on Rhythm, Pitch and Global Style Tokens. | Rafael Valle, Jason Li, Ryan Prenger, Bryan Catanzaro |
| 2019 | ICASSP | Waveglow: A Flow-based Generative Network for Speech Synthesis. | Ryan Prenger, Rafael Valle, Bryan Catanzaro |