Skip to content

Wei-Ning Hsu

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

62

Venues

13

Active years

2015–2025

Best venue rank

A*

Where they publish

Papers

62 indexed papers, newest first.

YearVenueTitleAuthors
2025ASRUThe AudioMOS Challenge 2025.Wen-Chin Huang, Hui Wang, Cheng Liu, Yi-Chiao Wu, Andros Tjandra, Wei-Ning Hsu, Erica Cooper, Yong Qin, Tomoki Toda
2025ASRUMeta Audiobox Aesthetics: Unified Automatic Assessment for Speech, Music and Sound.Andros Tjandra, Yi-Chiao Wu, Baishan Guo, John Hoffman, Brian Ellis, Apoorv Vyas, Bowen Shi, Sanyuan Chen, Matt Le, Nick Zacharov, Carleigh Wood, Ann Lee, Wei-Ning Hsu
2025ICLRFlowDec: A flow-based full-band general audio codec with high perceptual quality.Simon Welker, Matthew Le, Ricky T. Q. Chen, Wei-Ning Hsu, Timo Gerkmann, Alexander Richard, Yi-Chiao Wu
2025InterspeechAudiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation.Mu Yang, Bowen Shi, Matthew Le, Wei-Ning Hsu, Andros Tjandra
2024ACLXLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception.HyoJung Han, Mohamed Anwar, Juan Pino, Wei-Ning Hsu, Marine Carpuat, Bowen Shi, Changhan Wang
2024ECCVAction2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos.Changan Chen, Puyuan Peng, Ami Baid, Zihui Xue, Wei-Ning Hsu, David Harwath, Kristen Grauman
2024ICASSPM2BART: Multilingual and Multimodal Encoder-Decoder Pre-Training for Any-to-Any Machine Translation.Peng-Jen Chen, Bowen Shi, Kelvin Niu, Ann Lee, Wei-Ning Hsu
2024ICASSPAttention or Convolution: Transformer Encoders in Audio Language Models for Inference Efficiency.Sungho Jeon, Ching-Feng Yeh, Hakan Inan, Wei-Ning Hsu, Rashi Rungta, Yashar Mehdad, Daniel Bikel
2024ICLRGenerative Pre-training for Speech with Flow Matching.Alexander H. Liu, Matthew Le, Apoorv Vyas, Bowen Shi, Andros Tjandra, Wei-Ning Hsu
2024ICMLMusicFlow: Cascaded Flow Matching for Text Guided Music Generation.K. R. Prajwal, Bowen Shi, Matthew Le, Apoorv Vyas, Andros Tjandra, Mahi Luthra, Baishan Guo, Huiyu Wang, Triantafyllos Afouras, David Kant, Wei-Ning Hsu
2024InterspeechLearning Fine-Grained Controllability on Speech Generation via Efficient Fine-Tuning.Chung-Ming Chien, Andros Tjandra, Apoorv Vyas, Matt Le, Bowen Shi, Wei-Ning Hsu
2023ACLSpeech-to-Speech Translation for a Real-world Unwritten Language.Peng-Jen Chen, Kevin Tran, Yilin Yang, Jingfei Du, Justine Kao, Yu-An Chung, Paden Tomasello, Paul-Ambroise Duquenne, Holger Schwenk, Hongyu Gong, Hirofumi Inaguma, Sravya Popuri, Changhan Wang, Juan Pino, Wei-Ning Hsu, Ann Lee
2023ACLSimple and Effective Unsupervised Speech Translation.Changhan Wang, Hirofumi Inaguma, Peng-Jen Chen, Ilia Kulikov, Yun Tang, Wei-Ning Hsu, Michael Auli, Juan Pino
2023ASRUAv-Data2Vec: Self-Supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations.Jiachen Lian, Alexei Baevski, Wei-Ning Hsu, Michael Auli
2023CVPRReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Regeneration.Wei-Ning Hsu, Tal Remez, Bowen Shi, Jacob Donley, Yossi Adi
2023EMNLPToward Joint Language Modeling for Speech Units and Text.Ju-Chieh Chou, Chung-Ming Chien, Wei-Ning Hsu, Karen Livescu, Arun Babu, Alexis Conneau, Alexei Baevski, Michael Auli
2023ICASSPContinual Learning for On-Device Speech Recognition Using Disentangled Conformers.Anuj Diwan, Ching-Feng Yeh, Wei-Ning Hsu, Paden Tomasello, Eunsol Choi, David Harwath, Abdelrahman Mohamed
2023ICASSPDo Coarser Units Benefit Cluster Prediction-Based Speech Pre-Training?Ali Elkahky, Wei-Ning Hsu, Paden Tomasello, Tu Anh Nguyen, Robin Algayres, Yossi Adi, Jade Copet, Emmanuel Dupoux, Abdelrahman Mohamed
2023ICASSPCocktail Hubert: Generalized Self-Supervised Pre-Training for Mixture and Single-Source Speech.Maryam Fazel-Zarandi, Wei-Ning Hsu
2023ICASSPMeasuring the Impact of Domain Factors in Self-Supervised Pre-Training.Ramon Sanabria, Wei-Ning Hsu, Alexei Baevski, Michael Auli
2023ICMLScaling Laws for Generative Mixed-Modal Language Models.Armen Aghajanyan, Lili Yu, Alexis Conneau, Wei-Ning Hsu, Karen Hambardzumyan, Susan Zhang, Stephen Roller, Naman Goyal, Omer Levy, Luke Zettlemoyer
2023ICMLEfficient Self-supervised Learning with Contextualized Target Representations for Vision, Speech and Language.Alexei Baevski, Arun Babu, Wei-Ning Hsu, Michael Auli
2023InterspeechMuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation.Mohamed Anwar, Bowen Shi, Vedanuj Goswami, Wei-Ning Hsu, Juan Pino, Changhan Wang
2023InterspeechExpresso: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis.Tu Anh Nguyen, Wei-Ning Hsu, Antony D'Avirro, Bowen Shi, Itai Gat, Maryam Fazel-Zarandi, Tal Remez, Jade Copet, Gabriel Synnaeve, Michael Hassid, Felix Kreuk, Yossi Adi, Emmanuel Dupoux
2022ACLText-Free Prosody-Aware Generative Spoken Language Modeling.Eugene Kharitonov, Ann Lee, Adam Polyak, Yossi Adi, Jade Copet, Kushal Lakhotia, Tu Anh Nguyen, Morgane Rivire, Abdelrahman Mohamed, Emmanuel Dupoux, Wei-Ning Hsu
2022ACLDirect Speech-to-Speech Translation With Discrete Units.Ann Lee, Peng-Jen Chen, Changhan Wang, Jiatao Gu, Sravya Popuri, Xutai Ma, Adam Polyak, Yossi Adi, Qing He, Yun Tang, Juan Pino, Wei-Ning Hsu
2022ACLUnified Speech-Text Pre-training for Speech Translation and Recognition.Yun Tang, Hongyu Gong, Ning Dong, Changhan Wang, Wei-Ning Hsu, Jiatao Gu, Alexei Baevski, Xian Li, Abdelrahman Mohamed, Michael Auli, Juan Miguel Pino
2022EMNLPTextless Speech Emotion Conversion using Discrete & Decomposed Representations.Felix Kreuk, Adam Polyak, Jade Copet, Eugene Kharitonov, Tu Anh Nguyen, Morgane Rivire, Wei-Ning Hsu, Abdelrahman Mohamed, Emmanuel Dupoux, Yossi Adi
2022ICLRLearning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction.Bowen Shi, Wei-Ning Hsu, Kushal Lakhotia, Abdelrahman Mohamed
2022ICMLdata2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language.Alexei Baevski, Wei-Ning Hsu, Qiantong Xu, Arun Babu, Jiatao Gu, Michael Auli
2022InterspeechSimple and Effective Unsupervised Speech Synthesis.Alexander H. Liu, Cheng-I Lai, Wei-Ning Hsu, Michael Auli, Alexei Baevski, James R. Glass
2022InterspeechEnhanced Direct Speech-to-Speech Translation Using Self-supervised Pre-training and Data Augmentation.Sravya Popuri, Peng-Jen Chen, Changhan Wang, Juan Pino, Yossi Adi, Jiatao Gu, Wei-Ning Hsu, Ann Lee
2022InterspeechRobust Self-Supervised Audio-Visual Speech Recognition.Bowen Shi, Wei-Ning Hsu, Abdelrahman Mohamed
2022InterspeechLearning Lip-Based Audio-Visual Speaker Embeddings with AV-HuBERT.Bowen Shi, Abdelrahman Mohamed, Wei-Ning Hsu
2022InterspeechOn-demand compute reduction with stochastic wav2vec 2.0.Apoorv Vyas, Wei-Ning Hsu, Michael Auli, Alexei Baevski
2022NAACLTextless Speech-to-Speech Translation on Real Data.Ann Lee, Hongyu Gong, Paul-Ambroise Duquenne, Holger Schwenk, Peng-Jen Chen, Changhan Wang, Sravya Popuri, Yossi Adi, Juan Miguel Pino, Jiatao Gu, Wei-Ning Hsu
2021ACLText-Free Image-to-Speech Synthesis Using Learned Segmental Units.Wei-Ning Hsu, David Harwath, Tyler Miller, Christopher Song, James R. Glass
2021ASRUKaizen: Continuously Improving Teacher Using Exponential Moving Average for Semi-Supervised Speech Recognition.Vimal Manohar, Tatiana Likhomanenko, Qiantong Xu, Wei-Ning Hsu, Ronan Collobert, Yatharth Saraf, Geoffrey Zweig, Abdelrahman Mohamed
2021EMNLPfairseq S\^2: A Scalable and Integrable Speech Synthesis Toolkit.Changhan Wang, Wei-Ning Hsu, Yossi Adi, Adam Polyak, Ann Lee, Peng-Jen Chen, Jiatao Gu, Juan Pino
2021ICASSPHubert: How Much Can a Bad Teacher Benefit ASR Pre-Training?Wei-Ning Hsu, Yao-Hung Hubert Tsai, Benjamin Bolte, Ruslan Salakhutdinov, Abdelrahman Mohamed
2021InterspeechRobust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training.Wei-Ning Hsu, Anuroop Sriram, Alexei Baevski, Tatiana Likhomanenko, Qiantong Xu, Vineel Pratap, Jacob Kahn, Ann Lee, Ronan Collobert, Gabriel Synnaeve, Michael Auli
2021InterspeechSpeech Resynthesis from Discrete Disentangled Self-Supervised Representations.Adam Polyak, Yossi Adi, Jade Copet, Eugene Kharitonov, Kushal Lakhotia, Wei-Ning Hsu, Abdelrahman Mohamed, Emmanuel Dupoux
2020ICLRLearning Hierarchical Discrete Linguistic Units from Visually-Grounded Speech.David Harwath, Wei-Ning Hsu, James R. Glass
2020InterspeechUnsupervised Methods for Evaluating Speech Representations.Michael Gump, Wei-Ning Hsu, James R. Glass
2020InterspeechA Convolutional Deep Markov Model for Unsupervised Speech Representation Learning.Sameer Khurana, Antoine Laurent, Wei-Ning Hsu, Jan Chorowski, Adrian Lancucki, Ricard Marxer, James R. Glass
2019ICASSPSemi-supervised Training for Improving Data Efficiency in End-to-end Speech Synthesis.Yu-An Chung, Yuxuan Wang, Wei-Ning Hsu, Yu Zhang, R. J. Skerry-Ryan
2019ICASSPDisentangling Correlated Speaker and Noise for Speech Synthesis via Data Augmentation and Adversarial Factorization.Wei-Ning Hsu, Yu Zhang, Ron J. Weiss, Yu-An Chung, Yuxuan Wang, Yonghui Wu, James R. Glass
2019ICLRHierarchical Generative Modeling for Controllable Speech Synthesis.Wei-Ning Hsu, Yu Zhang, Ron J. Weiss, Heiga Zen, Yonghui Wu, Yuxuan Wang, Yuan Cao, Ye Jia, Zhifeng Chen, Jonathan Shen, Patrick Nguyen, Ruoming Pang
2019InterspeechAn Unsupervised Autoregressive Model for Speech Representation Learning.Yu-An Chung, Wei-Ning Hsu, Hao Tang, James R. Glass
2019InterspeechTransfer Learning from Audio-Visual Grounding to Speech Recognition.Wei-Ning Hsu, David Harwath, James R. Glass
2018ICASSPExtracting Domain Invariant Features by Unsupervised Learning for Robust Automatic Speech Recognition.Wei-Ning Hsu, James R. Glass
2018ICPRA Noise-Robust Self-Adaptive Multitarget Speaker Detection System.Siqi Zheng, Jianzong Wang, Jing Xiao, Wei-Ning Hsu, James R. Glass
2018InterspeechScalable Factorized Hierarchical Variational Autoencoder Training.Wei-Ning Hsu, James R. Glass
2018InterspeechUnsupervised Adaptation with Interpretable Disentangled Representations for Distant Conversational Speech Recognition.Wei-Ning Hsu, Hao Tang, James R. Glass
2018InterspeechA Study of Enhancement, Augmentation and Autoencoder Methods for Domain Adaptation in Distant Speech Recognition.Hao Tang, Wei-Ning Hsu, Franois Grondin, James R. Glass
2017ASRUUnsupervised domain adaptation for robust speech recognition via variational autoencoder-based data augmentation.Wei-Ning Hsu, Yu Zhang, James R. Glass
2017ASRUAutomatic speech recognition of Arabic multi-genre broadcast media.Maryam Najafian, Wei-Ning Hsu, Ahmed Ali, James R. Glass
2017InterspeechLearning Latent Representations for Speech Generation and Transformation.Wei-Ning Hsu, Yu Zhang, James R. Glass
2016COLINGNeural Attention for Learning to Rank Questions in Community Question Answering.Salvatore Romeo, Giovanni Da San Martino, Alberto Barrn-Cedeo, Alessandro Moschitti, Yonatan Belinkov, Wei-Ning Hsu, Yu Zhang, Mitra Mohtarami, James R. Glass
2016InterspeechExploiting Depth and Highway Connections in Convolutional Recurrent Deep Neural Networks for Speech Recognition.Wei-Ning Hsu, Yu Zhang, Ann Lee, James R. Glass
2015AAAIActive Learning by Learning.Wei-Ning Hsu, Hsuan-Tien Lin
2015ICASSPEnhancing automatically discovered multi-level acoustic patterns considering context consistency with applications in spoken term detection.Cheng-Tao Chung, Wei-Ning Hsu, Cheng-Yi Lee, Lin-Shan Lee