Wei-Ning Hsu
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
62
Venues
13
Active years
2015–2025
Best venue rank
A*
Where they publish
Papers
62 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | ASRU | The AudioMOS Challenge 2025. | Wen-Chin Huang, Hui Wang, Cheng Liu, Yi-Chiao Wu, Andros Tjandra, Wei-Ning Hsu, Erica Cooper, Yong Qin, Tomoki Toda |
| 2025 | ASRU | Meta Audiobox Aesthetics: Unified Automatic Assessment for Speech, Music and Sound. | Andros Tjandra, Yi-Chiao Wu, Baishan Guo, John Hoffman, Brian Ellis, Apoorv Vyas, Bowen Shi, Sanyuan Chen, Matt Le, Nick Zacharov, Carleigh Wood, Ann Lee, Wei-Ning Hsu |
| 2025 | ICLR | FlowDec: A flow-based full-band general audio codec with high perceptual quality. | Simon Welker, Matthew Le, Ricky T. Q. Chen, Wei-Ning Hsu, Timo Gerkmann, Alexander Richard, Yi-Chiao Wu |
| 2025 | Interspeech | Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation. | Mu Yang, Bowen Shi, Matthew Le, Wei-Ning Hsu, Andros Tjandra |
| 2024 | ACL | XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception. | HyoJung Han, Mohamed Anwar, Juan Pino, Wei-Ning Hsu, Marine Carpuat, Bowen Shi, Changhan Wang |
| 2024 | ECCV | Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos. | Changan Chen, Puyuan Peng, Ami Baid, Zihui Xue, Wei-Ning Hsu, David Harwath, Kristen Grauman |
| 2024 | ICASSP | M2BART: Multilingual and Multimodal Encoder-Decoder Pre-Training for Any-to-Any Machine Translation. | Peng-Jen Chen, Bowen Shi, Kelvin Niu, Ann Lee, Wei-Ning Hsu |
| 2024 | ICASSP | Attention or Convolution: Transformer Encoders in Audio Language Models for Inference Efficiency. | Sungho Jeon, Ching-Feng Yeh, Hakan Inan, Wei-Ning Hsu, Rashi Rungta, Yashar Mehdad, Daniel Bikel |
| 2024 | ICLR | Generative Pre-training for Speech with Flow Matching. | Alexander H. Liu, Matthew Le, Apoorv Vyas, Bowen Shi, Andros Tjandra, Wei-Ning Hsu |
| 2024 | ICML | MusicFlow: Cascaded Flow Matching for Text Guided Music Generation. | K. R. Prajwal, Bowen Shi, Matthew Le, Apoorv Vyas, Andros Tjandra, Mahi Luthra, Baishan Guo, Huiyu Wang, Triantafyllos Afouras, David Kant, Wei-Ning Hsu |
| 2024 | Interspeech | Learning Fine-Grained Controllability on Speech Generation via Efficient Fine-Tuning. | Chung-Ming Chien, Andros Tjandra, Apoorv Vyas, Matt Le, Bowen Shi, Wei-Ning Hsu |
| 2023 | ACL | Speech-to-Speech Translation for a Real-world Unwritten Language. | Peng-Jen Chen, Kevin Tran, Yilin Yang, Jingfei Du, Justine Kao, Yu-An Chung, Paden Tomasello, Paul-Ambroise Duquenne, Holger Schwenk, Hongyu Gong, Hirofumi Inaguma, Sravya Popuri, Changhan Wang, Juan Pino, Wei-Ning Hsu, Ann Lee |
| 2023 | ACL | Simple and Effective Unsupervised Speech Translation. | Changhan Wang, Hirofumi Inaguma, Peng-Jen Chen, Ilia Kulikov, Yun Tang, Wei-Ning Hsu, Michael Auli, Juan Pino |
| 2023 | ASRU | Av-Data2Vec: Self-Supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations. | Jiachen Lian, Alexei Baevski, Wei-Ning Hsu, Michael Auli |
| 2023 | CVPR | ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Regeneration. | Wei-Ning Hsu, Tal Remez, Bowen Shi, Jacob Donley, Yossi Adi |
| 2023 | EMNLP | Toward Joint Language Modeling for Speech Units and Text. | Ju-Chieh Chou, Chung-Ming Chien, Wei-Ning Hsu, Karen Livescu, Arun Babu, Alexis Conneau, Alexei Baevski, Michael Auli |
| 2023 | ICASSP | Continual Learning for On-Device Speech Recognition Using Disentangled Conformers. | Anuj Diwan, Ching-Feng Yeh, Wei-Ning Hsu, Paden Tomasello, Eunsol Choi, David Harwath, Abdelrahman Mohamed |
| 2023 | ICASSP | Do Coarser Units Benefit Cluster Prediction-Based Speech Pre-Training? | Ali Elkahky, Wei-Ning Hsu, Paden Tomasello, Tu Anh Nguyen, Robin Algayres, Yossi Adi, Jade Copet, Emmanuel Dupoux, Abdelrahman Mohamed |
| 2023 | ICASSP | Cocktail Hubert: Generalized Self-Supervised Pre-Training for Mixture and Single-Source Speech. | Maryam Fazel-Zarandi, Wei-Ning Hsu |
| 2023 | ICASSP | Measuring the Impact of Domain Factors in Self-Supervised Pre-Training. | Ramon Sanabria, Wei-Ning Hsu, Alexei Baevski, Michael Auli |
| 2023 | ICML | Scaling Laws for Generative Mixed-Modal Language Models. | Armen Aghajanyan, Lili Yu, Alexis Conneau, Wei-Ning Hsu, Karen Hambardzumyan, Susan Zhang, Stephen Roller, Naman Goyal, Omer Levy, Luke Zettlemoyer |
| 2023 | ICML | Efficient Self-supervised Learning with Contextualized Target Representations for Vision, Speech and Language. | Alexei Baevski, Arun Babu, Wei-Ning Hsu, Michael Auli |
| 2023 | Interspeech | MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation. | Mohamed Anwar, Bowen Shi, Vedanuj Goswami, Wei-Ning Hsu, Juan Pino, Changhan Wang |
| 2023 | Interspeech | Expresso: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis. | Tu Anh Nguyen, Wei-Ning Hsu, Antony D'Avirro, Bowen Shi, Itai Gat, Maryam Fazel-Zarandi, Tal Remez, Jade Copet, Gabriel Synnaeve, Michael Hassid, Felix Kreuk, Yossi Adi, Emmanuel Dupoux |
| 2022 | ACL | Text-Free Prosody-Aware Generative Spoken Language Modeling. | Eugene Kharitonov, Ann Lee, Adam Polyak, Yossi Adi, Jade Copet, Kushal Lakhotia, Tu Anh Nguyen, Morgane Rivire, Abdelrahman Mohamed, Emmanuel Dupoux, Wei-Ning Hsu |
| 2022 | ACL | Direct Speech-to-Speech Translation With Discrete Units. | Ann Lee, Peng-Jen Chen, Changhan Wang, Jiatao Gu, Sravya Popuri, Xutai Ma, Adam Polyak, Yossi Adi, Qing He, Yun Tang, Juan Pino, Wei-Ning Hsu |
| 2022 | ACL | Unified Speech-Text Pre-training for Speech Translation and Recognition. | Yun Tang, Hongyu Gong, Ning Dong, Changhan Wang, Wei-Ning Hsu, Jiatao Gu, Alexei Baevski, Xian Li, Abdelrahman Mohamed, Michael Auli, Juan Miguel Pino |
| 2022 | EMNLP | Textless Speech Emotion Conversion using Discrete & Decomposed Representations. | Felix Kreuk, Adam Polyak, Jade Copet, Eugene Kharitonov, Tu Anh Nguyen, Morgane Rivire, Wei-Ning Hsu, Abdelrahman Mohamed, Emmanuel Dupoux, Yossi Adi |
| 2022 | ICLR | Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction. | Bowen Shi, Wei-Ning Hsu, Kushal Lakhotia, Abdelrahman Mohamed |
| 2022 | ICML | data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language. | Alexei Baevski, Wei-Ning Hsu, Qiantong Xu, Arun Babu, Jiatao Gu, Michael Auli |
| 2022 | Interspeech | Simple and Effective Unsupervised Speech Synthesis. | Alexander H. Liu, Cheng-I Lai, Wei-Ning Hsu, Michael Auli, Alexei Baevski, James R. Glass |
| 2022 | Interspeech | Enhanced Direct Speech-to-Speech Translation Using Self-supervised Pre-training and Data Augmentation. | Sravya Popuri, Peng-Jen Chen, Changhan Wang, Juan Pino, Yossi Adi, Jiatao Gu, Wei-Ning Hsu, Ann Lee |
| 2022 | Interspeech | Robust Self-Supervised Audio-Visual Speech Recognition. | Bowen Shi, Wei-Ning Hsu, Abdelrahman Mohamed |
| 2022 | Interspeech | Learning Lip-Based Audio-Visual Speaker Embeddings with AV-HuBERT. | Bowen Shi, Abdelrahman Mohamed, Wei-Ning Hsu |
| 2022 | Interspeech | On-demand compute reduction with stochastic wav2vec 2.0. | Apoorv Vyas, Wei-Ning Hsu, Michael Auli, Alexei Baevski |
| 2022 | NAACL | Textless Speech-to-Speech Translation on Real Data. | Ann Lee, Hongyu Gong, Paul-Ambroise Duquenne, Holger Schwenk, Peng-Jen Chen, Changhan Wang, Sravya Popuri, Yossi Adi, Juan Miguel Pino, Jiatao Gu, Wei-Ning Hsu |
| 2021 | ACL | Text-Free Image-to-Speech Synthesis Using Learned Segmental Units. | Wei-Ning Hsu, David Harwath, Tyler Miller, Christopher Song, James R. Glass |
| 2021 | ASRU | Kaizen: Continuously Improving Teacher Using Exponential Moving Average for Semi-Supervised Speech Recognition. | Vimal Manohar, Tatiana Likhomanenko, Qiantong Xu, Wei-Ning Hsu, Ronan Collobert, Yatharth Saraf, Geoffrey Zweig, Abdelrahman Mohamed |
| 2021 | EMNLP | fairseq S\^2: A Scalable and Integrable Speech Synthesis Toolkit. | Changhan Wang, Wei-Ning Hsu, Yossi Adi, Adam Polyak, Ann Lee, Peng-Jen Chen, Jiatao Gu, Juan Pino |
| 2021 | ICASSP | Hubert: How Much Can a Bad Teacher Benefit ASR Pre-Training? | Wei-Ning Hsu, Yao-Hung Hubert Tsai, Benjamin Bolte, Ruslan Salakhutdinov, Abdelrahman Mohamed |
| 2021 | Interspeech | Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training. | Wei-Ning Hsu, Anuroop Sriram, Alexei Baevski, Tatiana Likhomanenko, Qiantong Xu, Vineel Pratap, Jacob Kahn, Ann Lee, Ronan Collobert, Gabriel Synnaeve, Michael Auli |
| 2021 | Interspeech | Speech Resynthesis from Discrete Disentangled Self-Supervised Representations. | Adam Polyak, Yossi Adi, Jade Copet, Eugene Kharitonov, Kushal Lakhotia, Wei-Ning Hsu, Abdelrahman Mohamed, Emmanuel Dupoux |
| 2020 | ICLR | Learning Hierarchical Discrete Linguistic Units from Visually-Grounded Speech. | David Harwath, Wei-Ning Hsu, James R. Glass |
| 2020 | Interspeech | Unsupervised Methods for Evaluating Speech Representations. | Michael Gump, Wei-Ning Hsu, James R. Glass |
| 2020 | Interspeech | A Convolutional Deep Markov Model for Unsupervised Speech Representation Learning. | Sameer Khurana, Antoine Laurent, Wei-Ning Hsu, Jan Chorowski, Adrian Lancucki, Ricard Marxer, James R. Glass |
| 2019 | ICASSP | Semi-supervised Training for Improving Data Efficiency in End-to-end Speech Synthesis. | Yu-An Chung, Yuxuan Wang, Wei-Ning Hsu, Yu Zhang, R. J. Skerry-Ryan |
| 2019 | ICASSP | Disentangling Correlated Speaker and Noise for Speech Synthesis via Data Augmentation and Adversarial Factorization. | Wei-Ning Hsu, Yu Zhang, Ron J. Weiss, Yu-An Chung, Yuxuan Wang, Yonghui Wu, James R. Glass |
| 2019 | ICLR | Hierarchical Generative Modeling for Controllable Speech Synthesis. | Wei-Ning Hsu, Yu Zhang, Ron J. Weiss, Heiga Zen, Yonghui Wu, Yuxuan Wang, Yuan Cao, Ye Jia, Zhifeng Chen, Jonathan Shen, Patrick Nguyen, Ruoming Pang |
| 2019 | Interspeech | An Unsupervised Autoregressive Model for Speech Representation Learning. | Yu-An Chung, Wei-Ning Hsu, Hao Tang, James R. Glass |
| 2019 | Interspeech | Transfer Learning from Audio-Visual Grounding to Speech Recognition. | Wei-Ning Hsu, David Harwath, James R. Glass |
| 2018 | ICASSP | Extracting Domain Invariant Features by Unsupervised Learning for Robust Automatic Speech Recognition. | Wei-Ning Hsu, James R. Glass |
| 2018 | ICPR | A Noise-Robust Self-Adaptive Multitarget Speaker Detection System. | Siqi Zheng, Jianzong Wang, Jing Xiao, Wei-Ning Hsu, James R. Glass |
| 2018 | Interspeech | Scalable Factorized Hierarchical Variational Autoencoder Training. | Wei-Ning Hsu, James R. Glass |
| 2018 | Interspeech | Unsupervised Adaptation with Interpretable Disentangled Representations for Distant Conversational Speech Recognition. | Wei-Ning Hsu, Hao Tang, James R. Glass |
| 2018 | Interspeech | A Study of Enhancement, Augmentation and Autoencoder Methods for Domain Adaptation in Distant Speech Recognition. | Hao Tang, Wei-Ning Hsu, Franois Grondin, James R. Glass |
| 2017 | ASRU | Unsupervised domain adaptation for robust speech recognition via variational autoencoder-based data augmentation. | Wei-Ning Hsu, Yu Zhang, James R. Glass |
| 2017 | ASRU | Automatic speech recognition of Arabic multi-genre broadcast media. | Maryam Najafian, Wei-Ning Hsu, Ahmed Ali, James R. Glass |
| 2017 | Interspeech | Learning Latent Representations for Speech Generation and Transformation. | Wei-Ning Hsu, Yu Zhang, James R. Glass |
| 2016 | COLING | Neural Attention for Learning to Rank Questions in Community Question Answering. | Salvatore Romeo, Giovanni Da San Martino, Alberto Barrn-Cedeo, Alessandro Moschitti, Yonatan Belinkov, Wei-Ning Hsu, Yu Zhang, Mitra Mohtarami, James R. Glass |
| 2016 | Interspeech | Exploiting Depth and Highway Connections in Convolutional Recurrent Deep Neural Networks for Speech Recognition. | Wei-Ning Hsu, Yu Zhang, Ann Lee, James R. Glass |
| 2015 | AAAI | Active Learning by Learning. | Wei-Ning Hsu, Hsuan-Tien Lin |
| 2015 | ICASSP | Enhancing automatically discovered multi-level acoustic patterns considering context consistency with applications in spoken term detection. | Cheng-Tao Chung, Wei-Ning Hsu, Cheng-Yi Lee, Lin-Shan Lee |