Xuankai Chang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
51
Venues
7
Active years
2016–2024
Best venue rank
A*
Where they publish
Papers
51 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2024 | AAAI | AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head. | Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe |
| 2024 | ACL | Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners. | Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu |
| 2024 | EMNLP | Towards Robust Speech Representation Learning for Thousands of Languages. | William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe |
| 2024 | ICASSP | Exploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study. | Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang |
| 2024 | ICASSP | Hubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model. | Takashi Maekaku, Jiatong Shi, Xuankai Chang, Yuya Fujita, Shinji Watanabe |
| 2024 | ICASSP | VoxtLM: Unified Decoder-Only Models for Consolidating Speech Recognition, Synthesis and Speech, Text Continuation Tasks. | Soumi Maiti, Yifan Peng, Shukjae Choi, Jee-Weon Jung, Xuankai Chang, Shinji Watanabe |
| 2024 | ICASSP | Improving Audio Captioning Models with Fine-Grained Audio Features, Text Embedding Supervision, and LLM Mix-Up Augmentation. | Shih-Lun Wu, Xuankai Chang, Gordon Wichern, Jee-Weon Jung, Franois G. Germain, Jonathan Le Roux, Shinji Watanabe |
| 2024 | ICASSP | Cross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing. | Brian Yan, Xuankai Chang, Antonios Anastasopoulos, Yuya Fujita, Shinji Watanabe |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | Interspeech | The Interspeech 2024 Challenge on Speech Processing Using Discrete Units. | Xuankai Chang, Jiatong Shi, Jinchuan Tian, Yuning Wu, Yuxun Tang, Yihan Wu, Shinji Watanabe, Yossi Adi, Xie Chen, Qin Jin |
| 2024 | Interspeech | OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer. | Yifan Peng, Jinchuan Tian, William Chen, Siddhant Arora, Brian Yan, Yui Sudo, Muhammad Shakeel, Kwanghee Choi, Jiatong Shi, Xuankai Chang, Jee-weon Jung, Shinji Watanabe |
| 2024 | Interspeech | ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets. | Jiatong Shi, Shih-Heng Wang, William Chen, Martijn Bartelds, Vanya Bannihatti Kumar, Jinchuan Tian, Xuankai Chang, Dan Jurafsky, Karen Livescu, Hung-yi Lee, Shinji Watanabe |
| 2023 | ASRU | Joint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning. | William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | LV-CTC: Non-Autoregressive ASR With CTC and Latent Variable Models. | Yuya Fujita, Shinji Watanabe, Xuankai Chang, Takashi Maekaku |
| 2023 | ASRU | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | Findings of the 2023 ML-Superb Challenge: Pre-Training And Evaluation Over More Languages And Beyond. | Jiatong Shi, William Chen, Dan Berrebbi, Hsiu-Hsuan Wang, Wei-Ping Huang, En-Pei Hu, Ho-Lam Chuang, Xuankai Chang, Yuxun Tang, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Shinji Watanabe |
| 2023 | ICASSP | FindAdaptNet: Find and Insert Adapters by Learned Layer Importance. | Junwei Huang, Karthik Ganesan, Soumi Maiti, Young Min Kim, Xuankai Chang, Paul Liang, Shinji Watanabe |
| 2023 | ICASSP | Fully Unsupervised Topic Clustering of Unlabelled Spoken Audio Using Self-Supervised Representation Learning and Topic Model. | Takashi Maekaku, Yuya Fujita, Xuankai Chang, Shinji Watanabe |
| 2023 | Interspeech | Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning. | Xuankai Chang, Brian Yan, Yuya Fujita, Takashi Maekaku, Shinji Watanabe |
| 2023 | Interspeech | Reducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute. | William Chen, Xuankai Chang, Yifan Peng, Zhaoheng Ni, Soumi Maiti, Shinji Watanabe |
| 2023 | Interspeech | TokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript-Conditioned Speech Separation and Recognition. | Hakan Erdogan, Scott Wisdom, Xuankai Chang, Zaln Borsos, Marco Tagliasacchi, Neil Zeghidour, John R. Hershey |
| 2023 | Interspeech | ML-SUPERB: Multilingual Speech Universal PERformance Benchmark. | Jiatong Shi, Dan Berrebbi, William Chen, En-Pei Hu, Wei-Ping Huang, Ho-Lam Chung, Xuankai Chang, Shang-Wen Li, Abdelrahman Mohamed, Hung-yi Lee, Shinji Watanabe |
| 2023 | Interspeech | A New Benchmark of Aphasia Speech Recognition and Detection Based on E-Branchformer and Multi-task Learning. | Jiyang Tang, William Chen, Xuankai Chang, Shinji Watanabe, Brian MacWhinney |
| 2022 | ACL | SUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities. | Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang, Zili Huang, Kushal Lakhotia, Shu-Wen Yang, Shuyan Dong, Andy T. Liu, Cheng-I Lai, Jiatong Shi, Xuankai Chang, Phil Hall, Hsuan-Jui Chen, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee |
| 2022 | ICASSP | ESPnet-SLU: Advancing Spoken Language Understanding Through ESPnet. | Siddhant Arora, Siddharth Dalmia, Pavel Denisov, Xuankai Chang, Yushi Ueda, Yifan Peng, Yuekai Zhang, Sujay Kumar, Karthik Ganesan, Brian Yan, Ngoc Thang Vu, Alan W. Black, Shinji Watanabe |
| 2022 | ICASSP | Extended Graph Temporal Classification for Multi-Speaker End-to-End ASR. | Xuankai Chang, Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux |
| 2022 | ICASSP | Towards Low-Distortion Multi-Channel Speech Enhancement: The ESPNET-Se Submission to the L3DAS22 Challenge. | Yen-Ju Lu, Samuele Cornell, Xuankai Chang, Wangyou Zhang, Chenda Li, Zhaoheng Ni, Zhong-Qiu Wang, Shinji Watanabe |
| 2022 | ICASSP | An Exploration of Hubert with Large Number of Cluster Units and Model Assessment Using Bayesian Information Criterion. | Takashi Maekaku, Xuankai Chang, Yuya Fujita, Shinji Watanabe |
| 2022 | ICASSP | Joint Speech Recognition and Audio Captioning. | Chaitanya Narisetty, Emiru Tsunoo, Xuankai Chang, Yosuke Kashiwagi, Michael Hentschel, Shinji Watanabe |
| 2022 | Interspeech | Two-Pass Low Latency End-to-End Spoken Language Understanding. | Siddhant Arora, Siddharth Dalmia, Xuankai Chang, Brian Yan, Alan W. Black, Shinji Watanabe |
| 2022 | Interspeech | End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation. | Xuankai Chang, Takashi Maekaku, Yuya Fujita, Shinji Watanabe |
| 2022 | Interspeech | ESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding. | Yen-Ju Lu, Xuankai Chang, Chenda Li, Wangyou Zhang, Samuele Cornell, Zhaoheng Ni, Yoshiki Masuyama, Brian Yan, Robin Scheibler, Zhong-Qiu Wang, Yu Tsao, Yanmin Qian, Shinji Watanabe |
| 2022 | Interspeech | Muskits: an End-to-end Music Processing Toolkit for Singing Voice Synthesis. | Jiatong Shi, Shuai Guo, Tao Qian, Tomoki Hayashi, Yuning Wu, Fangzheng Xu, Xuankai Chang, Huazhe Li, Peter Wu, Shinji Watanabe, Qin Jin |
| 2021 | ASRU | An Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition. | Xuankai Chang, Takashi Maekaku, Pengcheng Guo, Jing Shi, Yen-Ju Lu, Aswin Shanmugam Subramanian, Tianzi Wang, Shu-Wen Yang, Yu Tsao, Hung-yi Lee, Shinji Watanabe |
| 2021 | ICASSP | Hypothesis Stitcher for End-to-End Speaker-Attributed ASR on Long-Form Multi-Talker Recordings. | Xuankai Chang, Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka |
| 2021 | ICASSP | Recent Developments on Espnet Toolkit Boosted By Conformer. | Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang |
| 2021 | Interspeech | Multi-Speaker ASR Combining Non-Autoregressive Conformer CTC and Conditional Speaker Chain. | Pengcheng Guo, Xuankai Chang, Shinji Watanabe, Lei Xie |
| 2021 | Interspeech | Speech Representation Learning Combining Conformer CPC with Deep Cluster for the ZeroSpeech Challenge 2021. | Takashi Maekaku, Xuankai Chang, Yuya Fujita, Li-Wei Chen, Shinji Watanabe, Alexander I. Rudnicky |
| 2021 | Interspeech | Streaming End-to-End ASR Based on Blockwise Non-Autoregressive Models. | Tianzi Wang, Yuya Fujita, Xuankai Chang, Shinji Watanabe |
| 2021 | Interspeech | SUPERB: Speech Processing Universal PERformance Benchmark. | Shu-Wen Yang, Po-Han Chi, Yung-Sung Chuang, Cheng-I Jeff Lai, Kushal Lakhotia, Yist Y. Lin, Andy T. Liu, Jiatong Shi, Xuankai Chang, Guan-Ting Lin, Tzu-Hsien Huang, Wei-Cheng Tseng, Ko-tik Lee, Da-Rong Liu, Zili Huang, Shuyan Dong, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee |
| 2020 | ICASSP | End-To-End Multi-Speaker Speech Recognition With Transformer. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2020 | Interspeech | End-to-End ASR with Adaptive Span Self-Attention. | Xuankai Chang, Aswin Shanmugam Subramanian, Pengcheng Guo, Shinji Watanabe, Yuya Fujita, Motoi Omachi |
| 2020 | Interspeech | Insertion-Based Modeling for End-to-End Automatic Speech Recognition. | Yuya Fujita, Shinji Watanabe, Motoi Omachi, Xuankai Chang |
| 2020 | Interspeech | End-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming. | Wangyou Zhang, Aswin Shanmugam Subramanian, Xuankai Chang, Shinji Watanabe, Yanmin Qian |
| 2019 | ASRU | MIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition. | Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe |
| 2019 | ICASSP | End-to-end Monaural Multi-speaker ASR System without Pretraining. | Xuankai Chang, Yanmin Qian, Kai Yu, Shinji Watanabe |
| 2019 | Interspeech | Knowledge Distillation for End-to-End Monaural Multi-Talker ASR System. | Wangyou Zhang, Xuankai Chang, Yanmin Qian |
| 2018 | ICASSP | Adaptive Permutation Invariant Training with Auxiliary Information for Monaural Multi-Talker Speech Recognition. | Xuankai Chang, Yanmin Qian, Dong Yu |
| 2018 | Interspeech | Monaural Multi-Talker Speech Recognition with Attention Mechanism and Gated Convolutional Networks. | Xuankai Chang, Yanmin Qian, Dong Yu |
| 2017 | Interspeech | Recognizing Multi-Talker Speech with Permutation Invariant Training. | Dong Yu, Xuankai Chang, Yanmin Qian |
| 2016 | Interspeech | Unrestricted Vocabulary Keyword Spotting Using LSTM-CTC. | Yimeng Zhuang, Xuankai Chang, Yanmin Qian, Kai Yu |