Skip to content

Xuankai Chang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

51

Venues

7

Active years

2016–2024

Best venue rank

A*

Where they publish

Papers

51 indexed papers, newest first.

YearVenueTitleAuthors
2024AAAIAudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head.Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe
2024ACLMake-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners.Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu
2024EMNLPTowards Robust Speech Representation Learning for Thousands of Languages.William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe
2024ICASSPExploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study.Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang
2024ICASSPHubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model.Takashi Maekaku, Jiatong Shi, Xuankai Chang, Yuya Fujita, Shinji Watanabe
2024ICASSPVoxtLM: Unified Decoder-Only Models for Consolidating Speech Recognition, Synthesis and Speech, Text Continuation Tasks.Soumi Maiti, Yifan Peng, Shukjae Choi, Jee-Weon Jung, Xuankai Chang, Shinji Watanabe
2024ICASSPImproving Audio Captioning Models with Fine-Grained Audio Features, Text Embedding Supervision, and LLM Mix-Up Augmentation.Shih-Lun Wu, Xuankai Chang, Gordon Wichern, Jee-Weon Jung, Franois G. Germain, Jonathan Le Roux, Shinji Watanabe
2024ICASSPCross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing.Brian Yan, Xuankai Chang, Antonios Anastasopoulos, Yuya Fujita, Shinji Watanabe
2024ICMLUniAudio: Towards Universal Audio Generation with Large Language Models.Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng
2024InterspeechThe Interspeech 2024 Challenge on Speech Processing Using Discrete Units.Xuankai Chang, Jiatong Shi, Jinchuan Tian, Yuning Wu, Yuxun Tang, Yihan Wu, Shinji Watanabe, Yossi Adi, Xie Chen, Qin Jin
2024InterspeechOWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer.Yifan Peng, Jinchuan Tian, William Chen, Siddhant Arora, Brian Yan, Yui Sudo, Muhammad Shakeel, Kwanghee Choi, Jiatong Shi, Xuankai Chang, Jee-weon Jung, Shinji Watanabe
2024InterspeechML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets.Jiatong Shi, Shih-Heng Wang, William Chen, Martijn Bartelds, Vanya Bannihatti Kumar, Jinchuan Tian, Xuankai Chang, Dan Jurafsky, Karen Livescu, Hung-yi Lee, Shinji Watanabe
2023ASRUJoint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning.William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe
2023ASRULV-CTC: Non-Autoregressive ASR With CTC and Latent Variable Models.Yuya Fujita, Shinji Watanabe, Xuankai Chang, Takashi Maekaku
2023ASRUReproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data.Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe
2023ASRUFindings of the 2023 ML-Superb Challenge: Pre-Training And Evaluation Over More Languages And Beyond.Jiatong Shi, William Chen, Dan Berrebbi, Hsiu-Hsuan Wang, Wei-Ping Huang, En-Pei Hu, Ho-Lam Chuang, Xuankai Chang, Yuxun Tang, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Shinji Watanabe
2023ICASSPFindAdaptNet: Find and Insert Adapters by Learned Layer Importance.Junwei Huang, Karthik Ganesan, Soumi Maiti, Young Min Kim, Xuankai Chang, Paul Liang, Shinji Watanabe
2023ICASSPFully Unsupervised Topic Clustering of Unlabelled Spoken Audio Using Self-Supervised Representation Learning and Topic Model.Takashi Maekaku, Yuya Fujita, Xuankai Chang, Shinji Watanabe
2023InterspeechExploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning.Xuankai Chang, Brian Yan, Yuya Fujita, Takashi Maekaku, Shinji Watanabe
2023InterspeechReducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute.William Chen, Xuankai Chang, Yifan Peng, Zhaoheng Ni, Soumi Maiti, Shinji Watanabe
2023InterspeechTokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript-Conditioned Speech Separation and Recognition.Hakan Erdogan, Scott Wisdom, Xuankai Chang, Zaln Borsos, Marco Tagliasacchi, Neil Zeghidour, John R. Hershey
2023InterspeechML-SUPERB: Multilingual Speech Universal PERformance Benchmark.Jiatong Shi, Dan Berrebbi, William Chen, En-Pei Hu, Wei-Ping Huang, Ho-Lam Chung, Xuankai Chang, Shang-Wen Li, Abdelrahman Mohamed, Hung-yi Lee, Shinji Watanabe
2023InterspeechA New Benchmark of Aphasia Speech Recognition and Detection Based on E-Branchformer and Multi-task Learning.Jiyang Tang, William Chen, Xuankai Chang, Shinji Watanabe, Brian MacWhinney
2022ACLSUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities.Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang, Zili Huang, Kushal Lakhotia, Shu-Wen Yang, Shuyan Dong, Andy T. Liu, Cheng-I Lai, Jiatong Shi, Xuankai Chang, Phil Hall, Hsuan-Jui Chen, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee
2022ICASSPESPnet-SLU: Advancing Spoken Language Understanding Through ESPnet.Siddhant Arora, Siddharth Dalmia, Pavel Denisov, Xuankai Chang, Yushi Ueda, Yifan Peng, Yuekai Zhang, Sujay Kumar, Karthik Ganesan, Brian Yan, Ngoc Thang Vu, Alan W. Black, Shinji Watanabe
2022ICASSPExtended Graph Temporal Classification for Multi-Speaker End-to-End ASR.Xuankai Chang, Niko Moritz, Takaaki Hori, Shinji Watanabe, Jonathan Le Roux
2022ICASSPTowards Low-Distortion Multi-Channel Speech Enhancement: The ESPNET-Se Submission to the L3DAS22 Challenge.Yen-Ju Lu, Samuele Cornell, Xuankai Chang, Wangyou Zhang, Chenda Li, Zhaoheng Ni, Zhong-Qiu Wang, Shinji Watanabe
2022ICASSPAn Exploration of Hubert with Large Number of Cluster Units and Model Assessment Using Bayesian Information Criterion.Takashi Maekaku, Xuankai Chang, Yuya Fujita, Shinji Watanabe
2022ICASSPJoint Speech Recognition and Audio Captioning.Chaitanya Narisetty, Emiru Tsunoo, Xuankai Chang, Yosuke Kashiwagi, Michael Hentschel, Shinji Watanabe
2022InterspeechTwo-Pass Low Latency End-to-End Spoken Language Understanding.Siddhant Arora, Siddharth Dalmia, Xuankai Chang, Brian Yan, Alan W. Black, Shinji Watanabe
2022InterspeechEnd-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation.Xuankai Chang, Takashi Maekaku, Yuya Fujita, Shinji Watanabe
2022InterspeechESPnet-SE++: Speech Enhancement for Robust Speech Recognition, Translation, and Understanding.Yen-Ju Lu, Xuankai Chang, Chenda Li, Wangyou Zhang, Samuele Cornell, Zhaoheng Ni, Yoshiki Masuyama, Brian Yan, Robin Scheibler, Zhong-Qiu Wang, Yu Tsao, Yanmin Qian, Shinji Watanabe
2022InterspeechMuskits: an End-to-end Music Processing Toolkit for Singing Voice Synthesis.Jiatong Shi, Shuai Guo, Tao Qian, Tomoki Hayashi, Yuning Wu, Fangzheng Xu, Xuankai Chang, Huazhe Li, Peter Wu, Shinji Watanabe, Qin Jin
2021ASRUAn Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition.Xuankai Chang, Takashi Maekaku, Pengcheng Guo, Jing Shi, Yen-Ju Lu, Aswin Shanmugam Subramanian, Tianzi Wang, Shu-Wen Yang, Yu Tsao, Hung-yi Lee, Shinji Watanabe
2021ICASSPHypothesis Stitcher for End-to-End Speaker-Attributed ASR on Long-Form Multi-Talker Recordings.Xuankai Chang, Naoyuki Kanda, Yashesh Gaur, Xiaofei Wang, Zhong Meng, Takuya Yoshioka
2021ICASSPRecent Developments on Espnet Toolkit Boosted By Conformer.Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang
2021InterspeechMulti-Speaker ASR Combining Non-Autoregressive Conformer CTC and Conditional Speaker Chain.Pengcheng Guo, Xuankai Chang, Shinji Watanabe, Lei Xie
2021InterspeechSpeech Representation Learning Combining Conformer CPC with Deep Cluster for the ZeroSpeech Challenge 2021.Takashi Maekaku, Xuankai Chang, Yuya Fujita, Li-Wei Chen, Shinji Watanabe, Alexander I. Rudnicky
2021InterspeechStreaming End-to-End ASR Based on Blockwise Non-Autoregressive Models.Tianzi Wang, Yuya Fujita, Xuankai Chang, Shinji Watanabe
2021InterspeechSUPERB: Speech Processing Universal PERformance Benchmark.Shu-Wen Yang, Po-Han Chi, Yung-Sung Chuang, Cheng-I Jeff Lai, Kushal Lakhotia, Yist Y. Lin, Andy T. Liu, Jiatong Shi, Xuankai Chang, Guan-Ting Lin, Tzu-Hsien Huang, Wei-Cheng Tseng, Ko-tik Lee, Da-Rong Liu, Zili Huang, Shuyan Dong, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee
2020ICASSPEnd-To-End Multi-Speaker Speech Recognition With Transformer.Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe
2020InterspeechEnd-to-End ASR with Adaptive Span Self-Attention.Xuankai Chang, Aswin Shanmugam Subramanian, Pengcheng Guo, Shinji Watanabe, Yuya Fujita, Motoi Omachi
2020InterspeechInsertion-Based Modeling for End-to-End Automatic Speech Recognition.Yuya Fujita, Shinji Watanabe, Motoi Omachi, Xuankai Chang
2020InterspeechEnd-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming.Wangyou Zhang, Aswin Shanmugam Subramanian, Xuankai Chang, Shinji Watanabe, Yanmin Qian
2019ASRUMIMO-Speech: End-to-End Multi-Channel Multi-Speaker Speech Recognition.Xuankai Chang, Wangyou Zhang, Yanmin Qian, Jonathan Le Roux, Shinji Watanabe
2019ICASSPEnd-to-end Monaural Multi-speaker ASR System without Pretraining.Xuankai Chang, Yanmin Qian, Kai Yu, Shinji Watanabe
2019InterspeechKnowledge Distillation for End-to-End Monaural Multi-Talker ASR System.Wangyou Zhang, Xuankai Chang, Yanmin Qian
2018ICASSPAdaptive Permutation Invariant Training with Auxiliary Information for Monaural Multi-Talker Speech Recognition.Xuankai Chang, Yanmin Qian, Dong Yu
2018InterspeechMonaural Multi-Talker Speech Recognition with Attention Mechanism and Gated Convolutional Networks.Xuankai Chang, Yanmin Qian, Dong Yu
2017InterspeechRecognizing Multi-Talker Speech with Permutation Invariant Training.Dong Yu, Xuankai Chang, Yanmin Qian
2016InterspeechUnrestricted Vocabulary Keyword Spotting Using LSTM-CTC.Yimeng Zhuang, Xuankai Chang, Yanmin Qian, Kai Yu