Skip to content

Jiatong Shi

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

74

Venues

12

Active years

2020–2026

Best venue rank

A*

Where they publish

Papers

74 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLOptimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback.Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2026ACLFull-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner.Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-Yi Lee
2026EACLBSCodec: A Band-Split Neural Codec for High-Quality Universal Audio Reconstruction.Haoran Wang, Jiatong Shi, Jinchuan Tian, Bohan Li, Kai Yu, Shinji Watanabe
2025ASRUVERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration.Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe
2025ASRUPURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning.Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe
2025ASRUContinual Pre-training for Codec-Based Speech LLMs: Balancing Understanding and Generation.Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu
2025ASRURobust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty.Yiwen Zhao, Jiatong Shi, Yuxun Tang, William Chen, Shinji Watanabe
2025ICASSPPreference Alignment Improves Language Model-Based TTS.Jinchuan Tian, Chunlei Zhang, Jiatong Shi, Hao Zhang, Jianwei Yu, Shinji Watanabe, Dong Yu
2025ICLRDynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks.Chien-yu Huang, Wei-Chih Chen, Shu-Wen Yang, Andy T. Liu, Chen-An Li, Yu-Xiang Lin, Wei-Cheng Tseng, Anuj Diwan, Yi-Jen Shih, Jiatong Shi, William Chen, Chih-Kai Yang, Xuanjun Chen, Chi-Yuan Hsiao, Puyuan Peng, Shih-Heng Wang, Chun-Yi Kuan, Ke-Han Lu, Kai-Wei Chang, Fabian Alejandro Ritter Gutierrez, et al.
2025InterspeechChain-of-Thought Training for Open E2E Spoken Dialogue Systems.Siddhant Arora, Jinchuan Tian, Hayato Futami, Jee-weon Jung, Jiatong Shi, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe
2025InterspeechMIKU-PAL: An Automated and Standardized Multimodal Method for Speech Paralinguistic and Affect Labeling.Yifan Cheng, Ruoyi Zhang, Jiatong Shi
2025InterspeechThe ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties.William Chen, Chutong Meng, Jiatong Shi, Martijn Bartelds, Shih-Heng Wang, Hsiu-Hsuan Wang, Rafael Mosquera, Sara Hincapie, Dan Jurafsky, Antonis Anastasopoulos, Hung-yi Lee, Karen Livescu, Shinji Watanabe
2025InterspeechBridging Speech and Singing: Multi-stage Speech-Prompted Singing Voice Conversion with Speaker Embedding Adaptation.Mingda Liu, Jiatong Shi
2025InterspeechScalable Spontaneous Speech Dataset (SSSD): Crowdsourcing Data Collection to Promote Dialogue Research.Zaid Sheikh, Shuichiro Shimizu, Siddhant Arora, Jiatong Shi, Samuele Cornell, Xinjian Li, Shinji Watanabe
2025InterspeechUni-VERSA: Versatile Speech Assessment with a Unified Network.Jiatong Shi, Hye-jin Shim, Shinji Watanabe
2025InterspeechOpusLM: A Family of Open Unified Speech Language Models.Jinchuan Tian, William Chen, Yifan Peng, Jiatong Shi, Siddhant Arora, Shikhar Bharadwaj, Takashi Maekaku, Yusuke Shinohara, Keita Goto, Xiang Yue, Huck Yang, Shinji Watanabe
2025KDDFoodPuzzle: Toward Developing Large Language Model Agents as Autonomous Flavor Scientists.Tenghao Huang, Dong Hee Lee, John Sweeney, Jiatong Shi, Emily Steliotes, Matthew Lange, Jonathan May, Muhao Chen
2025NAACLESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems.Siddhant Arora, Yifan Peng, Jiatong Shi, Jinchuan Tian, William Chen, Shikhar Bharadwaj, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shuichiro Shimizu, Vaibhav Srivastav, Shinji Watanabe
2025NAACLVERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music.Jiatong Shi, Hye-jin Shim, Jinchuan Tian, Siddhant Arora, Haibin Wu, Darius Petermann, Jia Qi Yip, You Zhang, Yuxun Tang, Wangyou Zhang, Dareen Alharthi, Yichen Huang, Koichi Saito, Jionghao Han, Yiwen Zhao, Chris Donahue, Shinji Watanabe
2025NAACLESPnet-SpeechLM: An Open Speech Language Model Toolkit.Jinchuan Tian, Jiatong Shi, William Chen, Siddhant Arora, Yoshiki Masuyama, Takashi Maekaku, Yihan Wu, Junyi Peng, Shikhar Bharadwaj, Yiwen Zhao, Samuele Cornell, Yifan Peng, Xiang Yue, Chao-Han Huck Yang, Graham Neubig, Shinji Watanabe
2024AAAIAudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head.Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe
2024ACLWav2Gloss: Generating Interlinear Glossed Text from Speech.Taiqi He, Kwanghee Choi, Lindia Tjuatja, Nathaniel R. Robinson, Jiatong Shi, Shinji Watanabe, Graham Neubig, David R. Mortensen, Lori S. Levin
2024ACLMake-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners.Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu
2024EMNLPTowards Robust Speech Representation Learning for Thousands of Languages.William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe
2024HealthComExploiting Longitudinal Speech Sessions via Voice Assistant Systems for Early Detection of Cognitive Decline.Kristin Qi, Jiatong Shi, Caroline Summerour, John A. Batsis, Xiaohui Liang
2024ICASSPExploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study.Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang
2024ICASSPDynamic-Superb: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark For Speech.Chien-Yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao, Chun-Yi Kuan, Haibin Wu, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan S. Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-Yi Lee
2024ICASSPHubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model.Takashi Maekaku, Jiatong Shi, Xuankai Chang, Yuya Fujita, Shinji Watanabe
2024ICLRMulti-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction.Jiatong Shi, Hirofumi Inaguma, Xutai Ma, Ilia Kulikov, Anna Y. Sun
2024ICMLUniAudio: Towards Universal Audio Generation with Large Language Models.Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng
2024InterspeechSelf-supervised Speech Representations Still Struggle with African American Vernacular English.Kalvin Chang, Yi-Hui Chou, Jiatong Shi, Hsuan-Ming Chen, Nicole Holliday, Odette Scharenborg, David R. Mortensen
2024InterspeechThe Interspeech 2024 Challenge on Speech Processing Using Discrete Units.Xuankai Chang, Jiatong Shi, Jinchuan Tian, Yuning Wu, Yuxun Tang, Yihan Wu, Shinji Watanabe, Yossi Adi, Xie Chen, Qin Jin
2024InterspeechESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models.Jee-weon Jung, Wangyou Zhang, Jiatong Shi, Zakaria Aldeneh, Takuya Higuchi, Alex Gichamba, Barry-John Theobald, Ahmed Hussen Abdelaziz, Shinji Watanabe
2024InterspeechPL-TTS: A Generalizable Prompt-based Diffusion TTS Augmented by Large Language Model.Shuhua Li, Qirong Mao, Jiatong Shi
2024InterspeechOWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer.Yifan Peng, Jinchuan Tian, William Chen, Siddhant Arora, Brian Yan, Yui Sudo, Muhammad Shakeel, Kwanghee Choi, Jiatong Shi, Xuankai Chang, Jee-weon Jung, Shinji Watanabe
2024InterspeechSinging Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing.Jiatong Shi, Yueqian Lin, Xinyi Bai, Keyi Zhang, Yuning Wu, Yuxun Tang, Yifeng Yu, Qin Jin, Shinji Watanabe
2024InterspeechMMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model.Jiatong Shi, Xutai Ma, Hirofumi Inaguma, Anna Sun, Shinji Watanabe
2024InterspeechML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets.Jiatong Shi, Shih-Heng Wang, William Chen, Martijn Bartelds, Vanya Bannihatti Kumar, Jinchuan Tian, Xuankai Chang, Dan Jurafsky, Karen Livescu, Hung-yi Lee, Shinji Watanabe
2024InterspeechEFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios.Tejes Srivastava, Jiatong Shi, William Chen, Shinji Watanabe
2024InterspeechSingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models.Yuxun Tang, Yuning Wu, Jiatong Shi, Qin Jin
2024InterspeechTokSing: Singing Voice Synthesis based on Discrete Tokens.Yuning Wu, Chunlei Zhang, Jiatong Shi, Yuxun Tang, Shan Yang, Qin Jin
2024InterspeechCtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection.Yongyi Zang, Jiatong Shi, You Zhang, Ryuichi Yamamoto, Jionghao Han, Yuxun Tang, Shengyuan Xu, Wenxiao Zhao, Jing Guo, Tomoki Toda, Zhiyao Duan
2023ACLUniLG: A Unified Structure-aware Framework for Lyrics Generation.Tao Qian, Fan Lou, Jiatong Shi, Yuning Wu, Shuai Guo, Xiang Yin, Qin Jin
2023ACLESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit.Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe
2023ASRUJoint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning.William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe
2023ASRUEvaluating Self-Supervised Speech Models on a Taiwanese Hokkien Corpus.Yi-Hui Chou, Kalvin Chang, Meng-Ju Wu, Winston Ou, Alice Wen-Hsin Bi, Carol Yang, Bryan Y. Chen, Rong-Wei Pai, Po-Yen Yeh, Jo-Peng Chiang, Iu-Tshian Phoann, Winnie Chang, Chenxuan Cui, Noel Chen, Jiatong Shi
2023ASRUThe Singing Voice Conversion Challenge 2023.Wen-Chin Huang, Lester Phillip Violeta, Songxiang Liu, Jiatong Shi, Tomoki Toda
2023ASRUReproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data.Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe
2023ASRUFindings of the 2023 ML-Superb Challenge: Pre-Training And Evaluation Over More Languages And Beyond.Jiatong Shi, William Chen, Dan Berrebbi, Hsiu-Hsuan Wang, Wei-Ping Huang, En-Pei Hu, Ho-Lam Chuang, Xuankai Chang, Yuxun Tang, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Shinji Watanabe
2023ICASSPImproving Massively Multilingual ASR with Auxiliary CTC Objectives.William Chen, Brian Yan, Jiatong Shi, Yifan Peng, Soumi Maiti, Shinji Watanabe
2023ICASSPEuro: Espnet Unsupervised ASR Open-Source Toolkit.Dongji Gao, Jiatong Shi, Shun-Po Chuang, Leibny Paola Garca, Hung-Yi Lee, Shinji Watanabe, Sanjeev Khudanpur
2023ICASSPBridging Speech and Textual Pre-Trained Models With Unsupervised ASR.Jiatong Shi, Chan-Jan Hsu, Ho-Lam Chung, Dongji Gao, Paola Garca, Shinji Watanabe, Ann Lee, Hung-Yi Lee
2023ICASSPEnhancing Speech-To-Speech Translation with Multiple TTS Targets.Jiatong Shi, Yun Tang, Ann Lee, Hirofumi Inaguma, Changhan Wang, Juan Pino, Shinji Watanabe
2023ICASSPPhoneix: Acoustic Feature Processing Strategy for Enhanced Singing Pronunciation With Phoneme Distribution Predictor.Yuning Wu, Jiatong Shi, Tao Qian, Dongji Gao, Qin Jin
2023InterspeechExploration on HuBERT with Multiple Resolution.Jiatong Shi, Yun Tang, Hirofumi Inaguma, Hongyu Gong, Juan Pino, Shinji Watanabe
2023InterspeechML-SUPERB: Multilingual Speech Universal PERformance Benchmark.Jiatong Shi, Dan Berrebbi, William Chen, En-Pei Hu, Wei-Ping Huang, Ho-Lam Chung, Xuankai Chang, Shang-Wen Li, Abdelrahman Mohamed, Hung-yi Lee, Shinji Watanabe
2023Interspeech4D ASR: Joint modeling of CTC, Attention, Transducer, and Mask-Predict decoders.Yui Sudo, Muhammad Shakeel, Brian Yan, Jiatong Shi, Shinji Watanabe
2022ACLSUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities.Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang, Zili Huang, Kushal Lakhotia, Shu-Wen Yang, Shuyan Dong, Andy T. Liu, Cheng-I Lai, Jiatong Shi, Xuankai Chang, Phil Hall, Hsuan-Jui Chen, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee
2022ICASSPTraining Strategies for Automatic Song Writing: A Unified Framework Perspective.Tao Qian, Jiatong Shi, Shuai Guo, Peter Wu, Qin Jin
2022ICASSPTowards end-to-end Speaker Diarization with Generalized Neural Speaker Clustering.Chunlei Zhang, Jiatong Shi, Chao Weng, Meng Yu, Dong Yu
2022InterspeechCombining Spectral and Self-Supervised Features for Low Resource Speech Recognition and Translation.Dan Berrebbi, Jiatong Shi, Brian Yan, Osbel Lpez-Francisco, Jonathan D. Amith, Shinji Watanabe
2022InterspeechBlockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation.Keqi Deng, Shinji Watanabe, Jiatong Shi, Siddhant Arora
2022InterspeechSingAug: Data Augmentation for Singing Voice Synthesis with Cycle-consistent Training Strategy.Shuai Guo, Jiatong Shi, Tao Qian, Shinji Watanabe, Qin Jin
2022InterspeechMuskits: an End-to-end Music Processing Toolkit for Singing Voice Synthesis.Jiatong Shi, Shuai Guo, Tao Qian, Tomoki Hayashi, Yuning Wu, Fangzheng Xu, Xuankai Chang, Huazhe Li, Peter Wu, Shinji Watanabe, Qin Jin
2022InterspeechVQ-T: RNN Transducers using Vector-Quantized Prediction Network States.Jiatong Shi, George Saon, David Haws, Shinji Watanabe, Brian Kingsbury
2022InterspeechStreaming Automatic Speech Recognition with Re-blocking Processing Based on Integrated Voice Activity Detection.Yui Sudo, Muhammad Shakeel, Kazuhiro Nakadai, Jiatong Shi, Shinji Watanabe
2021ASRUCross-Lingual Transfer for Speech Processing Using Acoustic Language Similarity.Peter Wu, Jiatong Shi, Yifan Zhong, Shinji Watanabe, Alan W. Black
2021EACLLeveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yolxochitl Mixtec.Jiatong Shi, Jonathan D. Amith, Rey Castillo Garca, Esteban Guadalupe Sierra, Kevin Duh, Shinji Watanabe
2021ICASSPRecent Developments on Espnet Toolkit Boosted By Conformer.Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang
2021ICASSPSequence-To-Sequence Singing Voice Synthesis With Perceptual Entropy Loss.Jiatong Shi, Shuai Guo, Nan Huo, Yuekai Zhang, Qin Jin
2021ICASSPImproving RNN Transducer with Target Speaker Extraction and Neural Uncertainty Estimation.Jiatong Shi, Chunlei Zhang, Chao Weng, Shinji Watanabe, Meng Yu, Dong Yu
2021InterspeechSUPERB: Speech Processing Universal PERformance Benchmark.Shu-Wen Yang, Po-Han Chi, Yung-Sung Chuang, Cheng-I Jeff Lai, Kushal Lakhotia, Yist Y. Lin, Andy T. Liu, Jiatong Shi, Xuankai Chang, Guan-Ting Lin, Tzu-Hsien Huang, Wei-Cheng Tseng, Ko-tik Lee, Da-Rong Liu, Zili Huang, Shuyan Dong, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee
2020InterspeechLarge-Scale End-to-End Multilingual Speech Recognition and Language Identification with Multi-Task Learning.Wenxin Hou, Yue Dong, Bairong Zhuang, Longfei Yang, Jiatong Shi, Takahiro Shinozaki
2020InterspeechContext-Aware Goodness of Pronunciation for Computer-Assisted Pronunciation Training.Jiatong Shi, Nan Huo, Qin Jin