Jiatong Shi
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
74
Venues
12
Active years
2020–2026
Best venue rank
A*
Where they publish
Papers
74 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback. | Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2026 | ACL | Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner. | Guan-Ting Lin, Shih-Yun Shan Kuan, Jiatong Shi, Kai-Wei Chang, Siddhant Arora, Shinji Watanabe, Hung-Yi Lee |
| 2026 | EACL | BSCodec: A Band-Split Neural Codec for High-Quality Universal Audio Reconstruction. | Haoran Wang, Jiatong Shi, Jinchuan Tian, Bohan Li, Kai Yu, Shinji Watanabe |
| 2025 | ASRU | VERSA-v2: A Modular and Scalable Toolkit for Speech and Audio Evaluation with Expanded Metrics, Visualization, and LLM Integration. | Jiatong Shi, Bo-Hao Su, Shikhar Bharadwaj, Yiwen Zhao, Shih-Heng Wang, Jionghao Hang, Haoran Wang, Wei Wang, Wenhao Feng, Yuxun Tang, Nezih Topaloglu, Siddhant Arora, Jinchuan Tian, William Chen, Hye-jin Shim, Wangyou Zhang, Wen-Chin Huang, Shinji Watanabe |
| 2025 | ASRU | PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning. | Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe |
| 2025 | ASRU | Continual Pre-training for Codec-Based Speech LLMs: Balancing Understanding and Generation. | Jiatong Shi, Chunlei Zhang, Jinchuan Tian, Junrui Ni, Hao Zhang, Shinji Watanabe, Dong Yu |
| 2025 | ASRU | Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty. | Yiwen Zhao, Jiatong Shi, Yuxun Tang, William Chen, Shinji Watanabe |
| 2025 | ICASSP | Preference Alignment Improves Language Model-Based TTS. | Jinchuan Tian, Chunlei Zhang, Jiatong Shi, Hao Zhang, Jianwei Yu, Shinji Watanabe, Dong Yu |
| 2025 | ICLR | Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks. | Chien-yu Huang, Wei-Chih Chen, Shu-Wen Yang, Andy T. Liu, Chen-An Li, Yu-Xiang Lin, Wei-Cheng Tseng, Anuj Diwan, Yi-Jen Shih, Jiatong Shi, William Chen, Chih-Kai Yang, Xuanjun Chen, Chi-Yuan Hsiao, Puyuan Peng, Shih-Heng Wang, Chun-Yi Kuan, Ke-Han Lu, Kai-Wei Chang, Fabian Alejandro Ritter Gutierrez, et al. |
| 2025 | Interspeech | Chain-of-Thought Training for Open E2E Spoken Dialogue Systems. | Siddhant Arora, Jinchuan Tian, Hayato Futami, Jee-weon Jung, Jiatong Shi, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe |
| 2025 | Interspeech | MIKU-PAL: An Automated and Standardized Multimodal Method for Speech Paralinguistic and Affect Labeling. | Yifan Cheng, Ruoyi Zhang, Jiatong Shi |
| 2025 | Interspeech | The ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties. | William Chen, Chutong Meng, Jiatong Shi, Martijn Bartelds, Shih-Heng Wang, Hsiu-Hsuan Wang, Rafael Mosquera, Sara Hincapie, Dan Jurafsky, Antonis Anastasopoulos, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2025 | Interspeech | Bridging Speech and Singing: Multi-stage Speech-Prompted Singing Voice Conversion with Speaker Embedding Adaptation. | Mingda Liu, Jiatong Shi |
| 2025 | Interspeech | Scalable Spontaneous Speech Dataset (SSSD): Crowdsourcing Data Collection to Promote Dialogue Research. | Zaid Sheikh, Shuichiro Shimizu, Siddhant Arora, Jiatong Shi, Samuele Cornell, Xinjian Li, Shinji Watanabe |
| 2025 | Interspeech | Uni-VERSA: Versatile Speech Assessment with a Unified Network. | Jiatong Shi, Hye-jin Shim, Shinji Watanabe |
| 2025 | Interspeech | OpusLM: A Family of Open Unified Speech Language Models. | Jinchuan Tian, William Chen, Yifan Peng, Jiatong Shi, Siddhant Arora, Shikhar Bharadwaj, Takashi Maekaku, Yusuke Shinohara, Keita Goto, Xiang Yue, Huck Yang, Shinji Watanabe |
| 2025 | KDD | FoodPuzzle: Toward Developing Large Language Model Agents as Autonomous Flavor Scientists. | Tenghao Huang, Dong Hee Lee, John Sweeney, Jiatong Shi, Emily Steliotes, Matthew Lange, Jonathan May, Muhao Chen |
| 2025 | NAACL | ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems. | Siddhant Arora, Yifan Peng, Jiatong Shi, Jinchuan Tian, William Chen, Shikhar Bharadwaj, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shuichiro Shimizu, Vaibhav Srivastav, Shinji Watanabe |
| 2025 | NAACL | VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music. | Jiatong Shi, Hye-jin Shim, Jinchuan Tian, Siddhant Arora, Haibin Wu, Darius Petermann, Jia Qi Yip, You Zhang, Yuxun Tang, Wangyou Zhang, Dareen Alharthi, Yichen Huang, Koichi Saito, Jionghao Han, Yiwen Zhao, Chris Donahue, Shinji Watanabe |
| 2025 | NAACL | ESPnet-SpeechLM: An Open Speech Language Model Toolkit. | Jinchuan Tian, Jiatong Shi, William Chen, Siddhant Arora, Yoshiki Masuyama, Takashi Maekaku, Yihan Wu, Junyi Peng, Shikhar Bharadwaj, Yiwen Zhao, Samuele Cornell, Yifan Peng, Xiang Yue, Chao-Han Huck Yang, Graham Neubig, Shinji Watanabe |
| 2024 | AAAI | AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head. | Rongjie Huang, Mingze Li, Dongchao Yang, Jiatong Shi, Xuankai Chang, Zhenhui Ye, Yuning Wu, Zhiqing Hong, Jiawei Huang, Jinglin Liu, Yi Ren, Yuexian Zou, Zhou Zhao, Shinji Watanabe |
| 2024 | ACL | Wav2Gloss: Generating Interlinear Glossed Text from Speech. | Taiqi He, Kwanghee Choi, Lindia Tjuatja, Nathaniel R. Robinson, Jiatong Shi, Shinji Watanabe, Graham Neubig, David R. Mortensen, Lori S. Levin |
| 2024 | ACL | Make-A-Voice: Revisiting Voice Large Language Models as Scalable Multilingual and Multitask Learners. | Rongjie Huang, Chunlei Zhang, Yongqi Wang, Dongchao Yang, Jinchuan Tian, Zhenhui Ye, Luping Liu, Zehan Wang, Ziyue Jiang, Xuankai Chang, Jiatong Shi, Chao Weng, Zhou Zhao, Dong Yu |
| 2024 | EMNLP | Towards Robust Speech Representation Learning for Thousands of Languages. | William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe |
| 2024 | HealthCom | Exploiting Longitudinal Speech Sessions via Voice Assistant Systems for Early Detection of Cognitive Decline. | Kristin Qi, Jiatong Shi, Caroline Summerour, John A. Batsis, Xiaohui Liang |
| 2024 | ICASSP | Exploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study. | Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang |
| 2024 | ICASSP | Dynamic-Superb: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark For Speech. | Chien-Yu Huang, Ke-Han Lu, Shih-Heng Wang, Chi-Yuan Hsiao, Chun-Yi Kuan, Haibin Wu, Siddhant Arora, Kai-Wei Chang, Jiatong Shi, Yifan Peng, Roshan S. Sharma, Shinji Watanabe, Bhiksha Ramakrishnan, Shady Shehata, Hung-Yi Lee |
| 2024 | ICASSP | Hubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model. | Takashi Maekaku, Jiatong Shi, Xuankai Chang, Yuya Fujita, Shinji Watanabe |
| 2024 | ICLR | Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction. | Jiatong Shi, Hirofumi Inaguma, Xutai Ma, Ilia Kulikov, Anna Y. Sun |
| 2024 | ICML | UniAudio: Towards Universal Audio Generation with Large Language Models. | Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Haohan Guo, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2024 | Interspeech | Self-supervised Speech Representations Still Struggle with African American Vernacular English. | Kalvin Chang, Yi-Hui Chou, Jiatong Shi, Hsuan-Ming Chen, Nicole Holliday, Odette Scharenborg, David R. Mortensen |
| 2024 | Interspeech | The Interspeech 2024 Challenge on Speech Processing Using Discrete Units. | Xuankai Chang, Jiatong Shi, Jinchuan Tian, Yuning Wu, Yuxun Tang, Yihan Wu, Shinji Watanabe, Yossi Adi, Xie Chen, Qin Jin |
| 2024 | Interspeech | ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models. | Jee-weon Jung, Wangyou Zhang, Jiatong Shi, Zakaria Aldeneh, Takuya Higuchi, Alex Gichamba, Barry-John Theobald, Ahmed Hussen Abdelaziz, Shinji Watanabe |
| 2024 | Interspeech | PL-TTS: A Generalizable Prompt-based Diffusion TTS Augmented by Large Language Model. | Shuhua Li, Qirong Mao, Jiatong Shi |
| 2024 | Interspeech | OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer. | Yifan Peng, Jinchuan Tian, William Chen, Siddhant Arora, Brian Yan, Yui Sudo, Muhammad Shakeel, Kwanghee Choi, Jiatong Shi, Xuankai Chang, Jee-weon Jung, Shinji Watanabe |
| 2024 | Interspeech | Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing. | Jiatong Shi, Yueqian Lin, Xinyi Bai, Keyi Zhang, Yuning Wu, Yuxun Tang, Yifeng Yu, Qin Jin, Shinji Watanabe |
| 2024 | Interspeech | MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model. | Jiatong Shi, Xutai Ma, Hirofumi Inaguma, Anna Sun, Shinji Watanabe |
| 2024 | Interspeech | ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets. | Jiatong Shi, Shih-Heng Wang, William Chen, Martijn Bartelds, Vanya Bannihatti Kumar, Jinchuan Tian, Xuankai Chang, Dan Jurafsky, Karen Livescu, Hung-yi Lee, Shinji Watanabe |
| 2024 | Interspeech | EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios. | Tejes Srivastava, Jiatong Shi, William Chen, Shinji Watanabe |
| 2024 | Interspeech | SingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models. | Yuxun Tang, Yuning Wu, Jiatong Shi, Qin Jin |
| 2024 | Interspeech | TokSing: Singing Voice Synthesis based on Discrete Tokens. | Yuning Wu, Chunlei Zhang, Jiatong Shi, Yuxun Tang, Shan Yang, Qin Jin |
| 2024 | Interspeech | CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection. | Yongyi Zang, Jiatong Shi, You Zhang, Ryuichi Yamamoto, Jionghao Han, Yuxun Tang, Shengyuan Xu, Wenxiao Zhao, Jing Guo, Tomoki Toda, Zhiyao Duan |
| 2023 | ACL | UniLG: A Unified Structure-aware Framework for Lyrics Generation. | Tao Qian, Fan Lou, Jiatong Shi, Yuning Wu, Shuai Guo, Xiang Yin, Qin Jin |
| 2023 | ACL | ESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit. | Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe |
| 2023 | ASRU | Joint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning. | William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | Evaluating Self-Supervised Speech Models on a Taiwanese Hokkien Corpus. | Yi-Hui Chou, Kalvin Chang, Meng-Ju Wu, Winston Ou, Alice Wen-Hsin Bi, Carol Yang, Bryan Y. Chen, Rong-Wei Pai, Po-Yen Yeh, Jo-Peng Chiang, Iu-Tshian Phoann, Winnie Chang, Chenxuan Cui, Noel Chen, Jiatong Shi |
| 2023 | ASRU | The Singing Voice Conversion Challenge 2023. | Wen-Chin Huang, Lester Phillip Violeta, Songxiang Liu, Jiatong Shi, Tomoki Toda |
| 2023 | ASRU | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | Findings of the 2023 ML-Superb Challenge: Pre-Training And Evaluation Over More Languages And Beyond. | Jiatong Shi, William Chen, Dan Berrebbi, Hsiu-Hsuan Wang, Wei-Ping Huang, En-Pei Hu, Ho-Lam Chuang, Xuankai Chang, Yuxun Tang, Shang-Wen Li, Abdelrahman Mohamed, Hung-Yi Lee, Shinji Watanabe |
| 2023 | ICASSP | Improving Massively Multilingual ASR with Auxiliary CTC Objectives. | William Chen, Brian Yan, Jiatong Shi, Yifan Peng, Soumi Maiti, Shinji Watanabe |
| 2023 | ICASSP | Euro: Espnet Unsupervised ASR Open-Source Toolkit. | Dongji Gao, Jiatong Shi, Shun-Po Chuang, Leibny Paola Garca, Hung-Yi Lee, Shinji Watanabe, Sanjeev Khudanpur |
| 2023 | ICASSP | Bridging Speech and Textual Pre-Trained Models With Unsupervised ASR. | Jiatong Shi, Chan-Jan Hsu, Ho-Lam Chung, Dongji Gao, Paola Garca, Shinji Watanabe, Ann Lee, Hung-Yi Lee |
| 2023 | ICASSP | Enhancing Speech-To-Speech Translation with Multiple TTS Targets. | Jiatong Shi, Yun Tang, Ann Lee, Hirofumi Inaguma, Changhan Wang, Juan Pino, Shinji Watanabe |
| 2023 | ICASSP | Phoneix: Acoustic Feature Processing Strategy for Enhanced Singing Pronunciation With Phoneme Distribution Predictor. | Yuning Wu, Jiatong Shi, Tao Qian, Dongji Gao, Qin Jin |
| 2023 | Interspeech | Exploration on HuBERT with Multiple Resolution. | Jiatong Shi, Yun Tang, Hirofumi Inaguma, Hongyu Gong, Juan Pino, Shinji Watanabe |
| 2023 | Interspeech | ML-SUPERB: Multilingual Speech Universal PERformance Benchmark. | Jiatong Shi, Dan Berrebbi, William Chen, En-Pei Hu, Wei-Ping Huang, Ho-Lam Chung, Xuankai Chang, Shang-Wen Li, Abdelrahman Mohamed, Hung-yi Lee, Shinji Watanabe |
| 2023 | Interspeech | 4D ASR: Joint modeling of CTC, Attention, Transducer, and Mask-Predict decoders. | Yui Sudo, Muhammad Shakeel, Brian Yan, Jiatong Shi, Shinji Watanabe |
| 2022 | ACL | SUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities. | Hsiang-Sheng Tsai, Heng-Jui Chang, Wen-Chin Huang, Zili Huang, Kushal Lakhotia, Shu-Wen Yang, Shuyan Dong, Andy T. Liu, Cheng-I Lai, Jiatong Shi, Xuankai Chang, Phil Hall, Hsuan-Jui Chen, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee |
| 2022 | ICASSP | Training Strategies for Automatic Song Writing: A Unified Framework Perspective. | Tao Qian, Jiatong Shi, Shuai Guo, Peter Wu, Qin Jin |
| 2022 | ICASSP | Towards end-to-end Speaker Diarization with Generalized Neural Speaker Clustering. | Chunlei Zhang, Jiatong Shi, Chao Weng, Meng Yu, Dong Yu |
| 2022 | Interspeech | Combining Spectral and Self-Supervised Features for Low Resource Speech Recognition and Translation. | Dan Berrebbi, Jiatong Shi, Brian Yan, Osbel Lpez-Francisco, Jonathan D. Amith, Shinji Watanabe |
| 2022 | Interspeech | Blockwise Streaming Transformer for Spoken Language Understanding and Simultaneous Speech Translation. | Keqi Deng, Shinji Watanabe, Jiatong Shi, Siddhant Arora |
| 2022 | Interspeech | SingAug: Data Augmentation for Singing Voice Synthesis with Cycle-consistent Training Strategy. | Shuai Guo, Jiatong Shi, Tao Qian, Shinji Watanabe, Qin Jin |
| 2022 | Interspeech | Muskits: an End-to-end Music Processing Toolkit for Singing Voice Synthesis. | Jiatong Shi, Shuai Guo, Tao Qian, Tomoki Hayashi, Yuning Wu, Fangzheng Xu, Xuankai Chang, Huazhe Li, Peter Wu, Shinji Watanabe, Qin Jin |
| 2022 | Interspeech | VQ-T: RNN Transducers using Vector-Quantized Prediction Network States. | Jiatong Shi, George Saon, David Haws, Shinji Watanabe, Brian Kingsbury |
| 2022 | Interspeech | Streaming Automatic Speech Recognition with Re-blocking Processing Based on Integrated Voice Activity Detection. | Yui Sudo, Muhammad Shakeel, Kazuhiro Nakadai, Jiatong Shi, Shinji Watanabe |
| 2021 | ASRU | Cross-Lingual Transfer for Speech Processing Using Acoustic Language Similarity. | Peter Wu, Jiatong Shi, Yifan Zhong, Shinji Watanabe, Alan W. Black |
| 2021 | EACL | Leveraging End-to-End ASR for Endangered Language Documentation: An Empirical Study on Yolxochitl Mixtec. | Jiatong Shi, Jonathan D. Amith, Rey Castillo Garca, Esteban Guadalupe Sierra, Kevin Duh, Shinji Watanabe |
| 2021 | ICASSP | Recent Developments on Espnet Toolkit Boosted By Conformer. | Pengcheng Guo, Florian Boyer, Xuankai Chang, Tomoki Hayashi, Yosuke Higuchi, Hirofumi Inaguma, Naoyuki Kamo, Chenda Li, Daniel Garcia-Romero, Jiatong Shi, Jing Shi, Shinji Watanabe, Kun Wei, Wangyou Zhang, Yuekai Zhang |
| 2021 | ICASSP | Sequence-To-Sequence Singing Voice Synthesis With Perceptual Entropy Loss. | Jiatong Shi, Shuai Guo, Nan Huo, Yuekai Zhang, Qin Jin |
| 2021 | ICASSP | Improving RNN Transducer with Target Speaker Extraction and Neural Uncertainty Estimation. | Jiatong Shi, Chunlei Zhang, Chao Weng, Shinji Watanabe, Meng Yu, Dong Yu |
| 2021 | Interspeech | SUPERB: Speech Processing Universal PERformance Benchmark. | Shu-Wen Yang, Po-Han Chi, Yung-Sung Chuang, Cheng-I Jeff Lai, Kushal Lakhotia, Yist Y. Lin, Andy T. Liu, Jiatong Shi, Xuankai Chang, Guan-Ting Lin, Tzu-Hsien Huang, Wei-Cheng Tseng, Ko-tik Lee, Da-Rong Liu, Zili Huang, Shuyan Dong, Shang-Wen Li, Shinji Watanabe, Abdelrahman Mohamed, Hung-yi Lee |
| 2020 | Interspeech | Large-Scale End-to-End Multilingual Speech Recognition and Language Identification with Multi-Task Learning. | Wenxin Hou, Yue Dong, Bairong Zhuang, Longfei Yang, Jiatong Shi, Takahiro Shinozaki |
| 2020 | Interspeech | Context-Aware Goodness of Pronunciation for Computer-Assisted Pronunciation Training. | Jiatong Shi, Nan Huo, Qin Jin |