Skip to content

Soumi Maiti

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

22

Venues

6

Active years

2017–2025

Best venue rank

A*

Where they publish

Papers

22 indexed papers, newest first.

YearVenueTitleAuthors
2025InterspeechThe Text-to-speech in the Wild (TITW) Database.Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe
2024EMNLPTowards Robust Speech Representation Learning for Thousands of Languages.William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe
2024ICASSPExploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study.Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang
2024ICASSPTowards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-Training and Multi-Modal Tokens.Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro
2024ICASSPVoxtLM: Unified Decoder-Only Models for Consolidating Speech Recognition, Synthesis and Speech, Text Continuation Tasks.Soumi Maiti, Yifan Peng, Shukjae Choi, Jee-Weon Jung, Xuankai Chang, Shinji Watanabe
2024InterspeechSpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics.Takaaki Saeki, Soumi Maiti, Shinnosuke Takamichi, Shinji Watanabe, Hiroshi Saruwatari
2024InterspeechIndicMOS: Multilingual MOS Prediction for 7 Indian languages.Sathvik Udupa, Soumi Maiti, Prasanta Kumar Ghosh
2023ACLESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit.Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe
2023ASRUJoint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning.William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe
2023ASRUReproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data.Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe
2023ICASSPImproving Massively Multilingual ASR with Auxiliary CTC Objectives.William Chen, Brian Yan, Jiatong Shi, Yifan Peng, Soumi Maiti, Shinji Watanabe
2023ICASSPFindAdaptNet: Find and Insert Adapters by Learned Layer Importance.Junwei Huang, Karthik Ganesan, Soumi Maiti, Young Min Kim, Xuankai Chang, Paul Liang, Shinji Watanabe
2023ICASSPSpeechlmscore: Evaluating Speech Generation Using Speech Language Model.Soumi Maiti, Yifan Peng, Takaaki Saeki, Shinji Watanabe
2023IJCAILearning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining.Takaaki Saeki, Soumi Maiti, Xinjian Li, Shinji Watanabe, Shinnosuke Takamichi, Hiroshi Saruwatari
2023InterspeechReducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute.William Chen, Xuankai Chang, Yifan Peng, Zhaoheng Ni, Soumi Maiti, Shinji Watanabe
2022InterspeechTriniTTS: Pitch-controllable End-to-end TTS without External Aligner.Yooncheol Ju, Ilhwan Kim, Hongsun Yang, Ji-Hoon Kim, Byeongyeol Kim, Soumi Maiti, Shinji Watanabe
2021ICASSPEnd-To-End Diarization for Variable Number of Speakers with Local-Global Networks and Discriminative Speaker Embeddings.Soumi Maiti, Hakan Erdogan, Kevin W. Wilson, Scott Wisdom, Shinji Watanabe, John R. Hershey
2020ICASSPSpeaker Independence of Neural Vocoders and Their Effect on Parametric Resynthesis Speech Enhancement.Soumi Maiti, Michael I. Mandel
2020ICASSPGenerating Multilingual Voices Using Speaker Space Translation Based on Bilingual Speaker Data.Soumi Maiti, Erik Marchi, Alistair Conkie
2019ICASSPSpeech Denoising by Parametric Resynthesis.Soumi Maiti, Michael I. Mandel
2018InterspeechLarge Vocabulary Concatenative Resynthesis.Soumi Maiti, Joey Ching, Michael I. Mandel
2017InterspeechConcatenative Resynthesis Using Twin Networks.Soumi Maiti, Michael I. Mandel