Soumi Maiti
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
22
Venues
6
Active years
2017–2025
Best venue rank
A*
Where they publish
Papers
22 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | Interspeech | The Text-to-speech in the Wild (TITW) Database. | Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe |
| 2024 | EMNLP | Towards Robust Speech Representation Learning for Thousands of Languages. | William Chen, Wangyou Zhang, Yifan Peng, Xinjian Li, Jinchuan Tian, Jiatong Shi, Xuankai Chang, Soumi Maiti, Karen Livescu, Shinji Watanabe |
| 2024 | ICASSP | Exploring Speech Recognition, Translation, and Understanding with Discrete Speech Units: A Comparative Study. | Xuankai Chang, Brian Yan, Kwanghee Choi, Jee-Weon Jung, Yichen Lu, Soumi Maiti, Roshan S. Sharma, Jiatong Shi, Jinchuan Tian, Shinji Watanabe, Yuya Fujita, Takashi Maekaku, Pengcheng Guo, Yao-Fei Cheng, Pavel Denisov, Kohei Saijo, Hsiu-Hsuan Wang |
| 2024 | ICASSP | Towards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-Training and Multi-Modal Tokens. | Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro |
| 2024 | ICASSP | VoxtLM: Unified Decoder-Only Models for Consolidating Speech Recognition, Synthesis and Speech, Text Continuation Tasks. | Soumi Maiti, Yifan Peng, Shukjae Choi, Jee-Weon Jung, Xuankai Chang, Shinji Watanabe |
| 2024 | Interspeech | SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics. | Takaaki Saeki, Soumi Maiti, Shinnosuke Takamichi, Shinji Watanabe, Hiroshi Saruwatari |
| 2024 | Interspeech | IndicMOS: Multilingual MOS Prediction for 7 Indian languages. | Sathvik Udupa, Soumi Maiti, Prasanta Kumar Ghosh |
| 2023 | ACL | ESPnet-ST-v2: Multipurpose Spoken Language Translation Toolkit. | Brian Yan, Jiatong Shi, Yun Tang, Hirofumi Inaguma, Yifan Peng, Siddharth Dalmia, Peter Polak, Patrick Fernandes, Dan Berrebbi, Tomoki Hayashi, Xiaohui Zhang, Zhaoheng Ni, Moto Hira, Soumi Maiti, Juan Pino, Shinji Watanabe |
| 2023 | ASRU | Joint Prediction and Denoising for Large-Scale Multilingual Self-Supervised Learning. | William Chen, Jiatong Shi, Brian Yan, Dan Berrebbi, Wangyou Zhang, Yifan Peng, Xuankai Chang, Soumi Maiti, Shinji Watanabe |
| 2023 | ASRU | Reproducing Whisper-Style Training Using An Open-Source Toolkit And Publicly Available Data. | Yifan Peng, Jinchuan Tian, Brian Yan, Dan Berrebbi, Xuankai Chang, Xinjian Li, Jiatong Shi, Siddhant Arora, William Chen, Roshan S. Sharma, Wangyou Zhang, Yui Sudo, Muhammad Shakeel, Jee-Weon Jung, Soumi Maiti, Shinji Watanabe |
| 2023 | ICASSP | Improving Massively Multilingual ASR with Auxiliary CTC Objectives. | William Chen, Brian Yan, Jiatong Shi, Yifan Peng, Soumi Maiti, Shinji Watanabe |
| 2023 | ICASSP | FindAdaptNet: Find and Insert Adapters by Learned Layer Importance. | Junwei Huang, Karthik Ganesan, Soumi Maiti, Young Min Kim, Xuankai Chang, Paul Liang, Shinji Watanabe |
| 2023 | ICASSP | Speechlmscore: Evaluating Speech Generation Using Speech Language Model. | Soumi Maiti, Yifan Peng, Takaaki Saeki, Shinji Watanabe |
| 2023 | IJCAI | Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining. | Takaaki Saeki, Soumi Maiti, Xinjian Li, Shinji Watanabe, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2023 | Interspeech | Reducing Barriers to Self-Supervised Learning: HuBERT Pre-training with Academic Compute. | William Chen, Xuankai Chang, Yifan Peng, Zhaoheng Ni, Soumi Maiti, Shinji Watanabe |
| 2022 | Interspeech | TriniTTS: Pitch-controllable End-to-end TTS without External Aligner. | Yooncheol Ju, Ilhwan Kim, Hongsun Yang, Ji-Hoon Kim, Byeongyeol Kim, Soumi Maiti, Shinji Watanabe |
| 2021 | ICASSP | End-To-End Diarization for Variable Number of Speakers with Local-Global Networks and Discriminative Speaker Embeddings. | Soumi Maiti, Hakan Erdogan, Kevin W. Wilson, Scott Wisdom, Shinji Watanabe, John R. Hershey |
| 2020 | ICASSP | Speaker Independence of Neural Vocoders and Their Effect on Parametric Resynthesis Speech Enhancement. | Soumi Maiti, Michael I. Mandel |
| 2020 | ICASSP | Generating Multilingual Voices Using Speaker Space Translation Based on Bilingual Speaker Data. | Soumi Maiti, Erik Marchi, Alistair Conkie |
| 2019 | ICASSP | Speech Denoising by Parametric Resynthesis. | Soumi Maiti, Michael I. Mandel |
| 2018 | Interspeech | Large Vocabulary Concatenative Resynthesis. | Soumi Maiti, Joey Ching, Michael I. Mandel |
| 2017 | Interspeech | Concatenative Resynthesis Using Twin Networks. | Soumi Maiti, Michael I. Mandel |