| 2024 | Interspeech | VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech. | Ashishkumar Gudmalwar, Nirmesh Shah, Sai Akarsh, Pankaj Wasnik, Rajiv Ratn Shah |
| 2024 | Interspeech | DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing. | Neha Sahipjohn, Ashishkumar Gudmalwar, Nirmesh Shah, Pankaj Wasnik, Rajiv Ratn Shah |
| 2024 | NAACL | Isometric Neural Machine Translation using Phoneme Count Ratio Reward-based Reinforcement Learning. | Shivam Mhaskar, Nirmesh Shah, Mohammadi Zaki, Ashishkumar P. Gudmalwar, Pankaj Wasnik, Rajiv Ratn Shah |
| 2023 | ICASSP | Nonparallel Emotional Voice Conversion for Unseen Speaker-Emotion Pairs Using Dual Domain Adversarial Network & Virtual Domain Pairing. | Nirmesh Shah, Mayank Kumar Singh, Naoya Takahashi, Naoyuki Onoe |
| 2022 | CVPR | M2FNet: Multi-modal Fusion Network for Emotion Recognition in Conversation. | Vishal M. Chudasama, Purbayan Kar, Ashish Gudmalwar, Nirmesh Shah, Pankaj Wasnik, Naoyuki Onoe |
| 2022 | Interspeech | Semi-supervised Acoustic and Language Modeling for Hindi ASR. | Tarun Sai Bandarupalli, Shakti Rath, Nirmesh Shah, Naoyuki Onoe, Sriram Ganapathy |