Skip to content

Boris Ginsburg

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

87

Venues

9

Active years

2002–2026

Best venue rank

A*

Where they publish

Papers

87 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLHierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech.Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li
2026ACLScaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models.Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg
2026ACLSpeech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception.Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang
2025ACLNeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model.Yen-Ting Lin, Zhehuai Chen, Piotr Zelasko, Zhen Wan, Xuesong Yang, Zih-Ching Chen, Krishna C. Puvvada, Ke Hu, Szu-Wei Fu, Jun Wei Chiu, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Chao-Han Huck Yang
2025ACLGenetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models.Somshubra Majumdar, Vahid Noroozi, Mehrzad Samadi, Sean Narenthiran, Aleksander Ficek, Wasi Uddin Ahmad, Jocelyn Huang, Jagadeesh Balam, Boris Ginsburg
2025ASRUTurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree.Andrei Andrusenko, Vladimir Bataev, Lilit Grigoryan, Vitaly Lavrukhin, Boris Ginsburg
2025ASRUOpen Full-duplex Voice Agent with Speech-to-Speech Language Model.Edresson Casanova, Chen Chen, Kevin Hu, Ankita Pasad, Elena Rastorgueva, Seelan Lakshmi Narasimhan, Slyne Deng, Ehsan Hosseini-Asl, Piotr Zelasko, Valentin Mendelev, Subhankar Ghosh, Yifan Peng, Zhehuai Chen, Jason Li, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg
2025ASRUFlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities.Lilit Grigoryan, Vladimir Bataev, Nikolay Karpov, Andrei Andrusenko, Vitaly Lavrukhin, Boris Ginsburg
2025ASRUTraining and Inference Efficiency of Encoder-Decoder Speech Models.Piotr Zelasko, Kunal Dhawan, Daniel Galvez, Krishna C. Puvvada, Ankita Pasad, Travis M. Bartley, Nithin Rao Koluguri, Ke Hu, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg
2025EMNLPSWAN: An Efficient and Scalable Approach for Long-Context Language Modeling.Krishna C. Puvvada, Faisal Ladhak, Santiago Akle Serano, Cheng-Ping Hsieh, Shantanu Acharya, Somshubra Majumdar, Fei Jia, Samuel Kriman, Simeng Sun, Dima Rekesh, Boris Ginsburg
2025EMNLPExtending Automatic Machine Translation Evaluation to Book-Length Documents.Kuang-Da Wang, Shuoyang Ding, Chao-Han Huck Yang, Ping-Chun Hsieh, Wen-Chih Peng, Vitaly Lavrukhin, Boris Ginsburg
2025ICASSPOpen Automatic Speech Recognition Models for Classical and Modern Standard Arabic.Lilit Grigoryan, Nikolay Karpov, Enas Albasiri, Vitaly Lavrukhin, Boris Ginsburg
2025ICASSPNEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks.He Huang, Taejin Park, Kunal Dhawan, Ivan Medennikov, Krishna C. Puvvada, Nithin Rao Koluguri, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg
2025ICASSPChain-of-Thought Prompting for Speech Translation.Ke Hu, Zhehuai Chen, Chao-Han Huck Yang, Piotr Zelasko, Oleksii Hrinchuk, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg
2025ICASSPDeveloping Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data.Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-Yi Lee
2025ICASSPMETA-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR.Jinhan Wang, Weiqing Wang, Kunal Dhawan, Taejin Park, Myungjong Kim, Ivan Medennikov, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg
2025ICASSPEMMeTT: Efficient Multimodal Machine Translation Training.Piotr Zelasko, Zhehuai Chen, Mengru Wang, Daniel Galvez, Oleksii Hrinchuk, Shuoyang Ding, Ke Hu, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg
2025ICLRnGPT: Normalized Transformer with Representation Learning on the Hypersphere.Ilya Loshchilov, Cheng-Ping Hsieh, Simeng Sun, Boris Ginsburg
2025ICLRHAINAN: Fast and Accurate Transducer for Hybrid-Autoregressive ASR.Hainan Xu, Travis M. Bartley, Vladimir Bataev, Boris Ginsburg
2025ICMLStar Attention: Efficient LLM Inference over Long Sequences.Shantanu Acharya, Fei Jia, Boris Ginsburg
2025ICMLSortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems.Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg
2025InterspeechNGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding.Vladimir Bataev, Andrei Andrusenko, Lilit Grigoryan, Aleksandr Laptev, Vitaly Lavrukhin, Boris Ginsburg
2025InterspeechNanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference.Edresson Casanova, Paarth Neekhara, Ryan Langman, Shehzeen Hussain, Subhankar Ghosh, Xuesong Yang, Ante Jukic, Jason Li, Boris Ginsburg
2025InterspeechPushing the Limits of Beam Search Decoding for Transducer-based ASR models.Lilit Grigoryan, Vladimir Bataev, Andrei Andrusenko, Hainan Xu, Vitaly Lavrukhin, Boris Ginsburg
2025InterspeechSPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription.Raymond Grossman, Taejin Park, Kunal Dhawan, Andrew Titus, Sophia Zhi, Yulia Shchadilova, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg
2025InterspeechEfficient and Direct Duplex Modeling for Speech-to-Speech Language Model.Ke Hu, Ehsan Hosseini-Asl, Chen Chen, Edresson Casanova, Subhankar Ghosh, Piotr Zelasko, Zhehuai Chen, Jason Li, Jagadeesh Balam, Boris Ginsburg
2025InterspeechWord Level Timestamp Generation for Automatic Speech Recognition and Translation.Ke Hu, Krishna C. Puvvada, Elena Rastorgueva, Zhehuai Chen, He Huang, Shuoyang Ding, Kunal Dhawan, Hainan Xu, Jagadeesh Balam, Boris Ginsburg
2025InterspeechGranary: Speech Recognition and Translation Dataset in 25 European Languages.Nithin Rao Koluguri, Monica Sekoyan, George Zelenfroynd, Sasha Meister, Shuoyang Ding, Sofia Kostandian, He Huang, Nikolay Karpov, Jagadeesh Balam, Vitaly Lavrukhin, Yifan Peng, Sara Papi, Marco Gaido, Alessio Brutti, Boris Ginsburg
2025InterspeechStreaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering.Ivan Medennikov, Taejin Park, Weiqing Wang, He Huang, Kunal Dhawan, Jinhan Wang, Jagadeesh Balam, Boris Ginsburg
2025InterspeechSpeaker Targeting via Self-Speaker Adaptation for Multi-talker ASR.Weiqing Wang, Taejin Park, Ivan Medennikov, Jinhan Wang, Kunal Dhawan, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg
2025InterspeechWIND: Accelerated RNN-T Decoding with Windowed Inference for Non-blank Detection.Hainan Xu, Vladimir Bataev, Lilit Grigoryan, Boris Ginsburg
2025NAACLAnticipating Future with Large Language Model for Simultaneous Machine Translation.Siqi Ouyang, Oleksii Hrinchuk, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Lei Li, Boris Ginsburg
2025NAACLVoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning.Yifan Peng, Krishna C. Puvvada, Zhehuai Chen, Piotr Zelasko, He Huang, Kunal Dhawan, Ke Hu, Shinji Watanabe, Jagadeesh Balam, Boris Ginsburg
2024ICASSPA Chat about Boring Problems: Studying GPT-Based Text Normalization.Yang Zhang, Travis M. Bartley, Mariana Graterol-Fuenmayor, Vitaly Lavrukhin, Evelina Bakhturina, Boris Ginsburg
2024ICASSPMultilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer.Maxime Burchi, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg, Radu Timofte
2024ICASSPSALM: Speech-Augmented Language Model with in-Context Learning for Speech Recognition and Translation.Zhehuai Chen, He Huang, Andrei Andrusenko, Oleksii Hrinchuk, Krishna C. Puvvada, Jason Li, Subhankar Ghosh, Jagadeesh Balam, Boris Ginsburg
2024ICASSPInvestigating End-to-End ASR Architectures for Long Form Audio Transcription.Nithin Rao Koluguri, Samuel Kriman, Georgy Zelenfroind, Somshubra Majumdar, Dima Rekesh, Vahid Noroozi, Jagadeesh Balam, Boris Ginsburg
2024ICASSPStateful Conformer with Cache-Based Inference for Streaming Automatic Speech Recognition.Vahid Noroozi, Somshubra Majumdar, Ankur Kumar, Jagadeesh Balam, Boris Ginsburg
2024ICASSPDiscrete Audio Representation as an Alternative to Mel-Spectrograms for Speaker and Speech Recognition.Krishna C. Puvvada, Nithin Rao Koluguri, Kunal Dhawan, Jagadeesh Balam, Boris Ginsburg
2024ICASSPTransducers with Pronunciation-Aware Embeddings for Automatic Speech Recognition.Hainan Xu, Zhehuai Chen, Fei Jia, Boris Ginsburg
2024ICMLSelfVC: Voice Conversion With Iterative Refinement using Self Transformations.Paarth Neekhara, Shehzeen Samarah Hussain, Rafael Valle, Boris Ginsburg, Rishabh Ranjan, Shlomo Dubnov, Farinaz Koushanfar, Julian J. McAuley
2024InterspeechFast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter.Andrei Andrusenko, Aleksandr Laptev, Vladimir Bataev, Vitaly Lavrukhin, Boris Ginsburg
2024InterspeechCodec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations.Kunal Dhawan, Nithin Rao Koluguri, Ante Jukic, Ryan Langman, Jagadeesh Balam, Boris Ginsburg
2024InterspeechSchrdinger Bridge for Generative Speech Enhancement.Ante Jukic, Roman Korostik, Jagadeesh Balam, Boris Ginsburg
2024InterspeechDeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment.Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, He Huang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee
2024InterspeechImproving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment.Paarth Neekhara, Shehzeen Hussain, Subhankar Ghosh, Jason Li, Boris Ginsburg
2024InterspeechInstruction Data Generation and Unsupervised Adaptation for Speech Language Models.Vahid Noroozi, Zhehuai Chen, Somshubra Majumdar, Steve Huang, Jagadeesh Balam, Boris Ginsburg
2024InterspeechLess is More: Accurate Speech Recognition & Translation without Web-Scale Data.Krishna C. Puvvada, Piotr Zelasko, He Huang, Oleksii Hrinchuk, Nithin Rao Koluguri, Kunal Dhawan, Somshubra Majumdar, Elena Rastorgueva, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg
2023ASRULibriSpeech-PC: Benchmark for Evaluation of Punctuation and Capitalization Capabilities of End-to-End ASR Models.Aleksandr Meister, Matvei Novikov, Nikolay Karpov, Evelina Bakhturina, Vitaly Lavrukhin, Boris Ginsburg
2023ASRUFast Conformer With Linearly Scalable Attention For Efficient Speech Recognition.Dima Rekesh, Nithin Rao Koluguri, Samuel Kriman, Somshubra Majumdar, Vahid Noroozi, He Huang, Oleksii Hrinchuk, Krishna C. Puvvada, Ankur Kumar, Jagadeesh Balam, Boris Ginsburg
2023ICASSPVani: Very-Lightweight Accent-Controllable TTS for Native And Non-Native Speakers With Identity Preservation.Rohan Badlani, Akshit Arora, Subhankar Ghosh, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Boris Ginsburg, Bryan Catanzaro
2023ICASSPAccidental Learners: Spoken Language Identification in Multilingual Self-Supervised Models.Travis M. Bartley, Fei Jia, Krishna C. Puvvada, Samuel Kriman, Boris Ginsburg
2023ICASSPACE-VC: Adaptive and Controllable Voice Conversion Using Explicitly Disentangled Self-Supervised Speech Representations.Shehzeen Hussain, Paarth Neekhara, Jocelyn Huang, Jason Li, Boris Ginsburg
2023ICASSPPowerful and Extensible WFST Framework for Rnn-Transducer Losses.Aleksandr Laptev, Vladimir Bataev, Igor Gitman, Boris Ginsburg
2023ICASSPMulti-Blank Transducers for Speech Recognition.Hainan Xu, Fei Jia, Somshubra Majumdar, Shinji Watanabe, Boris Ginsburg
2023ICASSPConformer-Based Target-Speaker Automatic Speech Recognition For Single-Channel Audio.Yang Zhang, Krishna C. Puvvada, Vitaly Lavrukhin, Boris Ginsburg
2023ICLRBigVGAN: A Universal Neural Vocoder with Large-Scale Training.Sang-gil Lee, Wei Ping, Boris Ginsburg, Bryan Catanzaro, Sungroh Yoon
2023ICMLEfficient Sequence Transduction by Jointly Predicting Tokens and Durations.Hainan Xu, Fei Jia, Somshubra Majumdar, He Huang, Shinji Watanabe, Boris Ginsburg
2023InterspeechSpellMapper: A non-autoregressive neural spellchecker for ASR customization with candidate retrieval based on n-gram mappings.Alexandra Antonova, Evelina Bakhturina, Boris Ginsburg
2023InterspeechText-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator.Vladimir Bataev, Roman Korostik, Evgeny Shabalin, Vitaly Lavrukhin, Boris Ginsburg
2023InterspeechConfidence-based Ensembles of End-to-End Speech Recognition Models.Igor Gitman, Vitaly Lavrukhin, Aleksandr Laptev, Boris Ginsburg
2023InterspeechAdapter-Based Extension of Multi-Speaker Text-To-Speech Model for New Speakers.Cheng-Ping Hsieh, Subhankar Ghosh, Boris Ginsburg
2023InterspeechLeveraging Pretrained ASR Encoders for Effective and Efficient End-to-End Speech Intent Classification and Slot Filling.He Huang, Jagadeesh Balam, Boris Ginsburg
2023InterspeechA Compact End-to-End Model with Local and Global Context for Spoken Language Identification.Fei Jia, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg
2023InterspeechNeMo Forced Aligner and its application to word alignment for subtitle generation.Elena Rastorgueva, Vitaly Lavrukhin, Boris Ginsburg
2022ICASSPTitaNet: Neural Model for Speaker Representation with 1D Depth-Wise Separable Convolutions and Global Context.Nithin Rao Koluguri, Taejin Park, Boris Ginsburg
2022ICASSPMixer-TTS: Non-Autoregressive, Fast and Compact Text-to-Speech Model Conditioned on Language Model Embeddings.Oktai Tatanov, Stanislav Beliaev, Boris Ginsburg
2022InterspeechThutmose Tagger: Single-pass neural model for Inverse Text Normalization.Alexandra Antonova, Evelina Bakhturina, Boris Ginsburg
2022InterspeechShallow Fusion of Weighted Finite-State Transducer and Language Model for Text Normalization.Evelina Bakhturina, Yang Zhang, Boris Ginsburg
2022InterspeechCTC Variations Through New WFST Topologies.Aleksandr Laptev, Somshubra Majumdar, Boris Ginsburg
2022InterspeechMulti-scale Speaker Diarization with Dynamic Scale Weighting.Taejin Park, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg
2022InterspeechNeMo Open Source Speaker Diarization System.Taejin Park, Nithin Rao Koluguri, Fei Jia, Jagadeesh Balam, Boris Ginsburg
2021ICASSPMarbleNet: Deep 1D Time-Channel Separable Convolutional Neural Network for Voice Activity Detection.Fei Jia, Somshubra Majumdar, Boris Ginsburg
2021InterspeechHi-Fi Multi-Speaker English TTS Dataset.Evelina Bakhturina, Vitaly Lavrukhin, Boris Ginsburg, Yang Zhang
2021InterspeechTalkNet: Non-Autoregressive Depth-Wise Separable Convolutional Model for Speech Synthesis.Stanislav Beliaev, Boris Ginsburg
2021InterspeechSPGISpeech: 5, 000 Hours of Transcribed Financial Audio for Fully Formatted End-to-End Speech Recognition.Patrick K. O'Neill, Vitaly Lavrukhin, Somshubra Majumdar, Vahid Noroozi, Yuekai Zhang, Oleksii Kuchaiev, Jagadeesh Balam, Yuliya Dovzhenko, Keenan Freyberg, Michael D. Shulman, Boris Ginsburg, Shinji Watanabe, Georg Kucsko
2021InterspeechNeMo (Inverse) Text Normalization: From Development to Production.Yang Zhang, Evelina Bakhturina, Boris Ginsburg
2021InterspeechNeMo Inverse Text Normalization: From Development to Production.Yang Zhang, Evelina Bakhturina, Kyle Gorman, Boris Ginsburg
2020ICASSPCorrection of Automatic Speech Recognition with Transformer Sequence-To-Sequence Model.Oleksii Hrinchuk, Mariya Popova, Boris Ginsburg
2020ICASSPQuartznet: Deep Automatic Speech Recognition with 1D Time-Channel Separable Convolutions.Samuel Kriman, Stanislav Beliaev, Boris Ginsburg, Jocelyn Huang, Oleksii Kuchaiev, Vitaly Lavrukhin, Ryan Leary, Jason Li, Yang Zhang
2020InterspeechMatchboxNet: 1D Time-Channel Separable Convolutional Neural Network Architecture for Speech Commands Recognition.Somshubra Majumdar, Boris Ginsburg
2019InterspeechJasper: An End-to-End Convolutional Neural Acoustic Model.Jason Li, Vitaly Lavrukhin, Boris Ginsburg, Ryan Leary, Oleksii Kuchaiev, Jonathan M. Cohen, Huyen Nguyen, Ravi Teja Gadde
2018ICLRSpatially Parallel Convolutions.Peter H. Jin, Boris Ginsburg, Kurt Keutzer
2018ICLRMixed Precision Training.Paulius Micikevicius, Sharan Narang, Jonah Alben, Gregory F. Diamos, Erich Elsen, David Garca, Boris Ginsburg, Michael Houston, Oleksii Kuchaiev, Ganesh Venkatesh, Hao Wu
2017ICLRFactorization tricks for LSTM networks.Oleksii Kuchaiev, Boris Ginsburg
2017ICLROn Improving the Numerical Stability of Winograd Convolutions.Kevin Vincent, Kevin Stephano, Michael A. Frumkin, Boris Ginsburg, Julien Demouth
2002TACASThe ForSpec Temporal Logic: A New Temporal Property-Specification Language.Roy Armoni, Limor Fix, Alon Flaisher, Rob Gerth, Boris Ginsburg, Tomer Kanza, Avner Landver, Sela Mador-Haim, Eli Singerman, Andreas Tiemeyer, Moshe Y. Vardi, Yael Zbar