Boris Ginsburg
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
87
Venues
9
Active years
2002–2026
Best venue rank
A*
Where they publish
Papers
87 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech. | Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li |
| 2026 | ACL | Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models. | Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg |
| 2026 | ACL | Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception. | Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang |
| 2025 | ACL | NeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model. | Yen-Ting Lin, Zhehuai Chen, Piotr Zelasko, Zhen Wan, Xuesong Yang, Zih-Ching Chen, Krishna C. Puvvada, Ke Hu, Szu-Wei Fu, Jun Wei Chiu, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Chao-Han Huck Yang |
| 2025 | ACL | Genetic Instruct: Scaling up Synthetic Generation of Coding Instructions for Large Language Models. | Somshubra Majumdar, Vahid Noroozi, Mehrzad Samadi, Sean Narenthiran, Aleksander Ficek, Wasi Uddin Ahmad, Jocelyn Huang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ASRU | TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree. | Andrei Andrusenko, Vladimir Bataev, Lilit Grigoryan, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ASRU | Open Full-duplex Voice Agent with Speech-to-Speech Language Model. | Edresson Casanova, Chen Chen, Kevin Hu, Ankita Pasad, Elena Rastorgueva, Seelan Lakshmi Narasimhan, Slyne Deng, Ehsan Hosseini-Asl, Piotr Zelasko, Valentin Mendelev, Subhankar Ghosh, Yifan Peng, Zhehuai Chen, Jason Li, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ASRU | FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities. | Lilit Grigoryan, Vladimir Bataev, Nikolay Karpov, Andrei Andrusenko, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ASRU | Training and Inference Efficiency of Encoder-Decoder Speech Models. | Piotr Zelasko, Kunal Dhawan, Daniel Galvez, Krishna C. Puvvada, Ankita Pasad, Travis M. Bartley, Nithin Rao Koluguri, Ke Hu, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2025 | EMNLP | SWAN: An Efficient and Scalable Approach for Long-Context Language Modeling. | Krishna C. Puvvada, Faisal Ladhak, Santiago Akle Serano, Cheng-Ping Hsieh, Shantanu Acharya, Somshubra Majumdar, Fei Jia, Samuel Kriman, Simeng Sun, Dima Rekesh, Boris Ginsburg |
| 2025 | EMNLP | Extending Automatic Machine Translation Evaluation to Book-Length Documents. | Kuang-Da Wang, Shuoyang Ding, Chao-Han Huck Yang, Ping-Chun Hsieh, Wen-Chih Peng, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ICASSP | Open Automatic Speech Recognition Models for Classical and Modern Standard Arabic. | Lilit Grigoryan, Nikolay Karpov, Enas Albasiri, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ICASSP | NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks. | He Huang, Taejin Park, Kunal Dhawan, Ivan Medennikov, Krishna C. Puvvada, Nithin Rao Koluguri, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | Chain-of-Thought Prompting for Speech Translation. | Ke Hu, Zhehuai Chen, Chao-Han Huck Yang, Piotr Zelasko, Oleksii Hrinchuk, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data. | Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-Yi Lee |
| 2025 | ICASSP | META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR. | Jinhan Wang, Weiqing Wang, Kunal Dhawan, Taejin Park, Myungjong Kim, Ivan Medennikov, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | EMMeTT: Efficient Multimodal Machine Translation Training. | Piotr Zelasko, Zhehuai Chen, Mengru Wang, Daniel Galvez, Oleksii Hrinchuk, Shuoyang Ding, Ke Hu, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ICLR | nGPT: Normalized Transformer with Representation Learning on the Hypersphere. | Ilya Loshchilov, Cheng-Ping Hsieh, Simeng Sun, Boris Ginsburg |
| 2025 | ICLR | HAINAN: Fast and Accurate Transducer for Hybrid-Autoregressive ASR. | Hainan Xu, Travis M. Bartley, Vladimir Bataev, Boris Ginsburg |
| 2025 | ICML | Star Attention: Efficient LLM Inference over Long Sequences. | Shantanu Acharya, Fei Jia, Boris Ginsburg |
| 2025 | ICML | Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems. | Taejin Park, Ivan Medennikov, Kunal Dhawan, Weiqing Wang, He Huang, Nithin Rao Koluguri, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding. | Vladimir Bataev, Andrei Andrusenko, Lilit Grigoryan, Aleksandr Laptev, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | Interspeech | NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference. | Edresson Casanova, Paarth Neekhara, Ryan Langman, Shehzeen Hussain, Subhankar Ghosh, Xuesong Yang, Ante Jukic, Jason Li, Boris Ginsburg |
| 2025 | Interspeech | Pushing the Limits of Beam Search Decoding for Transducer-based ASR models. | Lilit Grigoryan, Vladimir Bataev, Andrei Andrusenko, Hainan Xu, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | Interspeech | SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription. | Raymond Grossman, Taejin Park, Kunal Dhawan, Andrew Titus, Sophia Zhi, Yulia Shchadilova, Weiqing Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model. | Ke Hu, Ehsan Hosseini-Asl, Chen Chen, Edresson Casanova, Subhankar Ghosh, Piotr Zelasko, Zhehuai Chen, Jason Li, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Word Level Timestamp Generation for Automatic Speech Recognition and Translation. | Ke Hu, Krishna C. Puvvada, Elena Rastorgueva, Zhehuai Chen, He Huang, Shuoyang Ding, Kunal Dhawan, Hainan Xu, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Granary: Speech Recognition and Translation Dataset in 25 European Languages. | Nithin Rao Koluguri, Monica Sekoyan, George Zelenfroynd, Sasha Meister, Shuoyang Ding, Sofia Kostandian, He Huang, Nikolay Karpov, Jagadeesh Balam, Vitaly Lavrukhin, Yifan Peng, Sara Papi, Marco Gaido, Alessio Brutti, Boris Ginsburg |
| 2025 | Interspeech | Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering. | Ivan Medennikov, Taejin Park, Weiqing Wang, He Huang, Kunal Dhawan, Jinhan Wang, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR. | Weiqing Wang, Taejin Park, Ivan Medennikov, Jinhan Wang, Kunal Dhawan, He Huang, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | WIND: Accelerated RNN-T Decoding with Windowed Inference for Non-blank Detection. | Hainan Xu, Vladimir Bataev, Lilit Grigoryan, Boris Ginsburg |
| 2025 | NAACL | Anticipating Future with Large Language Model for Simultaneous Machine Translation. | Siqi Ouyang, Oleksii Hrinchuk, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Lei Li, Boris Ginsburg |
| 2025 | NAACL | VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning. | Yifan Peng, Krishna C. Puvvada, Zhehuai Chen, Piotr Zelasko, He Huang, Kunal Dhawan, Ke Hu, Shinji Watanabe, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | A Chat about Boring Problems: Studying GPT-Based Text Normalization. | Yang Zhang, Travis M. Bartley, Mariana Graterol-Fuenmayor, Vitaly Lavrukhin, Evelina Bakhturina, Boris Ginsburg |
| 2024 | ICASSP | Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer. | Maxime Burchi, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg, Radu Timofte |
| 2024 | ICASSP | SALM: Speech-Augmented Language Model with in-Context Learning for Speech Recognition and Translation. | Zhehuai Chen, He Huang, Andrei Andrusenko, Oleksii Hrinchuk, Krishna C. Puvvada, Jason Li, Subhankar Ghosh, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Investigating End-to-End ASR Architectures for Long Form Audio Transcription. | Nithin Rao Koluguri, Samuel Kriman, Georgy Zelenfroind, Somshubra Majumdar, Dima Rekesh, Vahid Noroozi, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Stateful Conformer with Cache-Based Inference for Streaming Automatic Speech Recognition. | Vahid Noroozi, Somshubra Majumdar, Ankur Kumar, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Discrete Audio Representation as an Alternative to Mel-Spectrograms for Speaker and Speech Recognition. | Krishna C. Puvvada, Nithin Rao Koluguri, Kunal Dhawan, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Transducers with Pronunciation-Aware Embeddings for Automatic Speech Recognition. | Hainan Xu, Zhehuai Chen, Fei Jia, Boris Ginsburg |
| 2024 | ICML | SelfVC: Voice Conversion With Iterative Refinement using Self Transformations. | Paarth Neekhara, Shehzeen Samarah Hussain, Rafael Valle, Boris Ginsburg, Rishabh Ranjan, Shlomo Dubnov, Farinaz Koushanfar, Julian J. McAuley |
| 2024 | Interspeech | Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter. | Andrei Andrusenko, Aleksandr Laptev, Vladimir Bataev, Vitaly Lavrukhin, Boris Ginsburg |
| 2024 | Interspeech | Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations. | Kunal Dhawan, Nithin Rao Koluguri, Ante Jukic, Ryan Langman, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Schrdinger Bridge for Generative Speech Enhancement. | Ante Jukic, Roman Korostik, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment. | Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, He Huang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee |
| 2024 | Interspeech | Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment. | Paarth Neekhara, Shehzeen Hussain, Subhankar Ghosh, Jason Li, Boris Ginsburg |
| 2024 | Interspeech | Instruction Data Generation and Unsupervised Adaptation for Speech Language Models. | Vahid Noroozi, Zhehuai Chen, Somshubra Majumdar, Steve Huang, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Less is More: Accurate Speech Recognition & Translation without Web-Scale Data. | Krishna C. Puvvada, Piotr Zelasko, He Huang, Oleksii Hrinchuk, Nithin Rao Koluguri, Kunal Dhawan, Somshubra Majumdar, Elena Rastorgueva, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2023 | ASRU | LibriSpeech-PC: Benchmark for Evaluation of Punctuation and Capitalization Capabilities of End-to-End ASR Models. | Aleksandr Meister, Matvei Novikov, Nikolay Karpov, Evelina Bakhturina, Vitaly Lavrukhin, Boris Ginsburg |
| 2023 | ASRU | Fast Conformer With Linearly Scalable Attention For Efficient Speech Recognition. | Dima Rekesh, Nithin Rao Koluguri, Samuel Kriman, Somshubra Majumdar, Vahid Noroozi, He Huang, Oleksii Hrinchuk, Krishna C. Puvvada, Ankur Kumar, Jagadeesh Balam, Boris Ginsburg |
| 2023 | ICASSP | Vani: Very-Lightweight Accent-Controllable TTS for Native And Non-Native Speakers With Identity Preservation. | Rohan Badlani, Akshit Arora, Subhankar Ghosh, Rafael Valle, Kevin J. Shih, Joo Felipe Santos, Boris Ginsburg, Bryan Catanzaro |
| 2023 | ICASSP | Accidental Learners: Spoken Language Identification in Multilingual Self-Supervised Models. | Travis M. Bartley, Fei Jia, Krishna C. Puvvada, Samuel Kriman, Boris Ginsburg |
| 2023 | ICASSP | ACE-VC: Adaptive and Controllable Voice Conversion Using Explicitly Disentangled Self-Supervised Speech Representations. | Shehzeen Hussain, Paarth Neekhara, Jocelyn Huang, Jason Li, Boris Ginsburg |
| 2023 | ICASSP | Powerful and Extensible WFST Framework for Rnn-Transducer Losses. | Aleksandr Laptev, Vladimir Bataev, Igor Gitman, Boris Ginsburg |
| 2023 | ICASSP | Multi-Blank Transducers for Speech Recognition. | Hainan Xu, Fei Jia, Somshubra Majumdar, Shinji Watanabe, Boris Ginsburg |
| 2023 | ICASSP | Conformer-Based Target-Speaker Automatic Speech Recognition For Single-Channel Audio. | Yang Zhang, Krishna C. Puvvada, Vitaly Lavrukhin, Boris Ginsburg |
| 2023 | ICLR | BigVGAN: A Universal Neural Vocoder with Large-Scale Training. | Sang-gil Lee, Wei Ping, Boris Ginsburg, Bryan Catanzaro, Sungroh Yoon |
| 2023 | ICML | Efficient Sequence Transduction by Jointly Predicting Tokens and Durations. | Hainan Xu, Fei Jia, Somshubra Majumdar, He Huang, Shinji Watanabe, Boris Ginsburg |
| 2023 | Interspeech | SpellMapper: A non-autoregressive neural spellchecker for ASR customization with candidate retrieval based on n-gram mappings. | Alexandra Antonova, Evelina Bakhturina, Boris Ginsburg |
| 2023 | Interspeech | Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator. | Vladimir Bataev, Roman Korostik, Evgeny Shabalin, Vitaly Lavrukhin, Boris Ginsburg |
| 2023 | Interspeech | Confidence-based Ensembles of End-to-End Speech Recognition Models. | Igor Gitman, Vitaly Lavrukhin, Aleksandr Laptev, Boris Ginsburg |
| 2023 | Interspeech | Adapter-Based Extension of Multi-Speaker Text-To-Speech Model for New Speakers. | Cheng-Ping Hsieh, Subhankar Ghosh, Boris Ginsburg |
| 2023 | Interspeech | Leveraging Pretrained ASR Encoders for Effective and Efficient End-to-End Speech Intent Classification and Slot Filling. | He Huang, Jagadeesh Balam, Boris Ginsburg |
| 2023 | Interspeech | A Compact End-to-End Model with Local and Global Context for Spoken Language Identification. | Fei Jia, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2023 | Interspeech | NeMo Forced Aligner and its application to word alignment for subtitle generation. | Elena Rastorgueva, Vitaly Lavrukhin, Boris Ginsburg |
| 2022 | ICASSP | TitaNet: Neural Model for Speaker Representation with 1D Depth-Wise Separable Convolutions and Global Context. | Nithin Rao Koluguri, Taejin Park, Boris Ginsburg |
| 2022 | ICASSP | Mixer-TTS: Non-Autoregressive, Fast and Compact Text-to-Speech Model Conditioned on Language Model Embeddings. | Oktai Tatanov, Stanislav Beliaev, Boris Ginsburg |
| 2022 | Interspeech | Thutmose Tagger: Single-pass neural model for Inverse Text Normalization. | Alexandra Antonova, Evelina Bakhturina, Boris Ginsburg |
| 2022 | Interspeech | Shallow Fusion of Weighted Finite-State Transducer and Language Model for Text Normalization. | Evelina Bakhturina, Yang Zhang, Boris Ginsburg |
| 2022 | Interspeech | CTC Variations Through New WFST Topologies. | Aleksandr Laptev, Somshubra Majumdar, Boris Ginsburg |
| 2022 | Interspeech | Multi-scale Speaker Diarization with Dynamic Scale Weighting. | Taejin Park, Nithin Rao Koluguri, Jagadeesh Balam, Boris Ginsburg |
| 2022 | Interspeech | NeMo Open Source Speaker Diarization System. | Taejin Park, Nithin Rao Koluguri, Fei Jia, Jagadeesh Balam, Boris Ginsburg |
| 2021 | ICASSP | MarbleNet: Deep 1D Time-Channel Separable Convolutional Neural Network for Voice Activity Detection. | Fei Jia, Somshubra Majumdar, Boris Ginsburg |
| 2021 | Interspeech | Hi-Fi Multi-Speaker English TTS Dataset. | Evelina Bakhturina, Vitaly Lavrukhin, Boris Ginsburg, Yang Zhang |
| 2021 | Interspeech | TalkNet: Non-Autoregressive Depth-Wise Separable Convolutional Model for Speech Synthesis. | Stanislav Beliaev, Boris Ginsburg |
| 2021 | Interspeech | SPGISpeech: 5, 000 Hours of Transcribed Financial Audio for Fully Formatted End-to-End Speech Recognition. | Patrick K. O'Neill, Vitaly Lavrukhin, Somshubra Majumdar, Vahid Noroozi, Yuekai Zhang, Oleksii Kuchaiev, Jagadeesh Balam, Yuliya Dovzhenko, Keenan Freyberg, Michael D. Shulman, Boris Ginsburg, Shinji Watanabe, Georg Kucsko |
| 2021 | Interspeech | NeMo (Inverse) Text Normalization: From Development to Production. | Yang Zhang, Evelina Bakhturina, Boris Ginsburg |
| 2021 | Interspeech | NeMo Inverse Text Normalization: From Development to Production. | Yang Zhang, Evelina Bakhturina, Kyle Gorman, Boris Ginsburg |
| 2020 | ICASSP | Correction of Automatic Speech Recognition with Transformer Sequence-To-Sequence Model. | Oleksii Hrinchuk, Mariya Popova, Boris Ginsburg |
| 2020 | ICASSP | Quartznet: Deep Automatic Speech Recognition with 1D Time-Channel Separable Convolutions. | Samuel Kriman, Stanislav Beliaev, Boris Ginsburg, Jocelyn Huang, Oleksii Kuchaiev, Vitaly Lavrukhin, Ryan Leary, Jason Li, Yang Zhang |
| 2020 | Interspeech | MatchboxNet: 1D Time-Channel Separable Convolutional Neural Network Architecture for Speech Commands Recognition. | Somshubra Majumdar, Boris Ginsburg |
| 2019 | Interspeech | Jasper: An End-to-End Convolutional Neural Acoustic Model. | Jason Li, Vitaly Lavrukhin, Boris Ginsburg, Ryan Leary, Oleksii Kuchaiev, Jonathan M. Cohen, Huyen Nguyen, Ravi Teja Gadde |
| 2018 | ICLR | Spatially Parallel Convolutions. | Peter H. Jin, Boris Ginsburg, Kurt Keutzer |
| 2018 | ICLR | Mixed Precision Training. | Paulius Micikevicius, Sharan Narang, Jonah Alben, Gregory F. Diamos, Erich Elsen, David Garca, Boris Ginsburg, Michael Houston, Oleksii Kuchaiev, Ganesh Venkatesh, Hao Wu |
| 2017 | ICLR | Factorization tricks for LSTM networks. | Oleksii Kuchaiev, Boris Ginsburg |
| 2017 | ICLR | On Improving the Numerical Stability of Winograd Convolutions. | Kevin Vincent, Kevin Stephano, Michael A. Frumkin, Boris Ginsburg, Julien Demouth |
| 2002 | TACAS | The ForSpec Temporal Logic: A New Temporal Property-Specification Language. | Roy Armoni, Limor Fix, Alon Flaisher, Rob Gerth, Boris Ginsburg, Tomer Kanza, Avner Landver, Sela Mador-Haim, Eli Singerman, Andreas Tiemeyer, Moshe Y. Vardi, Yael Zbar |