Skip to content

Zhehuai Chen

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

43

Venues

6

Active years

2015–2026

Best venue rank

A*

Where they publish

Papers

43 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLSpeech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception.Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang
2025ACLNeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model.Yen-Ting Lin, Zhehuai Chen, Piotr Zelasko, Zhen Wan, Xuesong Yang, Zih-Ching Chen, Krishna C. Puvvada, Ke Hu, Szu-Wei Fu, Jun Wei Chiu, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Chao-Han Huck Yang
2025ACLSpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models.Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi
2025ASRUOpen Full-duplex Voice Agent with Speech-to-Speech Language Model.Edresson Casanova, Chen Chen, Kevin Hu, Ankita Pasad, Elena Rastorgueva, Seelan Lakshmi Narasimhan, Slyne Deng, Ehsan Hosseini-Asl, Piotr Zelasko, Valentin Mendelev, Subhankar Ghosh, Yifan Peng, Zhehuai Chen, Jason Li, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg
2025ICASSPChain-of-Thought Prompting for Speech Translation.Ke Hu, Zhehuai Chen, Chao-Han Huck Yang, Piotr Zelasko, Oleksii Hrinchuk, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg
2025ICASSPDeveloping Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data.Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-Yi Lee
2025ICASSPEMMeTT: Efficient Multimodal Machine Translation Training.Piotr Zelasko, Zhehuai Chen, Mengru Wang, Daniel Galvez, Oleksii Hrinchuk, Shuoyang Ding, Ke Hu, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg
2025ICLRAudio Large Language Models Can Be Descriptive Speech Quality Evaluators.Chen Chen, Yuchen Hu, Siyin Wang, Helin Wang, Zhehuai Chen, Chao Zhang, Chao-Han Huck Yang, Eng Siong Chng
2025InterspeechVoiceNoNG: Robust High-Quality Speech Editing Model without Hallucinations.Sung-Feng Huang, Heng-Cheng Kuo, Zhehuai Chen, Xuesong Yang, Pin-Jui Ku, Ante Jukic, Huck Yang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee, Szu-Wei Fu
2025InterspeechEfficient and Direct Duplex Modeling for Speech-to-Speech Language Model.Ke Hu, Ehsan Hosseini-Asl, Chen Chen, Edresson Casanova, Subhankar Ghosh, Piotr Zelasko, Zhehuai Chen, Jason Li, Jagadeesh Balam, Boris Ginsburg
2025InterspeechWord Level Timestamp Generation for Automatic Speech Recognition and Translation.Ke Hu, Krishna C. Puvvada, Elena Rastorgueva, Zhehuai Chen, He Huang, Shuoyang Ding, Kunal Dhawan, Hainan Xu, Jagadeesh Balam, Boris Ginsburg
2025NAACLAnticipating Future with Large Language Model for Simultaneous Machine Translation.Siqi Ouyang, Oleksii Hrinchuk, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Lei Li, Boris Ginsburg
2025NAACLVoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning.Yifan Peng, Krishna C. Puvvada, Zhehuai Chen, Piotr Zelasko, He Huang, Kunal Dhawan, Ke Hu, Shinji Watanabe, Jagadeesh Balam, Boris Ginsburg
2024ACLGenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators.Yuchen Hu, Chen Chen, Chao-Han Huck Yang, Ruizhe Li, Dong Zhang, Zhehuai Chen, Engsiong Chng
2024ICASSPSALM: Speech-Augmented Language Model with in-Context Learning for Speech Recognition and Translation.Zhehuai Chen, He Huang, Andrei Andrusenko, Oleksii Hrinchuk, Krishna C. Puvvada, Jason Li, Subhankar Ghosh, Jagadeesh Balam, Boris Ginsburg
2024ICASSPTransducers with Pronunciation-Aware Embeddings for Automatic Speech Recognition.Hainan Xu, Zhehuai Chen, Fei Jia, Boris Ginsburg
2024InterspeechDeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment.Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, He Huang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee
2024InterspeechInstruction Data Generation and Unsupervised Adaptation for Speech Language Models.Vahid Noroozi, Zhehuai Chen, Somshubra Majumdar, Steve Huang, Jagadeesh Balam, Boris Ginsburg
2024InterspeechLess is More: Accurate Speech Recognition & Translation without Web-Scale Data.Krishna C. Puvvada, Piotr Zelasko, He Huang, Oleksii Hrinchuk, Nithin Rao Koluguri, Kunal Dhawan, Somshubra Majumdar, Elena Rastorgueva, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg
2023ICASSPVirtuoso: Massive Multilingual Speech-Text Joint Semi-Supervised Learning for Text-to-Speech.Takaaki Saeki, Heiga Zen, Zhehuai Chen, Nobuyuki Morioka, Gary Wang, Yu Zhang, Ankur Bapna, Andrew Rosenberg, Bhuvana Ramabhadran
2023ICASSPAccelerating RNN-T Training and Inference Using CTC Guidance.Yongqiang Wang, Zhehuai Chen, Chengjian Zheng, Yu Zhang, Wei Han, Parisa Haghani
2023ICASSPUnderstanding Shared Speech-Text Representations.Gary Wang, Kyle Kastner, Ankur Bapna, Zhehuai Chen, Andrew Rosenberg, Bhuvana Ramabhadran, Yu Zhang
2023InterspeechUsing Text Injection to Improve Recognition of Personal Identifiers in Speech.Yochai Blau, Rohan Agrawal, Lior Madmony, Gary Wang, Andrew Rosenberg, Zhehuai Chen, Zorik Gekhman, Genady Beryozkin, Parisa Haghani, Bhuvana Ramabhadran
2022ICASSPTts4pretrain 2.0: Advancing the use of Text and Speech in ASR Pretraining with Consistency and Contrastive Losses.Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Gary Wang
2022InterspeechMAESTRO: Matched Speech Text Representations through Modality Matching.Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Ankur Bapna, Heiga Zen
2022InterspeechUnsupervised Data Selection via Discrete Speech Representation for ASR.Zhiyun Lu, Yongqiang Wang, Yu Zhang, Wei Han, Zhehuai Chen, Parisa Haghani
2021ASRUInjecting Text in Self-Supervised Speech Pretraining.Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Gary Wang, Pedro J. Moreno
2021ICASSPAn Asynchronous WFST-Based Decoder for Automatic Speech Recognition.Hang Lv, Zhehuai Chen, Hainan Xu, Daniel Povey, Lei Xie, Sanjeev Khudanpur
2021InterspeechConformer Parrotron: A Faster and Stronger End-to-End Speech Conversion and Recognition Model for Atypical Speech.Zhehuai Chen, Bhuvana Ramabhadran, Fadi Biadsy, Xia Zhang, Youzheng Chen, Liyang Jiang, Fang Chu, Rohan Doshi, Pedro J. Moreno
2021InterspeechSemi-Supervision in ASR: Sequential MixMatch and Factorized TTS-Based Augmentation.Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Heiga Zen, Mohammadreza Ghodsi, Yinghui Huang, Jesse Emond, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno
2020ICASSPImproving Speech Recognition Using Consistent Predictions on Synthesized Speech.Gary Wang, Andrew Rosenberg, Zhehuai Chen, Yu Zhang, Bhuvana Ramabhadran, Yonghui Wu, Pedro J. Moreno
2020InterspeechImproving Speech Recognition Using GAN-Based Speech Synthesis and Contrastive Unspoken Text Selection.Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno
2020InterspeechSCADA: Stochastic, Consistent and Adversarial Data Augmentation to Improve ASR.Gary Wang, Andrew Rosenberg, Zhehuai Chen, Yu Zhang, Bhuvana Ramabhadran, Pedro J. Moreno
2019ASRUIncremental Lattice Determinization for WFST Decoders.Zhehuai Chen, Mahsa Yarmohammadi, Hainan Xu, Hang Lv, Lei Xie, Daniel Povey, Sanjeev Khudanpur
2019ICASSPEnd-to-end Contextual Speech Recognition Using Class Language Models and a Token Passing Decoder.Zhehuai Chen, Mahaveer Jain, Yongqiang Wang, Michael L. Seltzer, Christian Fuegen
2019InterspeechJoint Grapheme and Phoneme Embeddings for Contextual End-to-End ASR.Zhehuai Chen, Mahaveer Jain, Yongqiang Wang, Michael L. Seltzer, Christian Fuegen
2018ICASSPSequence Modeling in Unsupervised Single-Channel Overlapped Speech Recognition.Zhehuai Chen, Jasha Droppo
2018ICASSPOn Modular Training of Neural Acoustics-to-Word Model for LVCSR.Zhehuai Chen, Qi Liu, Hao Li, Kai Yu
2018InterspeechA GPU-based WFST Decoder with Exact Lattice Generation.Zhehuai Chen, Justin Luitjens, Hainan Xu, Yiming Wang, Daniel Povey, Sanjeev Khudanpur
2018InterspeechKnowledge Distillation for Sequence Model.Mingkun Huang, Yongbin You, Zhehuai Chen, Yanmin Qian, Kai Yu
2017ICASSPConfidence measures for CTC-based phone synchronous decoding.Zhehuai Chen, Yimeng Zhuang, Kai Yu
2016InterspeechPhone Synchronous Decoding with CTC Lattice.Zhehuai Chen, Wei Deng, Tao Xu, Kai Yu
2015InterspeechAn investigation of context clustering for statistical speech synthesis with deep neural network.Bo Chen, Zhehuai Chen, Jiachen Xu, Kai Yu