Zhehuai Chen
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
43
Venues
6
Active years
2015–2026
Best venue rank
A*
Where they publish
Papers
43 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception. | Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang |
| 2025 | ACL | NeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model. | Yen-Ting Lin, Zhehuai Chen, Piotr Zelasko, Zhen Wan, Xuesong Yang, Zih-Ching Chen, Krishna C. Puvvada, Ke Hu, Szu-Wei Fu, Jun Wei Chiu, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Chao-Han Huck Yang |
| 2025 | ACL | SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models. | Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi |
| 2025 | ASRU | Open Full-duplex Voice Agent with Speech-to-Speech Language Model. | Edresson Casanova, Chen Chen, Kevin Hu, Ankita Pasad, Elena Rastorgueva, Seelan Lakshmi Narasimhan, Slyne Deng, Ehsan Hosseini-Asl, Piotr Zelasko, Valentin Mendelev, Subhankar Ghosh, Yifan Peng, Zhehuai Chen, Jason Li, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ICASSP | Chain-of-Thought Prompting for Speech Translation. | Ke Hu, Zhehuai Chen, Chao-Han Huck Yang, Piotr Zelasko, Oleksii Hrinchuk, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2025 | ICASSP | Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data. | Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-Yi Lee |
| 2025 | ICASSP | EMMeTT: Efficient Multimodal Machine Translation Training. | Piotr Zelasko, Zhehuai Chen, Mengru Wang, Daniel Galvez, Oleksii Hrinchuk, Shuoyang Ding, Ke Hu, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg |
| 2025 | ICLR | Audio Large Language Models Can Be Descriptive Speech Quality Evaluators. | Chen Chen, Yuchen Hu, Siyin Wang, Helin Wang, Zhehuai Chen, Chao Zhang, Chao-Han Huck Yang, Eng Siong Chng |
| 2025 | Interspeech | VoiceNoNG: Robust High-Quality Speech Editing Model without Hallucinations. | Sung-Feng Huang, Heng-Cheng Kuo, Zhehuai Chen, Xuesong Yang, Pin-Jui Ku, Ante Jukic, Huck Yang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee, Szu-Wei Fu |
| 2025 | Interspeech | Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model. | Ke Hu, Ehsan Hosseini-Asl, Chen Chen, Edresson Casanova, Subhankar Ghosh, Piotr Zelasko, Zhehuai Chen, Jason Li, Jagadeesh Balam, Boris Ginsburg |
| 2025 | Interspeech | Word Level Timestamp Generation for Automatic Speech Recognition and Translation. | Ke Hu, Krishna C. Puvvada, Elena Rastorgueva, Zhehuai Chen, He Huang, Shuoyang Ding, Kunal Dhawan, Hainan Xu, Jagadeesh Balam, Boris Ginsburg |
| 2025 | NAACL | Anticipating Future with Large Language Model for Simultaneous Machine Translation. | Siqi Ouyang, Oleksii Hrinchuk, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Lei Li, Boris Ginsburg |
| 2025 | NAACL | VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning. | Yifan Peng, Krishna C. Puvvada, Zhehuai Chen, Piotr Zelasko, He Huang, Kunal Dhawan, Ke Hu, Shinji Watanabe, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ACL | GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators. | Yuchen Hu, Chen Chen, Chao-Han Huck Yang, Ruizhe Li, Dong Zhang, Zhehuai Chen, Engsiong Chng |
| 2024 | ICASSP | SALM: Speech-Augmented Language Model with in-Context Learning for Speech Recognition and Translation. | Zhehuai Chen, He Huang, Andrei Andrusenko, Oleksii Hrinchuk, Krishna C. Puvvada, Jason Li, Subhankar Ghosh, Jagadeesh Balam, Boris Ginsburg |
| 2024 | ICASSP | Transducers with Pronunciation-Aware Embeddings for Automatic Speech Recognition. | Hainan Xu, Zhehuai Chen, Fei Jia, Boris Ginsburg |
| 2024 | Interspeech | DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment. | Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, He Huang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee |
| 2024 | Interspeech | Instruction Data Generation and Unsupervised Adaptation for Speech Language Models. | Vahid Noroozi, Zhehuai Chen, Somshubra Majumdar, Steve Huang, Jagadeesh Balam, Boris Ginsburg |
| 2024 | Interspeech | Less is More: Accurate Speech Recognition & Translation without Web-Scale Data. | Krishna C. Puvvada, Piotr Zelasko, He Huang, Oleksii Hrinchuk, Nithin Rao Koluguri, Kunal Dhawan, Somshubra Majumdar, Elena Rastorgueva, Zhehuai Chen, Vitaly Lavrukhin, Jagadeesh Balam, Boris Ginsburg |
| 2023 | ICASSP | Virtuoso: Massive Multilingual Speech-Text Joint Semi-Supervised Learning for Text-to-Speech. | Takaaki Saeki, Heiga Zen, Zhehuai Chen, Nobuyuki Morioka, Gary Wang, Yu Zhang, Ankur Bapna, Andrew Rosenberg, Bhuvana Ramabhadran |
| 2023 | ICASSP | Accelerating RNN-T Training and Inference Using CTC Guidance. | Yongqiang Wang, Zhehuai Chen, Chengjian Zheng, Yu Zhang, Wei Han, Parisa Haghani |
| 2023 | ICASSP | Understanding Shared Speech-Text Representations. | Gary Wang, Kyle Kastner, Ankur Bapna, Zhehuai Chen, Andrew Rosenberg, Bhuvana Ramabhadran, Yu Zhang |
| 2023 | Interspeech | Using Text Injection to Improve Recognition of Personal Identifiers in Speech. | Yochai Blau, Rohan Agrawal, Lior Madmony, Gary Wang, Andrew Rosenberg, Zhehuai Chen, Zorik Gekhman, Genady Beryozkin, Parisa Haghani, Bhuvana Ramabhadran |
| 2022 | ICASSP | Tts4pretrain 2.0: Advancing the use of Text and Speech in ASR Pretraining with Consistency and Contrastive Losses. | Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Gary Wang |
| 2022 | Interspeech | MAESTRO: Matched Speech Text Representations through Modality Matching. | Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Pedro J. Moreno, Ankur Bapna, Heiga Zen |
| 2022 | Interspeech | Unsupervised Data Selection via Discrete Speech Representation for ASR. | Zhiyun Lu, Yongqiang Wang, Yu Zhang, Wei Han, Zhehuai Chen, Parisa Haghani |
| 2021 | ASRU | Injecting Text in Self-Supervised Speech Pretraining. | Zhehuai Chen, Yu Zhang, Andrew Rosenberg, Bhuvana Ramabhadran, Gary Wang, Pedro J. Moreno |
| 2021 | ICASSP | An Asynchronous WFST-Based Decoder for Automatic Speech Recognition. | Hang Lv, Zhehuai Chen, Hainan Xu, Daniel Povey, Lei Xie, Sanjeev Khudanpur |
| 2021 | Interspeech | Conformer Parrotron: A Faster and Stronger End-to-End Speech Conversion and Recognition Model for Atypical Speech. | Zhehuai Chen, Bhuvana Ramabhadran, Fadi Biadsy, Xia Zhang, Youzheng Chen, Liyang Jiang, Fang Chu, Rohan Doshi, Pedro J. Moreno |
| 2021 | Interspeech | Semi-Supervision in ASR: Sequential MixMatch and Factorized TTS-Based Augmentation. | Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Heiga Zen, Mohammadreza Ghodsi, Yinghui Huang, Jesse Emond, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno |
| 2020 | ICASSP | Improving Speech Recognition Using Consistent Predictions on Synthesized Speech. | Gary Wang, Andrew Rosenberg, Zhehuai Chen, Yu Zhang, Bhuvana Ramabhadran, Yonghui Wu, Pedro J. Moreno |
| 2020 | Interspeech | Improving Speech Recognition Using GAN-Based Speech Synthesis and Contrastive Unspoken Text Selection. | Zhehuai Chen, Andrew Rosenberg, Yu Zhang, Gary Wang, Bhuvana Ramabhadran, Pedro J. Moreno |
| 2020 | Interspeech | SCADA: Stochastic, Consistent and Adversarial Data Augmentation to Improve ASR. | Gary Wang, Andrew Rosenberg, Zhehuai Chen, Yu Zhang, Bhuvana Ramabhadran, Pedro J. Moreno |
| 2019 | ASRU | Incremental Lattice Determinization for WFST Decoders. | Zhehuai Chen, Mahsa Yarmohammadi, Hainan Xu, Hang Lv, Lei Xie, Daniel Povey, Sanjeev Khudanpur |
| 2019 | ICASSP | End-to-end Contextual Speech Recognition Using Class Language Models and a Token Passing Decoder. | Zhehuai Chen, Mahaveer Jain, Yongqiang Wang, Michael L. Seltzer, Christian Fuegen |
| 2019 | Interspeech | Joint Grapheme and Phoneme Embeddings for Contextual End-to-End ASR. | Zhehuai Chen, Mahaveer Jain, Yongqiang Wang, Michael L. Seltzer, Christian Fuegen |
| 2018 | ICASSP | Sequence Modeling in Unsupervised Single-Channel Overlapped Speech Recognition. | Zhehuai Chen, Jasha Droppo |
| 2018 | ICASSP | On Modular Training of Neural Acoustics-to-Word Model for LVCSR. | Zhehuai Chen, Qi Liu, Hao Li, Kai Yu |
| 2018 | Interspeech | A GPU-based WFST Decoder with Exact Lattice Generation. | Zhehuai Chen, Justin Luitjens, Hainan Xu, Yiming Wang, Daniel Povey, Sanjeev Khudanpur |
| 2018 | Interspeech | Knowledge Distillation for Sequence Model. | Mingkun Huang, Yongbin You, Zhehuai Chen, Yanmin Qian, Kai Yu |
| 2017 | ICASSP | Confidence measures for CTC-based phone synchronous decoding. | Zhehuai Chen, Yimeng Zhuang, Kai Yu |
| 2016 | Interspeech | Phone Synchronous Decoding with CTC Lattice. | Zhehuai Chen, Wei Deng, Tao Xu, Kai Yu |
| 2015 | Interspeech | An investigation of context clustering for statistical speech synthesis with deep neural network. | Bo Chen, Zhehuai Chen, Jiachen Xu, Kai Yu |