Skip to content

Text-Enhanced Audio Encoder for Large Language Model based Speech Recognition via Cross-Modality Pre-training with Unpaired Audio-Text Data.

Hang Su, Yuxiang Kong, Lichun Fan, Jian Luan

Year2025
ProceedingsINTERSPEECH

Browse the full Interspeech paper archive.