Text-Enhanced Audio Encoder for Large Language Model based Speech Recognition via Cross-Modality Pre-training with Unpaired Audio-Text Data.
Hang Su, Yuxiang Kong, Lichun Fan, Jian Luan
Browse the full Interspeech paper archive.
Hang Su, Yuxiang Kong, Lichun Fan, Jian Luan
Browse the full Interspeech paper archive.