Skip to content

Bridging the Temporal Gap in Multimodal LLMs: Deeply Stacking Temporal Tokens for Audio-Visual Speech Recognition.

Liyong Wang, Junliang Xing, Tianyu Hu, Jianfei Jiang, Jihuai Zhao, Huimin Ma

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.