Skip to content

CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios.

Qilang Ye, Zitong Yu, Rui Shao, Xinyu Xie, Philip Torr, Xiaochun Cao

VenueA*ECCV
Year2024
ProceedingsECCV (10)

Browse the full ECCV paper archive.