Diversity and complementarity of speech encoders across diverse tasks in a multi-modal large language model.
Jeremy H. M. Wong, Muhammad Huzaifah, Hardik B. Sailor, Shuo Sun, Kye Min Tan, Bin Wang, Qiongqiong Wang, Wenyu Zhang, Xunlong Zou, Nancy F. Chen, Ai Ti Aw
Browse the full ASRU paper archive.