Self-Supervised Audio-Visual Speech Representations Learning by Multimodal Self-Distillation.
Jing-Xuan Zhang, Genshun Wan, Zhen-Hua Ling, Jia Pan, Jianqing Gao, Cong Liu
Browse the full ICASSP paper archive.
Jing-Xuan Zhang, Genshun Wan, Zhen-Hua Ling, Jia Pan, Jianqing Gao, Cong Liu
Browse the full ICASSP paper archive.