This is your work, valued
DCM_vgg_transformer. Dual cross modality attention audio-visual speech recognition model based on vgg transformer with hybrid CTC/attention architecture using fairseq
14dual_cross_modality-AVSR. The audio visual speech recognition model which dual cross modality attention based on sigmedia-AVSR code
2avsr-chain. Audio-Visual Speech Recognition using chain model in kaldi toolkit
2