This is your work, valued
LAVISH. Vision Transformers are Parameter-Efficient Audio-Visual Learners
ECLIPSE. Python
AVSiam. Siamese Vision Transformers are Scalable Audio-visual Learners
CM-Co-Occurrence-AVVP. Python
AVED. Python