This is your work, valued
CMBS. cross modal background suppression for audio-visual event localization
Spoken-Video-Grounding. Video-Guided Curriculum Learning for Spoken Video Grounding