PhD candidate. Research area: Action Recognition, Multimodal Large Language Models.
Bay-CAT. [ECCV’24] Official Implementation for CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
59Sugar_ActionRecognition. [AAAI’26] Official Implementation for SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition
7MCD-forAVQA. Official Implementation for Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
6AudioVisual_Confusion. [AAAI’26] Official Implementation for When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?
5Ppromo-IAR. [IEEE SPL] Official Implementation for Pose-promote: Progressive Visual Perception for Indoor Action Recognition
3