HUST, PKU
LocVTP. [ECCV 22] LocVTP: Video-Text Pre-training for Temporal Localization
39Continual-LLaVA.
16DCNet. [ACM MM 22] Correspondence Matters for Video Referring Expression Comprehension
15SpatialDreamer. SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
15MILO. Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
6Continual-RAG. Continual Retrieval-Augmented Generation for Large Vision-Language Models
1