Tsinghua University, Senior Student
Octopus. [ECCV2024] πOctopus, an embodied vision-language model trained with RLEF, emerging superior in embodied visual planning and programming.
301Insight-V. [CVPR2025 Highlight] Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
240Chain-of-Spot. Chain-of-Spot: Interactive Reasoning Improves Large Vision-language Models
100Demo-ICL. Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
41C2P. [CVPR2023]Complete-to-Partial 4D Distillation for Self-Supervised Point Cloud Sequence Representation Learning
16Awesome_Think_With_Images. Resources and paper list for "Thinking with Images for LVLMs". This repository accompanies our survey on how LVLMs can leverage visual information for complex reasoning, planning, and generation.
1VLMEvalKit. Open-source evaluation toolkit of large vision-language models (LVLMs), support 160+ VLMs, 50+ benchmarks
1