Multimodal-VLMs. A comprehensive Gradio-based interface for running multiple state-of-the-art Vision-Language Models (VLMs) for Optical Character Recognition (OCR) and Visual Question Answering (VQA) tasks.

github.com/PRITHIVSAKTHIUR/Multimodal-VLMs

Vaya's read on this project

Problem, audience, market, and the verdict — sign in to see it.

Updates

No recent activity.