Multimodal Machine Learning Research
CCoT. [CVPR 2024] Official Code for the Paper "Compositional Chain-of-Thought Prompting for Large Multimodal Models"
142CHAI. Official Codebase for CVPR 2026 Highlight Paper: "Building a Precise Video Language with Human–AI Oversight"
139SAVs. Official Codebase for "Generative Multimodal Model Features Are Discriminative Vision-Language Classifiers"
26cambench_ft. Modified LLaMA-Factory Finetuning Code
12CS182_All_About_Autoencoders. CS182 Final Project on Autoencoder Architectures!
5t2v_metrics. Evaluating text-to-image/video/3D models with VQAScore
4VLM_taskvec. Python
2