This is your work, valued
lmms-finetune. A minimal codebase for finetuning large multimodal models, supporting llava-1.5/1.6, llava-interleave, llava-next-video, llava-onevision, llama-3.2-vision, qwen-vl, qwen2-vl, phi3-v etc.
373VLM-Visualizer. Visualizing the attention of vision-language models
304mink-plus-plus. [ICLR'25 Spotlight] Min-K%++: Improved baseline for detecting pre-training data of LLMs
59DVERGE. [NeurIPS'20 Oral] DVERGE: Diversifying Vulnerabilities for Enhanced Robust Generation of Ensembles
55controlnet_tile. Workable training script for ControlNet tile
35MixOE. [WACV'23] Mixture Outlier Exposure for Out-of-Distribution Detection in Fine-grained Environments
26Awesome-Byte-LLM. A curated list of papers and resources on byte-based large language models (LLMs) — models that operate directly on raw bytes.
15PrivacyAttack_AT_FL. [CVPRW'22] A privacy attack that exploits Adversarial Training models to compromise the privacy of Federated Learning systems.
12bitslice_sparsity. Codes for our paper "Exploring Bit-Slice Sparsity in Deep Neural Networks for Efficient ReRAM-Based Deployment" [NeurIPS'19 EMC2 workshop].
10StreamDiffusion. StreamDiffusion: A Pipeline-Level Solution for Real-Time Interactive Generation
4SIO. Official PyTorch implementation for "SIO: Synthetic In-Distribution Data Benefits Out-of-Distribution Detection"
2open_clip. An open source implementation of CLIP.
1diffusers. 🤗 Diffusers: State-of-the-art diffusion models for image and audio generation in PyTorch and FLAX.
1igligen. Improved Implementation for Training GLIGEN: Open-Set Grounded Text-to-Image Generation
1zjysteven.github.io. Personal website
1