This is your work, valued

United States

Jingyang Zhang

Advanced
@zjysteven

Research Scientist @ MSL | Ph.D. @ Duke

lmms-finetune. A minimal codebase for finetuning large multimodal models, supporting llava-1.5/1.6, llava-interleave, llava-next-video, llava-onevision, llama-3.2-vision, qwen-vl, qwen2-vl, phi3-v etc.

373

VLM-Visualizer. Visualizing the attention of vision-language models

304

mink-plus-plus. [ICLR'25 Spotlight] Min-K%++: Improved baseline for detecting pre-training data of LLMs

59

DVERGE. [NeurIPS'20 Oral] DVERGE: Diversifying Vulnerabilities for Enhanced Robust Generation of Ensembles

55

controlnet_tile. Workable training script for ControlNet tile

35

MixOE. [WACV'23] Mixture Outlier Exposure for Out-of-Distribution Detection in Fine-grained Environments

26

Awesome-Byte-LLM. A curated list of papers and resources on byte-based large language models (LLMs) — models that operate directly on raw bytes.

15

PrivacyAttack_AT_FL. [CVPRW'22] A privacy attack that exploits Adversarial Training models to compromise the privacy of Federated Learning systems.

12

bitslice_sparsity. Codes for our paper "Exploring Bit-Slice Sparsity in Deep Neural Networks for Efficient ReRAM-Based Deployment" [NeurIPS'19 EMC2 workshop].

10

StreamDiffusion. StreamDiffusion: A Pipeline-Level Solution for Real-Time Interactive Generation

4

SIO. Official PyTorch implementation for "SIO: Synthetic In-Distribution Data Benefits Out-of-Distribution Detection"

2

open_clip. An open source implementation of CLIP.

1

diffusers. 🤗 Diffusers: State-of-the-art diffusion models for image and audio generation in PyTorch and FLAX.

1

igligen. Improved Implementation for Training GLIGEN: Open-Set Grounded Text-to-Image Generation

1

zjysteven.github.io. Personal website

1