NEFTune. Official repository of NEFTune: Noisy Embeddings Improves Instruction Finetuning
412BYOD. The Official Repository for "Bring Your Own Data! Self-Supervised Evaluation for Large Language Models"
108baseline-defenses. Official Code for "Baseline Defenses for Adversarial Attacks Against Aligned Language Models"
34refusal-tokens. This is the official repo for "Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models"
11