PhD student at UPenn
Adversarial-Reasoning. A new algorithm that formulates jailbreaking as a reasoning problem.
FRPO. FRPO is a robust RLHF algorithm to prevent catastrophic forgetting.
InfoSFT. InfoSFT is a modified supervised fine-tuning algorithm that generalizes better and forgets less.