Rare find

Self-Rewarding LM. Train AI models that grade and improve their own answers.

github.com/lucidrains/self-rewarding-lm-pytorch

Vaya's read on this project

Problem, audience, market, and the verdict — sign in to see it.

Updates

April 2024
  • Release —0.2.12
  • 0.2.12
  • Merge pull request #29 from Control-derek/derek
  • Fixed label mask error
  • Fixed deep copy, shallow copy problem
March 2024
  • Release —0.2.11
  • 0.2.11
  • Merge pull request #28 from Control-derek/derek
  • config.
  • Release —0.2.10
  • 0.2.10
  • Merge pull request #27 from Control-derek/derek
  • step->self.steps
  • Release —0.2.9
  • patch
  • Merge pull request #26 from Control-derek/derek
  • add self.
February 2024
  • Release —0.2.8
  • fix type error
  • Merge pull request #19 from ViswanathaReddyGajjala/patch-1
  • Fix TypeError for is_valid_reward in SelfRewardDPOConfig
  • Release —0.2.7
  • patch
  • Merge pull request #17 from unaidedelf8777/patch-1
  • Update self_rewarding_lm_pytorch.py
  • allow for an external LLM to play as reward model, as in OAIF
  • Release —0.2.6
  • Release —0.2.5
  • Release —0.2.4
  • Release —0.2.3