RL research.
onpolicybaselines. on-policy optimization baselines for deep reinforcement learning
32icml2021-pengqlambda. Revisiting Peng's Q(lambda) for Modern Reinforcement Learning
15neurips2021-meta-gradient-offpolicy-evaluation. Code for Unifying Gradient Estimators for Meta-Reinforcement Learning via Off-Policy Evaluation @ NeurIPS 2021
13nstep-sil. Code for NeurIPS 2020 paper 'Self-imitation Learning via Generalized Lower bound Q-learning'
12Variational-DQN. Variational DQN encourages efficient exploration and allows for parameter update using black box variational inference
9