D2Skill-AgenticRL. Dynamic dual-granularity skill bank for agentic RL, jointly evolving policy and skills to improve long-horizon decision making in agentic tasks.
71PaperAudit. Python
25DPO-VP. Improving Math reasoning through Direct Preference Optimization with Verifiable Pairs
20DTR. [AAAI'25] Code for "In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning"
14RL-SaLLM-F. [AAMAS'25] Code for "Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model"
12AutoThink-Preview. This repository implements AutoThink in our paper: Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
11CapPO.
1