This is your work, valued
A-PO. Accelerating RL for LLM Reasoning with Optimal Advantage Regression
41REBEL. Reinforcement Learning via Regressing Relative Rewards
40REFUEL. Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF
25Reviewer2. Optimizing Review Generation Through Prompt Generation
18LangPTune. End-to-end Training for Recommendation with Language-based User Profiles
12TD-VAE-CF. Mitigating the Filter Bubble while Maintaining Relevance: Targeted Diversification with VAE-based Recommender Systems
10KDD2025. Python
1