SAF-OPD: Stable Advantage Fusion for On-Policy Distillation Paper • 2607.29209 • Published 27 days ago • 34
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published 21 days ago • 100
OPD-V: Visual On-Policy Self-Distillation with Modality Balance Paper • 2608.05131 • Published 21 days ago • 14