SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning Paper • 2607.14777 • Published 7 days ago • 95
Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning Paper • 2607.07690 • Published 15 days ago • 4