HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 3 days ago • 27
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 14 days ago • 101