OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 13 days ago • 159
JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles Paper • 2607.27670 • Published 10 days ago • 7
SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification Paper • 2608.08786 • Published 5 days ago • 5
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation Paper • 2608.02287 • Published 11 days ago • 31
Evaluation-Verification Reward for Consistent Multi-Reference Image Editing Paper • 2607.29025 • Published 14 days ago • 16