OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 14 days ago • 252
MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models Paper • 2607.27637 • Published 14 days ago • 6
OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models Paper • 2608.03812 • Published 10 days ago • 27
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 20 days ago • 105