OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 13 days ago • 182
360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents Paper • 2608.08814 • Published 5 days ago • 10
MameLoshnLM: Yiddish Language Model and Evaluation Benchmark Paper • 2608.05850 • Published 8 days ago • 22
Invisible Shortcuts: Why Vision Encoders Know Your Camera Paper • 2608.05424 • Published 9 days ago • 17
Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval Paper • 2608.06060 • Published 8 days ago • 40
TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning Paper • 2608.04007 • Published 9 days ago • 19
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering Paper • 2607.28568 • Published 15 days ago • 183