OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains Paper • 2606.14702 • Published Jun 12 • 31
Running on Zero Agents 78 SAM2 Image Predictor 🔥 78 Generate object masks from an image with point guidance
C3: A Bilingual Benchmark for Spoken Dialogue Models Exploring Challenges in Complex Conversations Paper • 2507.22968 • Published Jul 30, 2025 • 25