GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Paper • 2608.05747 • Published 5 days ago • 42
Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing Paper • 2608.02711 • Published 8 days ago • 86
Scaling Properties of Text Conditioning in Visual Generation Paper • 2607.29679 • Published 11 days ago • 38