OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models Paper • 2608.03812 • Published 1 day ago • 20
RefCaptioner: Multi-Reference Image-Grounded Video Captioning Paper • 2607.28509 • Published 7 days ago • 30
Beacon: Knowing When and How to Perform Agentic Visual Reasoning Paper • 2607.28595 • Published 7 days ago • 52