Reason Through the Latent! Making Latent Visual Reasoning Necessary Paper • 2609.06746 • Published 8 days ago • 36
Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval Paper • 2607.04605 • Published Jul 6 • 24
D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI Paper • 2510.05684 • Published Oct 7, 2025 • 148