ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation Paper • 2608.04436 • Published 5 days ago • 54
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion Paper • 2608.03974 • Published 6 days ago • 89
Meshy T2: Fast Native Mesh Generation with Flow Matching Paper • 2607.28675 • Published 13 days ago • 53
PhiZero: A World Model Built Around Physical Language Paper • 2607.28624 • Published 11 days ago • 167
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper • 2607.23855 • Published 15 days ago • 27
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents Paper • 2607.23588 • Published 15 days ago • 125
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing Paper • 2607.19064 • Published 20 days ago • 77
RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model Paper • 2607.17977 • Published 21 days ago • 198
HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement Paper • 2607.18217 • Published 21 days ago • 61
KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation Paper • 2607.14202 • Published 26 days ago • 42
Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget Paper • 2607.13125 • Published 23 days ago • 139
Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable Paper • 2607.13285 • Published 27 days ago • 232
view article Article Distillation in 2026 (so far): which frontier models use it and how sergiopaniego • Jul 8 • 19
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence Paper • 2607.07675 • Published Jul 8 • 64
AlayaWorld: Long-Horizon and Playable Video World Generation Paper • 2607.06291 • Published Jul 7 • 92