ROWBench: Do Video Models Render What the Program Specifies? Paper • 2610.02205 • Published 6 days ago • 70
PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop Paper • 2610.00559 • Published 7 days ago • 30
World Observer: Joint Actor-Observer Generation for Persistent World Modeling Paper • 2610.02162 • Published 6 days ago • 85
MolmoAct2: Action Reasoning Models for Real-world Deployment Paper • 2605.02881 • Published May 4 • 358
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling Paper • 2608.15089 • Published Aug 15 • 452
LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence Paper • 2609.17488 • Published 22 days ago • 817