WorldToken Enables Robotic Imitation via Time-First Sequence Modeling
August 22, 2026
WorldToken fuses multiview images, proprioception, and task conditioning into a single world token per timestep for a causal temporal Transformer. An 85.3M-parameter policy achieved 59.45% mean closed-loop success on 23 RoboCasa tasks using only 2,900 demonstrations.
HOW THIS AFFECTS YOU
●
builderYou can use more efficient tokenization strategies for multi-modal robotic policies.
●
researcherThis provides a scalable architecture for time-first sequence modeling in robotics.