EchoWM Omnimodal World Model for Continuous Navigation
August 23, 2026
EchoWM generates 720p video, environmental sound, music, and speech in response to continuous 6-DoF camera trajectories. It maps discrete commands and continuous poses to a shared metric-scale trajectory using progressive training and autoregressive post-training for long-horizon generation.
HOW THIS AFFECTS YOU
●
builderYou can integrate continuous camera intent into generative media pipelines.
●
researcherYou can explore new methods for joint audio-visual trajectory control.