JigShape uses interlocking jigsaw puzzles to evaluate visual-geometric reasoning in Vision-Language Models (VLMs). Testing shows frontier models like GPT-5.5 struggle with geometric constraints, with performance collapsing as puzzle grid density increases from 4x4 to 12x12.
HOW THIS AFFECTS YOU
●
builderDo not rely on frontier VLMs for complex spatial or geometric manipulation tasks without additional fine-tuning.
●
researcherThis exposes a specific failure mode in VLM spatial reasoning that current scaling laws do not address.