llama.cpp adds multi-device model row-split support
September 11, 2026
The llama.cpp repository now supports multi-device model splitting, specifically via row-splitting in the ggml backend. This allows larger models to be distributed across multiple hardware devices during inference.
HOW THIS AFFECTS YOU
●
builderYou can now run larger models across multiple GPUs or devices more efficiently using llama.cpp.