[r/LocalLLaMA]score: 0.22NInfer Engine Achieves 542 tok/s for Qwen3.6-35B on RTX 5090July 20, 2026The NInfer C++/CUDA inference engine reaches 542 tokens per second for Qwen3.6-35B-A3B during a 65K-token generation on a single RTX 5090.HOW THIS AFFECTS YOU●builderYou can achieve extremely high throughput for large models on consumer-grade hardware using custom-optimized kernels.read original ↗reddit.comDAILY DIGEST_all newsbuilderresearcherfounderinvestordesignerpolicyhealthsubscribe →you don't check 9 sources — we do. one email every morning, read in 2 min. free. unsubscribe anytime. privacy← back to feed