[arXiv]score: 0.18
FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents
July 30, 2026
FinCacheServe enables dependency-consistent answer reuse for RAG systems by indexing responses using document versions, evidence fingerprints, and model configurations. A vLLM implementation using Qwen2.5 models achieved a 53.31% LLM call reduction on 32B parameter workloads, outperforming versioned semantic caching's 38.97% hit rate while maintaining zero stale outputs.
DAILY DIGEST
you don't check 9 sources — we do. one email every morning, read in 2 min. free. unsubscribe anytime. privacy