A systematic evaluation of LLMs for Devanagari script correction shows that CharBM25 retrieval outperforms domain-random selection by up to 4.0pp absolute WER in Hindi and Marathi.
HOW THIS AFFECTS YOU
●
builderImplement character n-gram BM25 for more effective in-context learning in multilingual OCR pipelines.
●
researcherThe results confirm that character-level similarity is superior to semantic retrieval for error-pattern matching.