Testing across 60 scenarios shows ChatGPT-4o, Gemini 2.5 Flash, and Llama 3.1 8B fail to identify hazards when multiple sensors are simultaneously below individual safety limits. While models achieve near-perfect accuracy on single-sensor violations, they score near zero on multi-sensor joint assessments.
HOW THIS AFFECTS YOU
●
builderDo not rely on LLMs for safety-critical multi-sensor reasoning without significant external verification logic.
●
policyThis highlights critical safety risks in deploying LLMs for physical environment monitoring and automated response.