A good final answer can hide failures elsewhere in an AI agent. Test tool routing, evidence retrieval, rules, and model output separately