Reviews an AI-generated response or LLM application output for factual risks, hallucination patterns, and confidence calibration issues.
Reviews an AI-generated response or LLM application output for factual risks, hallucination patterns, and confidence calibration issues.