ai-evaluation

SKILLWorkflowcommunity
v0.0.0sunnypatneediNOASSERTIONUpdated 5mo agoSource →

Systematic evaluation (evals) for LLM and AI products. Design test cases, measure accuracy/quality, track regressions, benchmark models, and build continuous evaluation pipelines. Distinct from traditional software testing with probabilistic outputs.

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
11Repo stars
1Clients
1Formats
5mo agoLast update
Skill
Authorsunnypatneedi
Version0.0.0
LicenseNOASSERTION
CategoryWorkflow
Formatsskill.md
PromptNot published
Compatibility
Claude✓ Supported
Cursor
Copilot
ChatGPT
Gemini
About

Systematic evaluation (evals) for LLM and AI products. Design test cases, measure accuracy/quality, track regressions, benchmark models, and build continuous evaluation pipelines. Distinct from traditional software testing with probabilistic outputs.

Keywords
skillclaude