ai-evaluation

SKILLFlujo de trabajocomunidad
v0.0.0sunnypatneediNOASSERTIONActualizado hace 5 mFuente →

Systematic evaluation (evals) for LLM and AI products. Design test cases, measure accuracy/quality, track regressions, benchmark models, and build continuous evaluation pipelines. Distinct from traditional software testing with probabilistic outputs.

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
11Estrellas del repo
1Clientes
1Formatos
hace 5 mÚltima actualización
Skill
Autorsunnypatneedi
Versión0.0.0
LicenciaNOASSERTION
CategoríaFlujo de trabajo
Formatosskill.md
PromptNo publicado
Compatibilidad
Claude✓ Compatible
Cursor
Copilot
ChatGPT
Gemini
Acerca de

Systematic evaluation (evals) for LLM and AI products. Design test cases, measure accuracy/quality, track regressions, benchmark models, and build continuous evaluation pipelines. Distinct from traditional software testing with probabilistic outputs.

Palabras clave
skillclaude