eval-grader

SKILLWorkflowcommunauté
v0.0.0byerlikayaMITMis à jour il y a 9 jSource →

Measure output quality, don't vibe it: score a generative task with a two-layer grader — deterministic code metrics + per-dimension LLM-as-judge — over a fixed task set, as signed deltas vs a pinned baseline. Grades cost alongside correctness (pass-slow).

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
22Étoiles du dépôt
1Clients
1Formats
il y a 9 jDernière mise à jour
Skill
Auteurbyerlikaya
Version0.0.0
LicenceMIT
CatégorieWorkflow
Formatsskill.md
PromptNon publié
Compatibilité
Claude✓ Pris en charge
Cursor
Copilot
ChatGPT
Gemini
À propos

Measure output quality, don't vibe it: score a generative task with a two-layer grader — deterministic code metrics + per-dimension LLM-as-judge — over a fixed task set, as signed deltas vs a pinned baseline. Grades cost alongside correctness (pass-slow).

Mots-clés
skillclaude