shipshitdev-advanced-evaluation

SKILLWorkflowcommunauté
v0.0.0shipshitdevUnknownMis à jour il y a 5 jSource →

Design and operate LLM-as-a-Judge evaluation systems using direct scoring, pairwise comparison, rubric calibration, evaluator bias mitigation, confidence scoring, and automated quality assessment. Use when building LLM-as-judge systems, comparing model responses, calibrating rubrics, debugging incon

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
32Étoiles du dépôt
1Clients
1Formats
il y a 5 jDernière mise à jour
Skill
Auteurshipshitdev
Version0.0.0
LicenceUnknown
CatégorieWorkflow
Formatsskill.md
PromptNon publié
Compatibilité
Claude✓ Pris en charge
Cursor
Copilot
ChatGPT
Gemini
À propos

Design and operate LLM-as-a-Judge evaluation systems using direct scoring, pairwise comparison, rubric calibration, evaluator bias mitigation, confidence scoring, and automated quality assessment. Use when building LLM-as-judge systems, comparing model responses, calibrating rubrics, debugging inconsistent evaluations, or designing A/B tests for prompt or model changes.

Mots-clés
skillclaude