evaluating-llms-harness

SKILLFlujo de trabajocomunidad
v0.0.0OpenRaiserMITActualizado hace 2 mFuente →

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vL

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
1kEstrellas del repo
1Clientes
1Formatos
hace 2 mÚltima actualización
Skill
AutorOpenRaiser
Versión0.0.0
LicenciaMIT
CategoríaFlujo de trabajo
Formatosskill.md
PromptAbrir (ver la pestaña Prompt)
Compatibilidad
Claude✓ Compatible
Cursor
Copilot
ChatGPT
Gemini
Acerca de

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vLLM, APIs.

Palabras clave
skillclaude