llm-inference-scaling

SKILLFlujo de trabajocomunidad
v0.0.0BagelHoleMITActualizado hace 4 mFuente →

Auto-scale LLM inference clusters on Kubernetes using KEDA, custom GPU metrics, and horizontal pod autoscaling. Handle traffic spikes, implement queue-based scaling, and optimize cost with spot instances for AI workloads.

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
47Estrellas del repo
1Clientes
1Formatos
hace 4 mÚltima actualización
Skill
AutorBagelHole
Versión0.0.0
LicenciaMIT
CategoríaFlujo de trabajo
Formatosskill.md
PromptNo publicado
Compatibilidad
Claude✓ Compatible
Cursor—
Copilot—
ChatGPT—
Gemini—
Acerca de

Auto-scale LLM inference clusters on Kubernetes using KEDA, custom GPU metrics, and horizontal pod autoscaling. Handle traffic spikes, implement queue-based scaling, and optimize cost with spot instances for AI workloads.

Palabras clave
skillclaude

Sin cobertura de dependencias

Esta entrada no publica ningún paquete de npm, así que Forge no tiene un árbol de dependencias para ella. Es una carencia de cobertura, no una afirmación de que no tenga dependencias.