ai-llm-inference

SKILLFlujo de trabajocomunidad
v0.0.0vasilyu1983MITActualizado hace 7 dFuente →

LLM inference patterns for latency, batching, caching, quantization, routing, and serving stacks. Use when optimizing throughput, tail latency, or serving cost.

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
75Estrellas del repo
1Clientes
1Formatos
hace 7 dÚltima actualización
Skill
Autorvasilyu1983
Versión0.0.0
LicenciaMIT
CategoríaFlujo de trabajo
Formatosskill.md
PromptNo publicado
Compatibilidad
Claude✓ Compatible
Cursor
Copilot
ChatGPT
Gemini
Acerca de

LLM inference patterns for latency, batching, caching, quantization, routing, and serving stacks. Use when optimizing throughput, tail latency, or serving cost.

Palabras clave
skillclaude