model-serving

SKILLWorkflowCommunity
v0.0.0ancolemanMITAktualisiert vor 8 Mon.Quelle →

LLM and ML model deployment for inference. Use when serving models in production, building AI APIs, or optimizing inference. Covers vLLM (LLM serving), TensorRT-LLM (GPU optimization), Ollama (local), BentoML (ML deployment), Triton (multi-model), LangChain (orchestration), LlamaIndex (RAG), and str

Community-submitted skill. Not yet reviewed by the Forge team. Full prompt content may not be available.Request review →
508Repo-Sterne
1Clients
1Formate
vor 8 Mon.Letzte Aktualisierung
Skill
Autorancoleman
Version0.0.0
LizenzMIT
KategorieWorkflow
Formateskill.md
PromptÖffnen (siehe Tab „Prompt“)
Kompatibilität
Claude✓ Unterstützt
Cursor
Copilot
ChatGPT
Gemini
Über

LLM and ML model deployment for inference. Use when serving models in production, building AI APIs, or optimizing inference. Covers vLLM (LLM serving), TensorRT-LLM (GPU optimization), Ollama (local), BentoML (ML deployment), Triton (multi-model), LangChain (orchestration), LlamaIndex (RAG), and streaming patterns.

Schlagwörter
skillclaude