Ta kontakt
 Varighet 21 timer

Kursplan

Innføring til skalering av Ollama

  • Ollamas arkitektur og overvegelser ved skalering
  • Vanlige flaskehals i flernivå-implementeringer
  • Beste praksis for infrastrukturberedskap

Ressurstilordning og GPU-optimalisering

  • Strategier for effektiv CPU/GPU-utnyttelse
  • Minn- og båndbreddeovervegelser
  • Kontainernivå ressursbegrensninger

Implementering med kontainere og Kubernetes

  • Kontainerisering av Ollama med Docker
  • Å kjøre Ollama i Kubernetes-kluster
  • Lastbalansering og oppdagelse av tjenester

Automatisk skalering og parting

  • Utforming av automatisk skaleringstrategi for Ollama
  • Partinferensmetoder for gjennomsnittsoptimalisering
  • Latens vs. gjennomsnitt kompromisser

Latens optimalisering

  • Profilering av inferensytelse
  • Kjernetaktikk og modellvarming
  • Redusere I/O- og kommunikasjonsoverhode

Overvåking og observabilitet

  • Integrasjon av Prometheus for metrikker
  • Oppbygging av dashboards med Grafana
  • Varsling og hendelsesrespons for Ollama-infrastruktur

Kostnadshåndtering og skaleringstrategi

  • Kostnadsbevisst GPU-tilordning
  • Cloud vs. lokalt deployement overvegelser
  • Strategier for bærekraftig skalering

Sammendrag og neste steg

Krav

  • Erfaring med Linux systemadministrasjon
  • Forståelse av kontainerisering og orkestrering
  • Kjennskap til maskinlæringsmodell-implementering

Publikum

  • DevOps-ingeniører
  • ML-infrastrukturteam
  • Stedliggjøringsingeniører (SRE)

Antall deltakere


Pris per deltaker

Kommende kurs

Relaterte kategorier