Takk for at du sendte din henvendelse! En av våre teammedlemmer vil kontakte deg straks.
Takk for at du sendte din bestilling! En av våre teammedlemmer vil kontakte deg straks.
Varighet 21 timer
Kursplan
Innføring til skalering av Ollama
- Ollamas arkitektur og overvegelser ved skalering
- Vanlige flaskehals i flernivå-implementeringer
- Beste praksis for infrastrukturberedskap
Ressurstilordning og GPU-optimalisering
- Strategier for effektiv CPU/GPU-utnyttelse
- Minn- og båndbreddeovervegelser
- Kontainernivå ressursbegrensninger
Implementering med kontainere og Kubernetes
- Kontainerisering av Ollama med Docker
- Å kjøre Ollama i Kubernetes-kluster
- Lastbalansering og oppdagelse av tjenester
Automatisk skalering og parting
- Utforming av automatisk skaleringstrategi for Ollama
- Partinferensmetoder for gjennomsnittsoptimalisering
- Latens vs. gjennomsnitt kompromisser
Latens optimalisering
- Profilering av inferensytelse
- Kjernetaktikk og modellvarming
- Redusere I/O- og kommunikasjonsoverhode
Overvåking og observabilitet
- Integrasjon av Prometheus for metrikker
- Oppbygging av dashboards med Grafana
- Varsling og hendelsesrespons for Ollama-infrastruktur
Kostnadshåndtering og skaleringstrategi
- Kostnadsbevisst GPU-tilordning
- Cloud vs. lokalt deployement overvegelser
- Strategier for bærekraftig skalering
Sammendrag og neste steg
Krav
- Erfaring med Linux systemadministrasjon
- Forståelse av kontainerisering og orkestrering
- Kjennskap til maskinlæringsmodell-implementering
Publikum
- DevOps-ingeniører
- ML-infrastrukturteam
- Stedliggjøringsingeniører (SRE)