Ta kontakt

Kursplan

EXO-infrastruktur som kode

  • Oversikt over EXO-distribusjonsmønstre: enkelt-node, multi-node og RDMA-klyster
  • Automatisere avhengighetsinstallasjon (Xcode, uv, Node.js, Rust) med konfigurasjonsstyring
  • Bruk av Nix flakes for reprodukbare EXO-bygginger og utviklermiljøer
  • Skrive Ansible playbooks eller skript for ubetjent klyste-tilvirkning

Reprodukbare bygginger og CI-integrasjon

  • Feste avhengigheter og bygge dashbord i CI-pipelines
  • Kjøre EXO-rykkttester i GitHub Actions eller GitLab CI-runner
  • Lage gullbilder og baserte tilbakestillingsarbeidflyter for macOS og Linux VMs
  • Versjonere tilpassede modellkort sammen med applikasjonskode

Klysteoppdagelse og nettverksautomatisering

  • Konfigurere mDNS og statisk DNS for pålitelig libp2p-nodeoppdagelse
  • Automatisere nettverksprofiloppretting og Thunderbolt-bryggestyring på macOS
  • Bruk av egendefinerte navnerom (EXO_LIBP2P_NAMESPACE) for å separere dev, staging og prod-klyster
  • Brannmurregler og nettverkssegmentering for multi-tenant-miljøer

Lagring og modell-livssyklus-håndtering

  • Designe EXO_MODELS_DIRS og EXO_MODELS_READ_ONLY_DIRS-strategier
  • Montere NFS eller SAN-shares som lesesikre modelldager for rask tilvirkning
  • Tømming av utgått dags og versjonerte vekter-retensjonsregler
  • Automatisere modell-forhåndsnedlastninger og helsekontroller før rullering oppgraderinger

Overvåking og varsling

  • Send EXO-logger til sentralisert logging (ELK, Loki eller Splunk)
  • Lage Grafana-dashbord fra EXO_TRACING_ENABLED-utdata
  • Varsle på klyste-medlemsendringer, OOM-hendelser og inferens-latensspikes
  • Korrelere macmon-hardvar-telemetria med modell-prestandaregressjoner

Oppdatering, tilbakestilling og katastrofe-gjenoppretting

  • Staging EXO-binære oppdateringer i en canary-node før fleet-wide rullering
  • Modell-nivå-tilbakestilling: bytte mellom kvantiserte versjoner uten å nedlaste på nytt
  • Sikkerhetskopiere og gjenopprette klyste-stat, tilpassede navnerom og lagrede vekter
  • Dokumentere gjenopprettings-runbooks for totale klyste-byggings-scenarios

Sikkerhetshærdning og compliance

  • Anvende TLS på reverse-proxy-laegret (nginx, traefik) for dashbordet og APIet
  • Implementere API-rate-limiting og IP-whitelisting for EXO-endepunkter
  • Isoletere klyster med VLANs og zero-trust-nettverks-policyer
  • Auditt tilgang og vedlikeholde et register over distribuerede modeller og versjoner

Krav

  • Erfaring med DevOps-praksis (CI/CD, IaC, container-orkestrering)
  • Kunnskap om macOS eller Linux-systemadministrasjon og pakkehåndtering
  • Forståelse for nettverks-, DNS- og lagringskonsepter

Målgruppe

  • DevOps-ingeniører
  • Infrastrukturarkitekter
  • SREs ansvarlig for on-premise AI-arbeidsbelastninger
 21 Timer

Antall deltakere


Pris per deltaker

Referanser (2)

Kommende kurs

Relaterte kategorier