Ta kontakt

Kursplan

Grunnleggende om Tencent Hunyuan i produksjon

  • Oversikt over bruksscenarier for distribusjon av Tencent Hunyuan-modeller
  • Produsjonsegenskaper ved store modeller og MoE-modeller
  • Vanne flaskehalser når det gjelder latens, ytelse og kostnader
  • Definere tjenestenivåmål (SLA) for inferensarbeidsbelastninger

Distribusjonsarkitektur og distribusjonsflyt

  • Komponenter i et produksjonsinferens-stack
  • Valg mellom distribusjonsmodeller med containere, lokalt installert infrastruktur og sky
  • Modelllasting, forespørselrouting og grunntanker for GPU-allokering
  • Utvikling for pålitelighet og operasjonal enkelhet

Latensoptimalisering i praksis

  • Bruk av optimaliserte inferensmotorer som TensorRT der det er aktuelt
  • KV-cache-konsepter og praktisk finjustering av cache
  • Minsk oppstart, varmningstid og svarforbruk
  • Måling av tid til første token og genereringshastighet for tokens

Ytelse, batching og GPU-effektivitet

  • Kontinuerlig batching og forespørselsbatching-strategier
  • Håndtering av konkurrent og køadferd
  • Forbedre GPU-utnyttelsen uten å skade brukeropplevelsen
  • Håndtere forespørsler med lang kontekst og blandet arbeidsbelastning

Kvantisering og kostnadskontroll

  • Hvorfor kvantisering er viktig for produksjonsdistribusjon
  • Praktiske avveininger mellom FP16, INT8 og andre vanlige presisjonsalternativer
  • Balansere modellkvalitet, latens og infrastrukturkostnader
  • Bygge en enkel sjekkliste for kostnadsoptimalisering

Drift, overvåking og klarhetsgjennomgang

  • Automatisk skalering av inferenstjenester
  • Overvåking av latens, ytelse, cachebruk og GPU-helse
  • Grunntanker for loggføring, varsler og hendelseshåndtering
  • Gjennomgang av en referansedistribusjon og utarbeide en forbedringsplan

Krav

  • Grunnleggende forståelse av distribusjon og inferensarbeidsflyter for store språkmodeller
  • Er erfaring med containere, skyinfrastruktur eller lokalt installert infrastruktur, og API-baserte tjenester
  • Praktisk kunnskap om Python eller systemingeniør-oppgaver

Målgruppe

  • ML-ingeniører som distribuerer store språkmodeller (LLM) til produksjon
  • Plattformingeniører ansvarlige for GPU-baserte inferenstjenester
  • Løsningsarkitekter som utformer skalerbare plattformer for AI-distribusjon
 14 Timer

Antall deltakere


Pris per deltaker

Kommende kurs

Relaterte kategorier