Takk for at du sendte din henvendelse! En av våre teammedlemmer vil kontakte deg straks.
Takk for at du sendte din bestilling! En av våre teammedlemmer vil kontakte deg straks.
Varighet 14 timer
Kursplan
Grunnleggende om Tencent Hunyuan i produksjon
- Oversikt over bruksscenarier for distribusjon av Tencent Hunyuan-modeller
- Produsjonsegenskaper ved store modeller og MoE-modeller
- Vanne flaskehalser når det gjelder latens, ytelse og kostnader
- Definere tjenestenivåmål (SLA) for inferensarbeidsbelastninger
Distribusjonsarkitektur og distribusjonsflyt
- Komponenter i et produksjonsinferens-stack
- Valg mellom distribusjonsmodeller med containere, lokalt installert infrastruktur og sky
- Modelllasting, forespørselrouting og grunntanker for GPU-allokering
- Utvikling for pålitelighet og operasjonal enkelhet
Latensoptimalisering i praksis
- Bruk av optimaliserte inferensmotorer som TensorRT der det er aktuelt
- KV-cache-konsepter og praktisk finjustering av cache
- Minsk oppstart, varmningstid og svarforbruk
- Måling av tid til første token og genereringshastighet for tokens
Ytelse, batching og GPU-effektivitet
- Kontinuerlig batching og forespørselsbatching-strategier
- Håndtering av konkurrent og køadferd
- Forbedre GPU-utnyttelsen uten å skade brukeropplevelsen
- Håndtere forespørsler med lang kontekst og blandet arbeidsbelastning
Kvantisering og kostnadskontroll
- Hvorfor kvantisering er viktig for produksjonsdistribusjon
- Praktiske avveininger mellom FP16, INT8 og andre vanlige presisjonsalternativer
- Balansere modellkvalitet, latens og infrastrukturkostnader
- Bygge en enkel sjekkliste for kostnadsoptimalisering
Drift, overvåking og klarhetsgjennomgang
- Automatisk skalering av inferenstjenester
- Overvåking av latens, ytelse, cachebruk og GPU-helse
- Grunntanker for loggføring, varsler og hendelseshåndtering
- Gjennomgang av en referansedistribusjon og utarbeide en forbedringsplan
Krav
- Grunnleggende forståelse av distribusjon og inferensarbeidsflyter for store språkmodeller
- Er erfaring med containere, skyinfrastruktur eller lokalt installert infrastruktur, og API-baserte tjenester
- Praktisk kunnskap om Python eller systemingeniør-oppgaver
Målgruppe
- ML-ingeniører som distribuerer store språkmodeller (LLM) til produksjon
- Plattformingeniører ansvarlige for GPU-baserte inferenstjenester
- Løsningsarkitekter som utformer skalerbare plattformer for AI-distribusjon