Takk for at du sendte din henvendelse! En av våre teammedlemmer vil kontakte deg straks.
Takk for at du sendte din bestilling! En av våre teammedlemmer vil kontakte deg straks.
Kursplan
Innledning, mål og migreringsstrategi
- Kursmål, samsvar med deltakerprofil og kriterier for suksess
- Høytnivå migreringsmetoder og risikooverveielser
- Innstilling av arbeidsområder, reposer og laboratoriedat sett
Dag 1 — Migreringsgrunnleggende og arkitektur
- Lakehouse-konsepter, oversikt over Delta Lake og Databricks-arkitektur
- Forskjeller mellom SMP og MPP og implikasjoner for migrering
- Medallion (Bronze→Silver→Gold)-design og oversikt over Unity Catalog
Dag 1 Laboratorium — Oversetting av en lagret prosedyre
- Praktisk migrering av en eksempel lagret prosedyre til en notatbok
- Kartlegging av midlertidige tabeller og kurser til DataFrame-transformasjoner
- Validering og sammenligning med opprinnelig utdata
Dag 2 — Avansert Delta Lake & inkrementell lastning
- ACID-transaksjoner, committjurnaler, versjonering og tidsreisning
- Auto Loader, MERGE INTO-mønstre, oppdateringer og skjemaevolusjon
- OPTIMIZE, VACUUM, Z-ORDER, partisjonering og lagringsjustering
Dag 2 Laboratorium — Inkrementelt inntak & optimering
- Implementering av Auto Loader-inntak og MERGE-arbeidsflyter
- Anvendelse av OPTIMIZE, Z-ORDER og VACUUM; validering av resultater
- Måling av ytelsesforbedringer ved lesing/skrivning
Dag 3 — SQL i Databricks, ytelse & feilsøking
- Analytiske SQL-funksjoner: vindusfunksjoner, høyre ordens funksjoner, JSON/array-håndtering
- Lese Spark UI, DAGs, shuffles, steg, oppgaver og diagnose av flaskehals
- Spørringsjusteringsmønstre: broadcast joins, hints, caching og reduksjon av spill
Dag 3 Laboratorium — SQL-refaktorering & ytelsesjustering
- Refaktorering av en tung SQL-prosess til optimalisert Spark SQL
- Bruke Spark UI-spor for å identifisere og rette skjevhets- og shuffle-problemer
- Benchmark før/etter og dokumentere justeringssteg
Dag 4 — Taktisk PySpark: Erstatning av prosedyremessig logikk
- Spark utførelsesmodell: driver, eksekutorer, lat evaluering og partisjoneringstrategier
- Transformering av løkker og kurser til vektoriserte DataFrame-operasjoner
- Modularisering, UDFs/pandas UDFs, widgets og gjenbruksbiblioteker
Dag 4 Laboratorium — Refaktorering av prosedyremessige skripter
- Refaktorering av et prosedyremessig ETL-skript til modulare PySpark-notatbøker
- Innføring av parametrering, enhetsliknende tester og gjenbruksfunksjoner
- Kodedgjennomgang og anvendelse av beste-praksis sjekkliste
Dag 5 — Orkestrering, end-to-end rørflyt & beste praksis
- Databricks Workflows: jobbdesign, oppgavedependanser, triggere og feilbehandling
- Design av inkrementelle Medallion-rørflyter med kvalitetsregler og skjemavalidering
- Integrasjon med Git (GitHub/Azure DevOps), CI og teststrategier for PySpark-logikk
Dag 5 Laboratorium — Bygge en komplett end-to-end rørflyt
- Sammensette Bronze→Silver→Gold-rørflyt orkestrert med Workflows
- Implementere logging, auditing, gjenforsøk og automatiserte valideringer
- Kjøre full rørflyt, validere utdata og forberede utleveringsnoter
Operasjonalisering, styring og produksjonsklarhet
- Unity Catalog-styring, herkomst og tilgangskontroller beste praksis
- Kostnad, klustring, autoscaling og jobbkonkurransesmønstre
- Utleveringskontroller, tilbakeslagsstrategier og opprettelse av kjøremanualer
Avsluttende gjennomgang, kunnskapsoverføring og neste steg
- Deltakerpresentasjoner av migreringsarbeid og læring
- Spranganalyse, anbefalte oppfølgingsaktiviteter og levering av opplæringsmateriell
- Referanser, ytterligere læringsbaner og støttealternativer
Krav
- Forståelse av dataingeniørkonsepter
- Erfaring med SQL og lagrede prosedyrer (Synapse / SQL Server)
- Kunnskap om ETL-orkestreringskonsepter (ADF eller lignende)
Målgruppe
- Teknologiledere med bakgrunn i dataingeniøring
- Dataingeniører som overfører prosedyremessig OLAP-logikk til Lakehouse-mønstre
- Plattformsentere som er ansvarlige for innføring av Databricks
35 Timer