Ta kontakt

Kursplan

Innledning, mål og migreringsstrategi

  • Kursmål, samsvar med deltakerprofil og kriterier for suksess
  • Høytnivå migreringsmetoder og risikooverveielser
  • Innstilling av arbeidsområder, reposer og laboratoriedat sett

Dag 1 — Migreringsgrunnleggende og arkitektur

  • Lakehouse-konsepter, oversikt over Delta Lake og Databricks-arkitektur
  • Forskjeller mellom SMP og MPP og implikasjoner for migrering
  • Medallion (Bronze→Silver→Gold)-design og oversikt over Unity Catalog

Dag 1 Laboratorium — Oversetting av en lagret prosedyre

  • Praktisk migrering av en eksempel lagret prosedyre til en notatbok
  • Kartlegging av midlertidige tabeller og kurser til DataFrame-transformasjoner
  • Validering og sammenligning med opprinnelig utdata

Dag 2 — Avansert Delta Lake & inkrementell lastning

  • ACID-transaksjoner, committjurnaler, versjonering og tidsreisning
  • Auto Loader, MERGE INTO-mønstre, oppdateringer og skjemaevolusjon
  • OPTIMIZE, VACUUM, Z-ORDER, partisjonering og lagringsjustering

Dag 2 Laboratorium — Inkrementelt inntak & optimering

  • Implementering av Auto Loader-inntak og MERGE-arbeidsflyter
  • Anvendelse av OPTIMIZE, Z-ORDER og VACUUM; validering av resultater
  • Måling av ytelsesforbedringer ved lesing/skrivning

Dag 3 — SQL i Databricks, ytelse & feilsøking

  • Analytiske SQL-funksjoner: vindusfunksjoner, høyre ordens funksjoner, JSON/array-håndtering
  • Lese Spark UI, DAGs, shuffles, steg, oppgaver og diagnose av flaskehals
  • Spørringsjusteringsmønstre: broadcast joins, hints, caching og reduksjon av spill

Dag 3 Laboratorium — SQL-refaktorering & ytelsesjustering

  • Refaktorering av en tung SQL-prosess til optimalisert Spark SQL
  • Bruke Spark UI-spor for å identifisere og rette skjevhets- og shuffle-problemer
  • Benchmark før/etter og dokumentere justeringssteg

Dag 4 — Taktisk PySpark: Erstatning av prosedyremessig logikk

  • Spark utførelsesmodell: driver, eksekutorer, lat evaluering og partisjoneringstrategier
  • Transformering av løkker og kurser til vektoriserte DataFrame-operasjoner
  • Modularisering, UDFs/pandas UDFs, widgets og gjenbruksbiblioteker

Dag 4 Laboratorium — Refaktorering av prosedyremessige skripter

  • Refaktorering av et prosedyremessig ETL-skript til modulare PySpark-notatbøker
  • Innføring av parametrering, enhetsliknende tester og gjenbruksfunksjoner
  • Kodedgjennomgang og anvendelse av beste-praksis sjekkliste

Dag 5 — Orkestrering, end-to-end rørflyt & beste praksis

  • Databricks Workflows: jobbdesign, oppgavedependanser, triggere og feilbehandling
  • Design av inkrementelle Medallion-rørflyter med kvalitetsregler og skjemavalidering
  • Integrasjon med Git (GitHub/Azure DevOps), CI og teststrategier for PySpark-logikk

Dag 5 Laboratorium — Bygge en komplett end-to-end rørflyt

  • Sammensette Bronze→Silver→Gold-rørflyt orkestrert med Workflows
  • Implementere logging, auditing, gjenforsøk og automatiserte valideringer
  • Kjøre full rørflyt, validere utdata og forberede utleveringsnoter

Operasjonalisering, styring og produksjonsklarhet

  • Unity Catalog-styring, herkomst og tilgangskontroller beste praksis
  • Kostnad, klustring, autoscaling og jobbkonkurransesmønstre
  • Utleveringskontroller, tilbakeslagsstrategier og opprettelse av kjøremanualer

Avsluttende gjennomgang, kunnskapsoverføring og neste steg

  • Deltakerpresentasjoner av migreringsarbeid og læring
  • Spranganalyse, anbefalte oppfølgingsaktiviteter og levering av opplæringsmateriell
  • Referanser, ytterligere læringsbaner og støttealternativer

Krav

  • Forståelse av dataingeniørkonsepter
  • Erfaring med SQL og lagrede prosedyrer (Synapse / SQL Server)
  • Kunnskap om ETL-orkestreringskonsepter (ADF eller lignende)

Målgruppe

  • Teknologiledere med bakgrunn i dataingeniøring
  • Dataingeniører som overfører prosedyremessig OLAP-logikk til Lakehouse-mønstre
  • Plattformsentere som er ansvarlige for innføring av Databricks
 35 Timer

Antall deltakere


Pris per deltaker

Kommende kurs

Relaterte kategorier