Ta kontakt

Kursplan

Databricks-plattformen og Lakehouse-grunnleggende

  • Databricks Lakehouse-arkitektur og komponenter
  • Organisering av arbeidsområder og kataloger

Databricks-arbeidsområde og notebooks

  • Navigasjon i arbeidsområdet og utvikling basert på notebooks
  • Strukturere kode i gjenbrukbare notebooks

Apache Spark-arkitektur og utførelse

  • Spark runtime-arkitektur og utførelsesmodell
  • Laten evaluering og jobbenes DAG (Directed Acyclic Graph)

PySpark DataFrames og DataFrame-API-et

  • DataFrame-abstraksjoner og skjemabeskrivelser
  • Kjerneloperasjoner for DataFrames og kolonneuttrykk

Omsetting av SQL til PySpark DataFrames

  • Omsette kjernen i SQL-setninger til DataFrame-operasjoner
  • Vindusfunksjoner og aggregeringer i PySpark

Lese og skrive data i Databricks

  • Lese fra vanlige fil- og databasekilder
  • Skrive og partitionere data i Lakehouse

Delta Lake og tabelladministrasjon

  • Delta-tabeller og ACID-transaksjoner
  • Tidlig reiser (time travel) og skjema-utvikling

Mønstre for datarensing og transformasjon

  • Datarensing og konvertering av typer
  • Bygge gjenbrukbar transformasjonslogikk

Brukerdefinerte funksjoner og modulær kode

  • Python UDFs (User-Defined Functions) og pandas UDFs
  • Modularisere prosedyrelatert logikk til funksjoner

ytelsesjustering og optimalisering

  • Strategier for partitionering og mellomlagring (caching)
  • Diagnostisere flaskehalser med Spark UI

Grunnleggende om Structured Streaming

  • Batch-prosesseringsmodeller kontra streaming-modeller
  • Streaming DataFrames og grunnleggende aggregeringer

Databricks-jobber og arbeidsflyt-orkestrering

  • Planlegge notebooks som jobber og oppgaver
  • Bygge flinnsprosedyre-arbeidsflyter med avhengigheter

Unity Catalog og datastyring

  • Unity Catalog-arkitektur og navnerom
  • Tilgangskontroll og datalinje (data lineage)

Testing, feilsøking og produksjonspraksis

  • Enhetstesting av PySpark-logikk
  • Feilsøking og standarder for kodekvalitet

End-to-end brukstilfeller innen finanssektoren

  • Bygge en end-to-end ETL-pipeline for banking
  • Omsette gamle SQL-prosesser til PySpark

Migrering av SQL-arbeidsbelastninger til PySpark

  • Strategi og planleggingsmønstre for migrering
  • Inkrementell konvertering av SQL-arbeidsflyter til PySpark

Krav

  • Erfaring med Python-programmering, inkludert funksjoner og datatyper
  • Forståelse av SQL, inkludert joins, aggregeringer og underspørringer
  • Ingen tidligere erfaring med Databricks eller PySpark kreves

Målgruppe

  • Dataingeniører, dataanalytikere og dataprofesjoner
  • Team som migrerer eksisterende SQL-baserte arbeidsflyter til Databricks og PySpark
 35 Timer

Antall deltakere


Pris per deltaker

Referanser (1)

Kommende kurs

Relaterte kategorier