Kursplan
Databricks-plattformen og Lakehouse-grunnleggende
- Databricks Lakehouse-arkitektur og komponenter
- Organisering av arbeidsområder og kataloger
Databricks-arbeidsområde og notebooks
- Navigasjon i arbeidsområdet og utvikling basert på notebooks
- Strukturere kode i gjenbrukbare notebooks
Apache Spark-arkitektur og utførelse
- Spark runtime-arkitektur og utførelsesmodell
- Laten evaluering og jobbenes DAG (Directed Acyclic Graph)
PySpark DataFrames og DataFrame-API-et
- DataFrame-abstraksjoner og skjemabeskrivelser
- Kjerneloperasjoner for DataFrames og kolonneuttrykk
Omsetting av SQL til PySpark DataFrames
- Omsette kjernen i SQL-setninger til DataFrame-operasjoner
- Vindusfunksjoner og aggregeringer i PySpark
Lese og skrive data i Databricks
- Lese fra vanlige fil- og databasekilder
- Skrive og partitionere data i Lakehouse
Delta Lake og tabelladministrasjon
- Delta-tabeller og ACID-transaksjoner
- Tidlig reiser (time travel) og skjema-utvikling
Mønstre for datarensing og transformasjon
- Datarensing og konvertering av typer
- Bygge gjenbrukbar transformasjonslogikk
Brukerdefinerte funksjoner og modulær kode
- Python UDFs (User-Defined Functions) og pandas UDFs
- Modularisere prosedyrelatert logikk til funksjoner
ytelsesjustering og optimalisering
- Strategier for partitionering og mellomlagring (caching)
- Diagnostisere flaskehalser med Spark UI
Grunnleggende om Structured Streaming
- Batch-prosesseringsmodeller kontra streaming-modeller
- Streaming DataFrames og grunnleggende aggregeringer
Databricks-jobber og arbeidsflyt-orkestrering
- Planlegge notebooks som jobber og oppgaver
- Bygge flinnsprosedyre-arbeidsflyter med avhengigheter
Unity Catalog og datastyring
- Unity Catalog-arkitektur og navnerom
- Tilgangskontroll og datalinje (data lineage)
Testing, feilsøking og produksjonspraksis
- Enhetstesting av PySpark-logikk
- Feilsøking og standarder for kodekvalitet
End-to-end brukstilfeller innen finanssektoren
- Bygge en end-to-end ETL-pipeline for banking
- Omsette gamle SQL-prosesser til PySpark
Migrering av SQL-arbeidsbelastninger til PySpark
- Strategi og planleggingsmønstre for migrering
- Inkrementell konvertering av SQL-arbeidsflyter til PySpark
Krav
- Erfaring med Python-programmering, inkludert funksjoner og datatyper
- Forståelse av SQL, inkludert joins, aggregeringer og underspørringer
- Ingen tidligere erfaring med Databricks eller PySpark kreves
Målgruppe
- Dataingeniører, dataanalytikere og dataprofesjoner
- Team som migrerer eksisterende SQL-baserte arbeidsflyter til Databricks og PySpark
Referanser (1)
Jeg likte at det var praktisk. Elsket å anvende den teoretiske kunnskapen med praktiske eksempler.
Aurelia-Adriana - Allianz Services Romania
Kurs - Python and Spark for Big Data (PySpark)
Maskinoversatt