Ta kontakt

Kursplan

Innledning:

  • Apache Spark i Hadoop-økosystemet
  • Kort introduksjon til Python og Scala

Grunnleggende teorier:

  • Arkitektur
  • RDD
  • Transformer og handlinger
  • Steg, oppgaver, avhengigheter

Forstå grunnleggende prinsipper ved bruk av Databricks-miljøet (praktisk verksted):

  • Øvelser med RDD-API
  • Grunnleggende handlinger og transformeringsfunksjoner
  • PairRDD
  • Sammenslåing (Join)
  • Kasjestrategier
  • Øvelser med DataFrame-API
  • SparkSQL
  • DataFrame: velg, filtrer, grupper, sorter
  • UDF (brukerdefinert funksjon)
  • Innsyn i DataSet-API
  • Strømbehandling (Streaming)

Forstå implementering ved bruk av AWS-miljøet (praktisk verksted):

  • Grunnleggende i AWS Glue
  • Forskjeller mellom AWS EMR og AWS Glue
  • Eksempeloppgaver i begge miljøer
  • Fordele- og ulempeanalyse

Ekstra:

  • Innføring i Apache Airflow-oryktrering

Krav

Programmeringserfaring (foretrekkes på Python og Scala)

Grunnleggende kunnskaper i SQL

 21 Timer

Antall deltakere


Pris per deltaker

Referanser (3)

Kommende kurs

Relaterte kategorier