Kursplan
Introduksjon
Forståelse av Big Data
Generelt om Spark
Generelt om Python
Generelt om PySpark
- Distribusjon av data ved hjelp av Resilient Distributed Datasets-rammeverket
- Distribusjon av beregninger ved hjelp av Spark API-operatører
Oppsett av Python med Spark
Oppsett av PySpark
Bruk av Amazon Web Services (AWS) EC2-instanser for Spark
Oppsett av Databricks
Oppsett av AWS EMR-klyngen
Lære grunnleggende Python-programmering
- Kom i gang med Python
- Bruk av Jupyter Notebook
- Bruk av variabler og enkle datatyper
- Arbeide med lister
- Bruk av if-setninger
- Bruk av brukerinput
- Arbeide med while-løkker
- Implementasjon av funksjoner
- Arbeide med klasser
- Arbeide med filer og unntak
- Arbeide med prosjekter, data og APIer
Lære grunnleggende Spark DataFrame
- Kom i gang med Spark DataFrames
- Implementasjon av basisoperasjoner med Spark
- Bruk av Groupby og aggregeringsoperasjoner
- Arbeide med tidsstempler og datoer
Arbeide med en Spark DataFrame-prosjektoppgave
Forståelse av maskinlæring med MLlib
Arbeide med MLlib, Spark og Python for maskinlæring
Forståelse av regresjoner
- Lære teorien bak lineær regresjon
- Implementasjon av en regresjonsvurderingskode
- Arbeide med en prøveøvelse i lineær regresjon
- Lære teorien bak logistisk regresjon
- Implementasjon av en logistisk regresjonskode
- Arbeide med en prøveøvelse i logistisk regresjon
Forståelse av tilfeldige skoger og beslutningstre
- Lære teorien bak tre-metoder
- Implementasjon av koder for beslutningstre og tilfeldige skoger
- Arbeide med en prøveøvelse i klassifisering med tilfeldige skoger
Arbeide med K-midde-clustering
- Forståelse av K-midde-clustering-teori
- Implementasjon av en K-midde-clustering-kode
- Arbeide med en prøveøvelse i clustering
Arbeide med anbefalingssystemer
Implementasjon av naturlig språkbehandlingsmetoder
- Forståelse av naturlig språkbehandling (NLP)
- Generelt om NLP-verktøy
- Arbeide med en prøveøvelse i NLP
Strømbasert behandling med Spark på Python
- Generelt om strømbasert behandling med Spark
- Prøveøvelse i Spark Streaming
Krav
- Generelle programmeringsferdigheter
Målgruppe
- Utviklere
- IT-profesjonelle
- Dataforskere
Referanser (6)
Jeg likte at det var praktisk. Elsket å anvende den teoretiske kunnskapen med praktiske eksempler.
Aurelia-Adriana - Allianz Services Romania
Kurs - Python and Spark for Big Data (PySpark)
Maskinoversatt
Kursen handlet om en rekke med meget komplekse og sammenhengende emner, og Pablo har dyp innsikt i hvert av dem. Av og til gikk nyanser tapt i kommunikasjonen og/eller på grunn av tidspress, noe som muligens førte til at forventningene ikke helt ble møtt. Det oppstod også noen UHG/Azure Databricks oppsetningsproblemer, men Pablo og UHG løste disse raskt når de ble oppdaget - dette viste ifølge meg en høy grad av forståelse og profesjonalitet mellom UHG og Pablo,
Michael Monks - Tech NorthWest Skillnet
Kurs - Python and Spark for Big Data (PySpark)
Maskinoversatt
Individuell oppmerksomhet.
ARCHANA ANILKUMAR - PPL
Kurs - Python and Spark for Big Data (PySpark)
Maskinoversatt
Praktisk trening..
Abraham Thomas - PPL
Kurs - Python and Spark for Big Data (PySpark)
Maskinoversatt
Leksjonene ble holdt i et Jupyter-ark. Emnene var strukturert med en logisk sekvens og bidro naturlig til å utvikle sesjonen fra de enkleste delene til de mer komplekse. Jeg er allerede en avansert bruker av Python med bakgrunn i maskinlæring, så jeg fant kurset lettere å følge enn kanskje noen av mine medstudenter som tok opplæringskurset. Jeg setter pris på at noen av de mest elementære konseptene ble hoppet over og at han fokuserte på de mest sentrale emnene.
Angela DeLaMora - ADT, LLC
Kurs - Python and Spark for Big Data (PySpark)
Maskinoversatt
øvelseoppgaver
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
Kurs - Python and Spark for Big Data (PySpark)
Maskinoversatt