Ta kontakt
 Varighet 35 timer (5 dager)

Kursplan

Hver sesjon varer 2 timer

Dag 1: Sesjon 1: Forretningsøversikt over hvorfor stor data og business intelligence i regjeringsorgan

  • Kasestudier fra NIH og DoE
  • Adopsjonshastighet av stor data i regjeringsorgan og hvordan de justerer fremtidig drift rundt prediktiv analyse
  • Bred skalerbarhetsområde i DoD, NSA, IRS, USDA osv.
  • Integrasjon av stor data med eksisterende data
  • Grunnleggende forståelse av muliggjørende teknologi for prediktiv analyse
  • Dataintegrering og dashboardsynliggjøring
  • Svindelstyring
  • Generering av forretningsregler/svindeloppdagelse
  • Trusseloppdagelse og profilering
  • Kostnadsgevinstanalyse for implementering av stor data

Dag 1: Sesjon 2: Introduksjon til stor data-1

  • Hovedkarakteristikkene ved stor data: volum, variasjon, hastighet og sannhetsgrad. MPP-arkitektur for volum.
  • Datawarehouse – statisk skjema, langsomt utviklende datasett
  • MPP-databaser som Greenplum, Exadata, Teradata, Netezza, Vertica osv.
  • Hadoop-baserte løsninger – ingen krav til struktur i datasettet.
  • Typisk mønster: HDFS, MapReduce (crunch), henting fra HDFS
  • Batch – egnet for analyse/non-interaktivt
  • Volum: CEP-strømdataløsninger
  • Typiske valg – CEP-produkter (f.eks. Infostreams, Apama, MarkLogic osv.)
  • Mindre produksjonsklar – Storm/S4
  • NoSQL-databaser – (kolonnebasert og nøkkel-verdi): Best egnet som analytisk tilleggsfunksjon til datawarehouse/database

Dag 1: Sesjon 3: Introduksjon til stor data-2

NoSQL-løsninger

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierarkisk) - GT.m, Cache
  • KV Store (Sortert) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Objektbase - ZopeDB, DB40, Shoal
  • Dokumentlagring - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Bred kolonnemagasin - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variasjoner av data: Introduksjon til datarensning i stor data

  • RDBMS – statisk struktur/skjema, fremmer ikke agilt, eksplortativt miljø.
  • NoSQL – halvstrukturert, nok struktur til å lagre data uten eksakt skjema før lagring
  • Problemer med datarensning

Dag 1: Sesjon 4: Introduksjon til stor data-3: Hadoop

  • Når skal man velge Hadoop?
  • STRUKTURERT - Enterprise datawarehouse/databaser kan lagre massive mengder data (med kostnad) men pålegger struktur (ikke bra for aktiv utforskning)
  • HALVSTRUKTURERT data – vanskelig å håndtere med tradisjonelle løsninger (DW/DB)
  • Warehouse av data = ENORM innsats og statisk selv etter implementering
  • For variasjon og volum av data, bearbeidet på kommodity-hardware – HADOOP
  • Kommodity-hardware trengs for å opprette en Hadoop-kluster

Introduksjon til MapReduce/HDFS

  • MapReduce – distribuert databehandling over flere servere
  • HDFS – gjør data lokalt tilgjengelig for databehandlingsprosessen (med redundans)
  • Data – kan være ustrukturert/skjemaløs (i motsetning til RDBMS)
  • Utvikleres ansvar for å finne mening i data
  • Programmatering av MapReduce = arbeid med Java (fordeler/ulemper), manuell lasting av data til HDFS

Dag 2: Sesjon 1: Stordataskjøtet – Bygging av ETL for stor data: universet av verktøy for stor data, hvilken skal man bruke og når?

  • Hadoop vs. andre NoSQL-løsninger
  • For interaktiv, tilfeldig tilgang til data
  • Hbase (kolonneorientert database) ovenpå Hadoop
  • Tilfeldig tilgang til data men med begrensninger (maks 1 PB)
  • Ikke bra for ad-hoc-analyse, bra for logging, telling, tidsserier
  • Sqoop - Import fra databaser til Hive eller HDFS (JDBC/ODBC-tillgang)
  • Flume – Strømme data (f.eks. loggdata) til HDFS

Dag 2: Sesjon 2: Stordatasystem

  • Deling av ressurser, beregningseksempler starter/slutter: ZooKeeper – For konfigurasjon/koordinering/navngivningstjenester
  • Kompleks pipeline/arbeidsflyt: Oozie – styr arbeidsflyt, avhengigheter, kjede
  • Utbred, konfigurer, klusterstyring, oppgradering osv. (systemadministrator): Ambari
  • I skyen: Whirr

Dag 2: Sesjon 3: Prediktiv analyse i business intelligence -1: Grunnteknikker og maskinlæringsbasert BI:

  • Introduksjon til maskinlæring
  • Læring av klassifikasjonsteknikker
  • Bayesisk prediksjon – forberedelse av treningsfil
  • Support Vektor Maskin
  • KNN p-Tree Algebra & vertikal gruveri
  • Neuronal nettverk
  • Stor data – problem med store variable - Tilfeldig skog (RF)
  • Automatiseringsproblem i stor data – Multi-modell ensemble RF
  • Automatisering via Soft10-M
  • Tekstanalytisk verktøy - Treeminer
  • Agil læring
  • Agentbasert læring
  • Distribuert læring
  • Introduksjon til Open Source-verktøy for prediktiv analyse: R, Rapidminer, Mahut

Dag 2: Sesjon 4: Ekosystem for prediktiv analyse-2: Vanlige prediktive analytiske problemer i regjeringsorgan

  • Innsiktsanalyse
  • Visualiseringsanalyse
  • Strukturert prediktiv analyse
  • Ustrukturert prediktiv analyse
  • Profilering av trusler/svindler/leverandører
  • Anbeflingsmotor
  • Mønsteroppdagelse
  • Regel/scenarieoppdagelse – feil, svindel, optimalisering
  • Oppdagelse av rotårsaker
  • Sentimentsanalyse
  • KRM-analyse
  • Nettverksanalyse
  • Tekstanalyse
  • Teknologistøttet gjennomgang
  • Svindelanalyse
  • Realtidsanalyse

Dag 3: Sesjon 1: Reeltid og skalbar analyse over Hadoop

  • Hvorfor vanlige analytiske algoritmer feiler i Hadoop/HDFS
  • Apache Hama – for massebasert synkron distribuert databehandling
  • Apache SPARK – for klusterdatabehandling for reeltidsanalyse
  • CMU Graphics Lab2 – Graf-basert asynkron tilnærming til distribuert databehandling
  • KNN p-Algebra-basert tilnærming fra Treeminer for redusert maskinvarekostnad

Dag 3: Sesjon 2: Verktøy for eDiscovery og forensikk

  • eDiscovery over stor data vs. eksisterende data – en sammenligning av kostnad og ytelse
  • Prediktiv koding og teknologistøttet gjennomgang (TAR)
  • Live demo av et TAR-produkt (vMiner) for å forstå hvordan TAR fungerer for raskere oppdagelse
  • Raskere indeksering gjennom HDFS – hastighet på data
  • NLP eller naturlig språkbearbeiding – ulike teknikker og open source-produkter
  • eDiscovery i fremmedspråk – teknologi for fremmedspråkbearbeiding

Dag 3: Sesjon 3: Stor data BI for cybersikkerhet – Forståelse av hele 360 graders syn fra hurtig datainnsamling til trusselidentifisering

  • Forståelse av grunnleggende sikkerhetsanalyse – angrepsoverflate, sikkerhetsmisconfiguration, vertforsvar
  • Nettverksinfrastruktur / Store datapipes / Respons ETL for reeltidsanalyse
  • Preskriktiv vs prediktiv – Fast regelbasert vs auto-oppdagelse av trusselregler fra metadata

Dag 3: Sesjon 4: Stor data i USDA: Applikasjon i landbruk

  • Introduksjon til IoT (Internet of Things) for landbruk – sensorbasert stor data og kontroll
  • Introduksjon til satellittbilleder og dets applikasjoner i landbruk
  • Integrasjon av sensor- og billeddata for jordfruktbarhet, dyrkingsanbefaling og prognose
  • Landbruksforsikring og stor data
  • Avlingsprognose

Dag 4: Sesjon 1: Svindel forebygging BI fra stor data i regjeringsorgan – Svindelanalyse:

  • Grunnleggende klassifisering av svindelanalyse – regelbasert vs prediktiv analyse
  • Overvakt vs overvakt maskinlæring for svindelmønsteroppdagelse
  • Leverandørsvindel/overprising for prosjekter
  • Medicare og Medicaid-svindel – svindeloppdagelsesteknikker for kravbehandling
  • Reisererfyllingssvindel
  • IRS-refundsvindel
  • Kasestudier og live demo vil bli gitt der data er tilgjengelig.

Dag 4: Sesjon 2: Sosial medieranalyse – Informasjonsinnhenting og analyse

  • Stor data ETL API for utvinning av sosial medierdata
  • Tekst, bilder, metadata og video
  • Sentimentsanalyse fra sosiale medier-strømmer
  • Kontekstuell og kontekstuell filtrering av sosiale medier-strømmer
  • Sosial medie-dashboard for integrasjon av mangfoldige sosiale medier
  • Automatisk profilering av sosiale medier-profiler
  • Live demo av hver analyse vil bli gitt gjennom Treeminer-verktøyet.

Dag 4: Sesjon 3: Stor data analyse i bildebehandling og videostrømmer

  • Bildestyringsteknikker i stor data – Styringsløsning for data som overstiger petabytes
  • LTFS og LTO
  • GPFS-LTFS (Lagret styringsløsning for store billedata)
  • Grunnleggende bildedanalyse
  • Objekterkjenning
  • Bildegrensegren
  • Bevegelsessporing
  • 3-D bildegjenoppretting

Dag 4: Sesjon 4: Stor data-applikasjoner i NIH:

  • Oppstige områder av bioinformatikk
  • Meta-genomikk og gruveri-problemer i stor data
  • Prediktiv analyse i stor data for Farmakogenomikk, Metabolomikk og Proteomikk
  • Stor data i nedstrøms genomikk-prosess
  • Applikasjon av prediktiv analyse i stor data i folkehelse

Stor data dashboard for rask tilgjengelighet av mangfoldig data og visning:

  • Integrasjon av eksisterende applikasjonsplattform med stor data-dashboard
  • Stor data styring
  • Kasestudie av stor data-dashboard: Tableau og Pentaho
  • Benytt stor data-app for å skubbe lokasjonsbaserte tjenester i regjeringsorgan
  • Sporingssystem og styring

Dag 5: Sesjon 1: Hvordan rettferdiggjøre implementasjon av stor data BI innenfor en organisasjon:

  • Definisjon av ROI for implementasjon av stor data
  • Kasestudier for å spare analytiker tid for innsamling og forberedelse av data – økning i produktivt gevinster
  • Kasestudier av inntektsgevinst fra å spare lisensiert databasekostnad
  • Inntektsgevinst fra lokasjonsbaserte tjenester
  • Sparing fra svindel forebygging
  • En integrert regnearktilnærming til å beregne omtrentlig utgift vs. inntektsgevinster/sparing fra implementasjon av stor data.

Dag 5: Sesjon 2: Steg for steg-prosedure for å erstatte eksisterende datasystem med stor data-system:

  • Forståelse av praktisk migreringsvei for stor data
  • Hva er viktig informasjon som trengs før arkitektur av en stor data implementasjon
  • Hva er de ulike måtene å beregne volum, hastighet, variasjon og sannhetsgrad på data
  • Hvordan estimere datavøkst
  • Kasestudier

Dag 5: Sesjon 4: Gjennomgang av leverandører for stor data og gjennomgang av deres produkter. Q/A sesjon:

  • Accenture
  • APTEAN (Tidligere CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Tidligere 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Del av EMC)

Krav

  • Grunne kunnskaper om forretningsdrift og datasystemer i regjeringsorganet innenfor sitt fagfelt
  • Grunnleggende forståelse av SQL/Oracle eller relasjonelle databaser
  • Grunnleggende forståelse av statistikk (på regnearknivå)

Antall deltakere


Pris per deltaker

Referanser (1)

Kommende kurs

Relaterte kategorier