Ta kontakt

Kursplan

Detaljert utdanningsoversikt

  1. Innføring i NLP
    • Forståelse av NLP
    • NLP-rammeverk
    • Kommercielle anvendelser av NLP
    • Innsamling av data fra nettet (web scraping)
    • Arbeid med ulike API-er for å hente tekstdata
    • Arbeid med og lagring av tekstkorpus ved lagring av innhold og relevant metadata
    • Fordeler med bruk av Python og en rask innføring i NLTK
  2. Praktisk forståelse av korpus og datasett
    • Hvorfor trenger vi et korpus?
    • Korpusanalyse
    • Typer dataattributter
    • Ulike filformater for korpus
    • Forberedelse av et datasett for NLP-anvendelser
  3. Forståelse av setningsstruktur
    • Komponenter av NLP
    • Naturlig språkforståelse
    • Morfologisk analyse - stam, ord, token, taleetiketter
    • Syntaktisk analyse
    • Semantisk analyse
    • Håndtering av tvetydighet
  4. Forbehandling av tekstdata
    • Korpus - rå tekst
      • Setningstokenisering
      • Stemming for rå tekst
      • Lemmatisering av rå tekst
      • Fjerning av stoppord
    • Korpus - rå setninger
      • Ordtokenisering
      • Ordlemmatisering
    • Arbeid med term-dokument-/dokument-term-mатриs
    • Tokenisering av tekst i n-grammer og setninger
    • Praktisk og tilpasset forbehandling
  5. Analyse av tekstdata
    • Grunnleggende egenskaper ved NLP
      • Parsere og parsing
      • POS-merking og merkere
      • Gjenkjenning av navngitte enheter
      • N-grammer
      • Bag of words
    • Statistiske egenskaper ved NLP
      • Begrep innen lineær algebra for NLP
      • Sannsynlighetsteori for NLP
      • TF-IDF
      • Vektorisering
      • Koder og avkodere (encoders og decoders)
      • Normalisering
      • Sannsynlighetsmodeller
    • Avansert egenskapsutvikling og NLP
      • Grunnlag i word2vec
      • Komponenter i word2vec-modellen
      • Logikk i word2vec-modellen
      • Utvikling av word2vec-konseptet
      • Anvendelse av word2vec-modellen
    • Studietilfelle: Anvendelse av bag of words: automatisk tekstoppsummering ved hjelp av forenklet og ekte Luhn-algoritme
  6. Dokumentklynging, klassifisering og tematisk modellering
    • Dokumentklynging og mønstergjenkjenning (hierarkisk klynging, k-means, klynging, osv.)
    • Sammenligning og klassifisering av dokumenter ved hjelp av TF-IDF, Jaccard- og cosine-avstandsformer
    • Dokumentklassifisering ved hjelp av Naïve Bayes og Maximum Entropy
  7. IDentifisering av viktige tekstelementer
    • Dimensjonsreduksjon: Principal Component Analysis (PCA), Singular Value Decomposition (SVD), non-negative matrix factorization (NMF)
    • Tematisk modellering og informasjonsinnhenting ved hjelp av Latent Semantic Analysis (LSA)
  8. Entitetsekstraksjon, stemningsanalyse og avansert tematisk modellering
    • Positiv vs. negativ: grad av stemning
    • Item Response Theory (IRT)
    • POS-merking og dens anvendelse: å finne personer, steder og organisasjoner nevnt i teksten
    • Avansert tematisk modellering: Latent Dirichlet Allocation (LDA)
  9. Studietilfeller
    • Utvinning av uprogrammerbare brukeranmeldelser
    • Klassifisering og visualisering av stemning i produktanmeldelsesdata
    • Utvinning av søkeloger for bruksmønstre
    • Tekstklassifisering
    • Tematisk modellering

Krav

Kunnskap om og kjennskap til NLP-prinsipper samt en forståelse for bruken av KI i virksomheter

 21 Timer

Antall deltakere


Pris per deltaker

Referanser (1)

Kommende kurs

Relaterte kategorier