Ta kontakt
 Varighet 21 timer

Kursplan

Innføring i multimodal AI og Ollama

  • Overblikk over multimodalt læring
  • Hovedutfordringer ved integrering av syn og språk
  • Kapabiliteter og arkitektur i Ollama

Oppsett av Ollama-miljøet

  • Installasjon og konfigurasjon av Ollama
  • Arbeid med lokal modellimplementering
  • Integrasjon av Ollama med Python og Jupyter

Arbeid med multimodale inndata

  • Integrasjon av tekst og bilder
  • Inkorporering av lyd og strukturert data
  • Design av forbehandlede pipelines

Applikasjoner for dokumentforståelse

  • Uttak av strukturert informasjon fra PDF-er og bilder
  • Kombinering av OCR med språkmodeller
  • Bygge intelligente dokumentanalyse-workflows

Visuell spørresvar (VQA)

  • Oppsett av VQA-datasets og benchmark
  • Trening og evaluering av multimodale modeller
  • Bygge interaktive VQA-applikasjoner

Design av multimodale agenter

  • Prinsipper for agentdesign med multimodal resonnering
  • Kombinering av persepsjon, språk og handling
  • Implementering av agenter for reelle bruksscenarier

Avansert integrasjon og optimering

  • Finjustering av multimodale modeller med Ollama
  • Optimering av inferanse ytelse
  • Skalerbarhet og implementeringsbetraktninger

Oppsummering og neste steg

Krav

  • Solid forståelse av maskinlæringskonsepter
  • Erfaring med dyplæringsrammer som PyTorch eller TensorFlow
  • Kjennskap til naturlig språkbehandling og datamaskinvitenskap

Målgruppe

  • Maskinlæringsingeniører
  • AI-forskere
  • Produktutviklere som integrerer visuelle og tekstuelle workflow

Antall deltakere


Pris per deltaker

Kommende kurs

Relaterte kategorier