Takk for at du sendte din henvendelse! En av våre teammedlemmer vil kontakte deg straks.
Takk for at du sendte din bestilling! En av våre teammedlemmer vil kontakte deg straks.
Varighet 21 timer
Kursplan
Innføring i multimodal AI og Ollama
- Overblikk over multimodalt læring
- Hovedutfordringer ved integrering av syn og språk
- Kapabiliteter og arkitektur i Ollama
Oppsett av Ollama-miljøet
- Installasjon og konfigurasjon av Ollama
- Arbeid med lokal modellimplementering
- Integrasjon av Ollama med Python og Jupyter
Arbeid med multimodale inndata
- Integrasjon av tekst og bilder
- Inkorporering av lyd og strukturert data
- Design av forbehandlede pipelines
Applikasjoner for dokumentforståelse
- Uttak av strukturert informasjon fra PDF-er og bilder
- Kombinering av OCR med språkmodeller
- Bygge intelligente dokumentanalyse-workflows
Visuell spørresvar (VQA)
- Oppsett av VQA-datasets og benchmark
- Trening og evaluering av multimodale modeller
- Bygge interaktive VQA-applikasjoner
Design av multimodale agenter
- Prinsipper for agentdesign med multimodal resonnering
- Kombinering av persepsjon, språk og handling
- Implementering av agenter for reelle bruksscenarier
Avansert integrasjon og optimering
- Finjustering av multimodale modeller med Ollama
- Optimering av inferanse ytelse
- Skalerbarhet og implementeringsbetraktninger
Oppsummering og neste steg
Krav
- Solid forståelse av maskinlæringskonsepter
- Erfaring med dyplæringsrammer som PyTorch eller TensorFlow
- Kjennskap til naturlig språkbehandling og datamaskinvitenskap
Målgruppe
- Maskinlæringsingeniører
- AI-forskere
- Produktutviklere som integrerer visuelle og tekstuelle workflow