Ta kontakt
 Varighet 14 timer

Kursplan

Innføring til Gemini 3 multimodalitet

  • Evner innenfor tekst, bilder, lyd og video
  • Valg av modell og oversikt over endepunkter
  • Vanlige konsepter i multimodal resonanse

Å jobbe med tekst og strukturerte input

  • Strategier for prompting for tekstgenerering
  • Metadata, kontekstvinduer og embedding
  • Tekstbasert orkestrering av multimodale oppgaver

Bildeforståelse og visuelle arbeidsflyter

  • Billedanalyse og -tolking med Gemini 3
  • Å lage visuelle søke- og taggingsverktøy
  • Å bygge interaksjoner fra bilde til tekst og fra tekst til bilde

Behandling av lydinput

  • Arbeidsflyter for gjenkjenning og transkripsjon av tale
  • Deteksjon og tolking av lydepisoder
  • Integrasjon av lyd med tekst- og visuelle input

Video-intelligens og scenedanalyse

  • Rasjonalisering av video bilde-for-bilde og kontinuerlig
  • Å lage verktøy for sammendrag og utvinnings av høydepunkter
  • Video-basert automatisering og innholdsarbeidsflyter

Design av multimodale applikasjonsarkitekturer

  • Kombinasjon av flere inntyp i én flyt
  • Latens, kostnad og beregningsmessige hensyn
  • Beste praksis for skalerbare multimodale systemer

Prototypering av multimodale applikasjoner

  • Praktisk skapelse av multimodale prototyper
  • Rask iterasjon med prompting
  • Testing og justering av brukeropplevelsesflyter

Driftsetting av multimodale løsninger

  • Driftsetningsstrategier og oppsett av miljø
  • Overvåking av ytelse i sanne forhold
  • Hensyn til sikkerhet og samsvar

Oppsummering og neste steg

Krav

  • Forståelse av moderne AI-konsepter
  • Erfaring med Python eller JavaScript
  • Kjennskap til REST APIer

Målgruppe

  • Designere
  • Innholdsskapere
  • Tekniske produktteam

Antall deltakere


Pris per deltaker

Referanser (1)

Kommende kurs

Relaterte kategorier