Takk for at du sendte din henvendelse! En av våre teammedlemmer vil kontakte deg straks.
Takk for at du sendte din bestilling! En av våre teammedlemmer vil kontakte deg straks.
Varighet 14 timer
Kursplan
Innføring til Gemini 3 multimodalitet
- Evner innenfor tekst, bilder, lyd og video
- Valg av modell og oversikt over endepunkter
- Vanlige konsepter i multimodal resonanse
Å jobbe med tekst og strukturerte input
- Strategier for prompting for tekstgenerering
- Metadata, kontekstvinduer og embedding
- Tekstbasert orkestrering av multimodale oppgaver
Bildeforståelse og visuelle arbeidsflyter
- Billedanalyse og -tolking med Gemini 3
- Å lage visuelle søke- og taggingsverktøy
- Å bygge interaksjoner fra bilde til tekst og fra tekst til bilde
Behandling av lydinput
- Arbeidsflyter for gjenkjenning og transkripsjon av tale
- Deteksjon og tolking av lydepisoder
- Integrasjon av lyd med tekst- og visuelle input
Video-intelligens og scenedanalyse
- Rasjonalisering av video bilde-for-bilde og kontinuerlig
- Å lage verktøy for sammendrag og utvinnings av høydepunkter
- Video-basert automatisering og innholdsarbeidsflyter
Design av multimodale applikasjonsarkitekturer
- Kombinasjon av flere inntyp i én flyt
- Latens, kostnad og beregningsmessige hensyn
- Beste praksis for skalerbare multimodale systemer
Prototypering av multimodale applikasjoner
- Praktisk skapelse av multimodale prototyper
- Rask iterasjon med prompting
- Testing og justering av brukeropplevelsesflyter
Driftsetting av multimodale løsninger
- Driftsetningsstrategier og oppsett av miljø
- Overvåking av ytelse i sanne forhold
- Hensyn til sikkerhet og samsvar
Oppsummering og neste steg
Krav
- Forståelse av moderne AI-konsepter
- Erfaring med Python eller JavaScript
- Kjennskap til REST APIer
Målgruppe
- Designere
- Innholdsskapere
- Tekniske produktteam
Referanser (1)
Flyt, vib og tema i presentasjonen
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kurs - Google Gemini AI for Data Analysis
Maskinoversatt