Takk for at du sendte din henvendelse! En av våre teammedlemmer vil kontakte deg straks.
Takk for at du sendte din bestilling! En av våre teammedlemmer vil kontakte deg straks.
Varighet 14 timer (2 dager)
Kursplan
Oversikt over talegjenkjenningsteknologier
- Historie og utvikling av talegjenkjenning
- Akustiske modeller, språkmodeller og dekoding
- Moderne arkitekturer: RNN-er, transformers og Whisper
Lydforbehandling og grunnleggende transkripsjon
- Håndtering av lydformater og samplefrekvenser
- Rensking, kutt og segmentering av lyd
- Generering av tekst fra lyd: sanntid vs. batch
Håndverksarbeid med Whisper og andre API-er
- Installere og bruke OpenAI Whisper
- Kalle sky-API-er (Google, Azure) for transkripsjon
- Sammenligne ytelse, latenstid og kostnad
Språk, aksenter og tilpasning til fagområder
- Arbeide med flere språk og aksenter
- Egener vokabular og toleranse for støy
- Håndtering av juridisk, medisinsk eller teknisk språk
Utgangsformat og integrasjon
- Tilføye tidsstempeler, tegn og talspersoner
- Eksportere til tekst, SRT eller JSON-formater
- Integrere transkripsjoner i applikasjoner eller databaser
Implementasjonslab for bruksområder
- Transkribere møter, intervjuer eller podcaster
- Tale-til-tekst kommandosystemer
- Sanntidsunderskrifter for video/lydstreamer
Evaluering, begrensninger og etikk
- Nøyaktighetsindikatorer og modellbenchmarking
- Forvikling og rettferdighet i talemodeller
- Konfidensialitet og samsvar overveielser
Oppsummering og neste trinn
Krav
- Et forståelse av generelle AI- og maskinlæring-konsepter
- Kjennskap til lyd- eller mediefilformater og verktøy
Publikum
- Dataforskere og AI-ingeniører som jobber med taledata
- Programvaresutviklere som bygger transkripsjonsbaserte applikasjoner
- Organisasjoner som utforsker talegenkjenning for automatisering