Ta kontakt
 Varighet 14 timer (2 dager)

Kursplan

Oversikt over talegjenkjenningsteknologier

  • Historie og utvikling av talegjenkjenning
  • Akustiske modeller, språkmodeller og dekoding
  • Moderne arkitekturer: RNN-er, transformers og Whisper

Lydforbehandling og grunnleggende transkripsjon

  • Håndtering av lydformater og samplefrekvenser
  • Rensking, kutt og segmentering av lyd
  • Generering av tekst fra lyd: sanntid vs. batch

Håndverksarbeid med Whisper og andre API-er

  • Installere og bruke OpenAI Whisper
  • Kalle sky-API-er (Google, Azure) for transkripsjon
  • Sammenligne ytelse, latenstid og kostnad

Språk, aksenter og tilpasning til fagområder

  • Arbeide med flere språk og aksenter
  • Egener vokabular og toleranse for støy
  • Håndtering av juridisk, medisinsk eller teknisk språk

Utgangsformat og integrasjon

  • Tilføye tidsstempeler, tegn og talspersoner
  • Eksportere til tekst, SRT eller JSON-formater
  • Integrere transkripsjoner i applikasjoner eller databaser

Implementasjonslab for bruksområder

  • Transkribere møter, intervjuer eller podcaster
  • Tale-til-tekst kommandosystemer
  • Sanntidsunderskrifter for video/lydstreamer

Evaluering, begrensninger og etikk

  • Nøyaktighetsindikatorer og modellbenchmarking
  • Forvikling og rettferdighet i talemodeller
  • Konfidensialitet og samsvar overveielser

Oppsummering og neste trinn

Krav

  • Et forståelse av generelle AI- og maskinlæring-konsepter
  • Kjennskap til lyd- eller mediefilformater og verktøy

Publikum

  • Dataforskere og AI-ingeniører som jobber med taledata
  • Programvaresutviklere som bygger transkripsjonsbaserte applikasjoner
  • Organisasjoner som utforsker talegenkjenning for automatisering

Antall deltakere


Pris per deltaker

Kommende kurs

Relaterte kategorier