Ta kontakt

Kursplan

Introduksjon til talesyntese og stemmekloning

  • Oversikt over tekst-til-tale (TTS) og neural stemmesyntese
  • Stemmekloning vs. talegenerering: bruksområder og grenser
  • Viktige modeller: Tacotron, WaveNet, FastSpeech, VITS

Arbeid med kommersielle plattformer

  • Bruk av ElevenLabs og Resemble AI
  • Opprettelse, kloning og redigering av stemmer
  • API-tilgang og tekst-til-tale-arbeidsflyter

Bygging med open-source-verktøy

  • Installere og konfigurere Coqui TTS
  • Trening av tilpassede stemmer og administrasjon av datasett
  • Generering av tale med finjustering (tonehøyde, hastighet, følelse)

Dataforberedelse og administrasjon av røstdatasett

  • Samling og rensing av røysample
  • Segmentering, etikettering og synkronisering av transkripter
  • Etisk opprinnelse og samtykke fra stemme

Applikasjonsintegrering

  • Innbygging av TTS i nettsteder og applikasjoner
  • Oppretting av IVR-systemer og interaktive botter
  • Generering av syntetisk dialog for video og spill

Vurdering av kvalitet og realism

  • MOS (Mean Opinion Score) og intelligibilitetstester
  • Kontrolling av uttrykksfullhet og prosodi
  • Sammenligning av latens, fidelitet og realism

Etiske, juridiske og styringsmessige hensyn

  • Deepfake-risikoen og ansvarlig bruk
  • Samtykke, kreditering og opphavsrettimplikasjoner
  • Regulativer og organisatoriske retningslinjer

Oppsummering og neste trinn

Krav

  • Forståelse av grunnleggende begreper i maskininlæring
  • Kjenne til lydformat og redigeringsverktøy
  • Basisferdigheter i Python-programmering

Målgruppe

  • KI-utviklere og ingeniører interessert i talesyntese
  • Innholdsprodusenter og medieteknologer som utforsker stemmegenerering
  • FoU-team som bygger personlige eller dynamiske lydsystemer
 14 Timer

Antall deltakere


Pris per deltaker

Kommende kurs

Relaterte kategorier