Ta kontakt

Kursplan

1. Introduksjon til dyp reforcelæring

  • Hva er reforcelæring?
  • Forskjellen mellom overvakt, undervakt og reforcelæring
  • Anvendelser av DRL i 2025 (robotikk, helsevesen, finans, logistikk)
  • Forståelse av agent-omgivelsesinteraksjonssyklusen

2. Grunnleggende i reforcelæring

  • Markov-besluttningsprosesser (MDP)
  • Tilstand, handling, belønning, politikk og verdifunksjoner
  • Kompromiss mellom utforskning og utnyttelse
  • Monte Carlo-metoder og Temporal-Difference (TD) læring

3. Implementering av basis-RL-algoritmer

  • Tabular metoder: Dynamisk programmering, politikkvurdering og iterasjon
  • Q-Learning og SARSA
  • Epsilon-greedy utforskning og avtagende strategier
  • Implementering av RL-omgivelser med OpenAI Gymnasium

4. Overgang til dyp reforcelæring

  • Begrensninger i tabular metoder
  • Bruk av neurale nettverk for funksjonsapproximasjon
  • Arkitektur og arbeidsflyt for Deep Q-Network (DQN)
  • Opplevelsesspill og målnettverk

5. Avanserte DRL-algoritmer

  • Double DQN, Dueling DQN og prioriteret opplevelsesspill
  • Politikkgradient-metoder: REINFORCE-algoritmen
  • Actor-Critic-arkitekturer (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Arbeid med kontinuerlige handlingsrom

  • Utfordringer i kontinuerlig styring
  • Bruk av DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Praktiske verktøy og rammeverk

  • Bruk av Stable-Baselines3 og Ray RLlib
  • Logging og overvåking med TensorBoard
  • Hyperparameterjustering for DRL-modeller

8. Belønningsingeniør og miljødesign

  • Belønningsforming og balanse av gebyrer
  • Konsepter for overføring fra simulering til virkelighet
  • Oppretting av tilpassede omgivelser i Gymnasium

9. Delvis observerbare omgivelser og generalisering

  • Håndtering av ufullstendig tilstandsinformasjon (POMDPs)
  • Minnebaserte tilnærminger ved hjelp av LSTMs og RNNs
  • Forbedring av agentens robusthet og generalisering

10. Spillteori og fleragentbasert reforcelæring

  • Introduksjon til fleragentomgivelser
  • Samarbeid vs. konkurranse
  • Anvendelser i motstandstrening og strategiøkonomisering

11. Tilfellsstudier og reelle anvendelser

  • Simuleringer av selvgående kjøring
  • Dynamisk prisfastsettelse og finansielle handelsstrategier
  • Robotikk og industriell automatisering

12. Feilsøking og optimalisering

  • Diagnostisering av ustabil trening
  • Håndtering av belønningsfattigdom og overfitting
  • Skaling av DRL-modeller på GPU-er og distribuerte systemer

13. Oppsummering og neste steg

  • Resumè av DRL-arkitektur og sentrale algoritmer
  • Bransjetrend og forskningsretninger (f.eks. RLHF, hybride modeller)
  • Ytterligere ressurser og lesestoff

Krav

  • Fagkyndighet i Python-programmering
  • Forståelse av kalkulus og lineær algebra
  • Grunnleggende kunnskap om sannsynlighets- og statistikkteori
  • Erfaring med å bygge maskinlæringsmodeller ved hjelp av Python og NumPy eller TensorFlow/PyTorch

Målgruppe

  • Utviklere som er interessert i KI og intelligente systemer
  • Datavitenskapsfolk som utforsker rammeverk for reforcelæring
  • Maskinlæringsingeniører som jobber med autonome systemer
 21 Timer

Antall deltakere


Pris per deltaker

Referanser (3)

Kommende kurs

Relaterte kategorier